J'ai monté un agent Gemini en tâche de fond, gratuit : le tuto
Depuis le 7 juillet, la Gemini API fait tourner des agents async, avec MCP distant, sur le free tier.
Depuis le 7 juillet 2026, la Gemini API laisse tourner un agent en tâche de fond : pas de connexion HTTP à garder ouverte, pas de serveur à vous, et zéro euro tant que vous restez dans les quotas du free tier. J'ai passé une soirée à monter le mien — un agent de veille qui me compile un digest concurrentiel chaque nuit et le pousse dans ma base via un serveur MCP maison. Voici le pas-à-pas, le code, le coût réel, et les deux pièges qui m'ont mangé une heure.
Si vous connaissez déjà les agents managés côté Anthropic, on avait décortiqué leur pricing dans Anthropic Managed Agents : vos agents IA en prod pour 0,08 $/h. Ce que Google vient de sortir joue dans la même cour, mais avec une entrée gratuite.
Ce que Google a débloqué le 7 juillet 2026
L'annonce est passée assez discrètement sur le blog Google, relayée par Logan Kilpatrick. Quatre nouveautés, une conséquence.
- Exécution en tâche de fond : vous passez
background: true, l'API renvoie immédiatement un identifiant d'interaction. Vous pollez ce statut, vous streamez la progression, ou vous vous déconnectez et revenez quand le job est fini. Google résume bien le problème qu'ils règlent : garder une connexion ouverte pour un travail long, « c'est fragile ». - Serveurs MCP distants : l'agent peut appeler vos endpoints (base de données interne, API métier, serveur d'observabilité) sans middleware maison. Vous attachez un outil
mcp_serverau moment de l'interaction, à côté de Google Search ou de l'exécution de code. - Function calling personnalisé : vos fonctions tournent côté client pendant que les outils intégrés (recherche, sandbox) s'exécutent côté serveur. Google appelle ça du « step matching ».
- Refresh des credentials : vous repassez un ID d'environnement existant avec une nouvelle config réseau, les nouvelles règles remplacent les anciennes immédiatement, et l'état du filesystem est préservé.
La conséquence, c'est la ligne que tout le monde a ratée : on peut désormais démarrer avec les Managed Agents via le free tier. Traduction : un agent qui bosse tout seul, connecté à vos outils, sans carte bleue.
Ce qu'il vous faut avant de commencer
Rien d'exotique. J'ai monté le mien en une trentaine de minutes, prérequis compris.
- Une clé API Gemini, générée gratuitement dans Google AI Studio. Depuis avril 2026, seuls les modèles Flash et Flash-Lite restent sur le free tier — mais c'est exactement ce qu'on veut ici.
- Le SDK
google-genai(Python) ou@google/genai(JavaScript). Un simplecurlsuffit aussi pour tester. - Un serveur MCP accessible en HTTP si vous voulez brancher vos données. Si vous n'en avez pas encore, on a couvert le protocole dans MCP : le protocole qui connecte l'IA à vos outils métier.
Étape 1 — Créer l'agent managé
Un agent managé se crée une fois, puis se réutilise. L'appel part sur l'endpoint /v1beta/agents. Voici la version curl minimale :
curl -X POST "https://generativelanguage.googleapis.com/v1beta/agents" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"id": "veille-concurrence",
"base_agent": "antigravity-preview-05-2026",
"agent_config": {"type": "antigravity", "model": "gemini-3.6-flash"},
"system_instruction": "Tu es analyste veille. Tu produis un digest factuel, sourcé, en 8 lignes max.",
"base_environment": {"type": "remote", "sources": []}
}'Quelques champs qui comptent :
id: votre identifiant. Il ne peut pas commencer par un préfixe réservé (gemini-,google-,antigravity-). C'est mon premier piège — j'avais nommé le miengemini-veille, rejet direct. Renommez.base_agent: pour l'instant, une seule valeur acceptée,antigravity-preview-05-2026.agent_config.model:gemini-3.6-flashpar défaut, ougemini-3.5-flash/gemini-3.5-flash-lite. Le modèle ne peut pas être surchargé au moment de l'interaction pour un agent nommé — vous le figez ici.
Comment brancher un serveur MCP distant sur Gemini
C'est là que ça devient intéressant pour une PME. Au lieu de laisser l'agent halluciner sur vos données, vous lui donnez un accès contrôlé à votre API via MCP. L'outil mcp_server s'attache au moment de l'interaction, pas à la création :
from google import genai
client = genai.Client()
result = client.interactions.create(
agent="veille-concurrence",
input="Compare les prix affichés hier et aujourd'hui, signale tout écart > 5 %.",
tools=[{
"type": "mcp_server",
"url": "https://mcp.mondomaine.fr/pricing",
"auth": {"token": TOKEN_MCP}
}],
background=True
)
print(result.interaction_id)L'agent interroge votre endpoint depuis son sandbox sécurisé. Vos données ne transitent pas par un proxy maison, et vous gardez la main sur ce que le serveur MCP expose. Détail de la mécanique côté doc officielle Gemini API.
Étape 2 — Le lancer en tâche de fond
Le background=True ci-dessus change tout. L'appel ne bloque pas. Vous récupérez un interaction_id, vous coupez, et vous revenez le poller quand vous voulez. Concrètement, mon cron lance l'agent à 3 h du matin et un second job relit le résultat à 3 h 05 :
status = client.interactions.get(interaction_id)
if status.state == "COMPLETED":
push_to_notion(status.output_text)
elif status.state == "RUNNING":
# on repasse au prochain tick
passC'est le vrai déblocage par rapport à l'ancien mode synchrone : un digest qui scanne dix sources et croise ma base peut prendre 90 secondes. Avant, il fallait tenir la connexion ouverte tout du long, avec le risque de timeout côté serverless. Maintenant, l'agent bosse dans son coin.
Combien coûte un agent Gemini en tâche de fond ?
La question que tout dirigeant pose en premier. Réponse en trois temps.
Sur le free tier : 0 €. Flash et Flash-Lite restent gratuits dans les quotas d'AI Studio, sans carte bleue. Pour un agent de veille qui tourne une fois par nuit, on reste largement sous les plafonds.
Au-delà du free tier, on bascule sur la tarification Gemini 3.5 Flash : environ 1,50 $ le million de tokens en entrée, 9 $ en sortie, 0,15 $ pour l'input mis en cache. Mon run type avale ~30 000 tokens en entrée (les pages récupérées via MCP) et crache ~5 000 tokens de digest. Le calcul : 0,045 $ d'entrée + 0,045 $ de sortie, soit ~9 centimes par run. En quotidien, ça fait 2,70 $ par mois. Pour une veille concurrentielle qui tourne seule, c'est ridicule.
Le piège caché, comme toujours avec les agents : les tokens de « thinking » et les allers-retours d'outils que vous ne voyez pas dans le prompt. Un agent qui appelle Google Search puis votre MCP puis raisonne va consommer plus qu'un simple appel. Surveillez le compteur les premiers jours avant de laisser tourner à l'aveugle. On avait détaillé ce mécanisme dans nos guides sur le coût réel des tokens.
Gemini Managed Agents ou Make/n8n : quand choisir quoi
Ne montez pas ça si vous n'avez pas à le monter. La règle que je m'applique :
- Vous ne codez pas, votre workflow est linéaire (déclencheur → action → notification) : restez sur du no-code. Make ou n8n font ça très bien, avec une interface visuelle et des connecteurs prêts. C'est plus rapide à maintenir pour une équipe non technique.
- Vous avez besoin d'un vrai raisonnement — l'agent doit décider quelles sources croiser, quand s'arrêter, quoi remonter — et d'un accès à vos données internes via MCP : les Managed Agents Gemini deviennent pertinents. Vous gagnez le sandbox, le background async et la facturation au token.
En pratique, je combine les deux : Make orchestre le déclencheur et la distribution (Slack, mail, Notion), et l'agent Gemini fait le travail de réflexion au milieu. Le no-code gère la plomberie, l'agent gère l'intelligence.
Ce qui m'a fait galérer
Deux trucs, au-delà du préfixe réservé.
Le token MCP qui expire en plein run. Mon serveur MCP émet des jetons courts (15 min). Sur un job long lancé en background, le token a expiré pendant l'exécution, et l'agent s'est planté sur l'appel outil sans message clair. C'est exactement ce que le credential refresh résout : je repasse l'ID d'environnement avec une nouvelle config réseau, les règles se remplacent à chaud, l'état du filesystem est conservé. Il faut juste penser à le câbler dès le départ, pas après le premier crash comme moi.
Les quotas free tier qui mordent. J'ai voulu tester en enchaînant vingt runs à la suite pour valider le pipeline. Le free tier a serré la vis au bout d'une dizaine d'appels rapprochés. Ce n'est pas fait pour du volume — c'est fait pour prototyper et pour du rythme « une fois par nuit ». Si vous industrialisez, basculez sur le tier payant, sinon vous prenez des 429 au pire moment.
Mon verdict
Pour un dev ou un profil technique en PME, c'est le moyen le plus propre aujourd'hui de faire tourner un agent connecté à vos données, sans infra et sans budget de départ. Le MCP distant est la vraie bonne nouvelle : vous branchez votre métier sans exposer votre base à l'extérieur. Le background async règle le problème des jobs longs sur serverless.
Ce n'est pas pour tout le monde. Si personne chez vous n'écrit une ligne de Python, restez sur Make ou n8n, vous irez plus vite et la maintenance sera saine. Et ne rêvez pas sur Flash : pour du raisonnement lourd, vous voudrez un modèle plus costaud, donc payant. Mais pour une veille, un tri d'entrées, un enrichissement nocturne de CRM branché sur vos données — montez-le ce week-end, ça vous coûte une soirée et zéro euro.