GLM-5.3 dans Claude Code : mon agent codeur à 18 $/mois

Dix jours de test du Coding Plan de Z.ai : la config complète, la facture réelle, et les crédits qui fondent plus vite qu'annoncé.

Terminal Claude Code exécutant le modèle GLM-5.3 de Z.ai

Z.ai a sorti GLM-5.3 le 14 août, et le modèle vient d'atterrir sur Cloudflare Workers AI ce 28 août. Entre les deux, j'ai passé dix jours avec le Coding Plan à 12,60 $ branché sur Claude Code, sur mon vrai backlog. Si vous cherchez un agent codeur d'appoint sans exploser le budget API, voici la config complète, la facture réelle, et les deux pièges que la fiche produit ne mentionne pas.

GLM-5.3 : ce qui change face à GLM-5.2

Techniquement, GLM-5.3 n'est pas un nouveau modèle. Même base MoE que GLM-5.2 : 744 milliards de paramètres dont 40 milliards actifs par token, 1 million de tokens de contexte, 128 K en sortie. Tout le gain vient du post-training : Z.ai a multiplié les environnements de tâches longues et le budget de reinforcement learning. Résultat, un bond que je n'avais jamais vu sur une version mineure : Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, et Z.ai annonce +50 % sur son Code Bench interne (chiffres compilés par CometAPI).

Précision qui compte : ces scores sortent des labos de Z.ai, personne ne les a reproduits en conditions unifiées. Mais l'ordre de grandeur colle avec ce que j'ai observé. Quand on avait comparé GLM-5.2 à GPT-5.5 sur le code agentique, le modèle chinois calait précisément sur les tâches longues en terminal. Ce verrou-là a sauté.

Autre nouveauté, moins réjouissante : le thinking est permanent. Impossible de le couper, on règle seulement l'effort (low, high, max). J'y reviens, parce que c'est ce paramètre qui décide de votre facture.

Combien coûte GLM-5.3 : les tarifs réels du Coding Plan

L'API classique n'a toujours pas de grille tarifaire au 29 août — Z.ai affiche « coming soon ». En attendant, deux portes d'entrée :

  • GLM Coding Plan : Lite à 12,60 $/mois en promo de lancement (18 $ au tarif normal), Pro à 56 $ (80 $ ensuite), Max au-dessus. Le Lite donne 2 000 crédits par fenêtre glissante de 5 heures, plafonnés à 10 000 par semaine — soit entre 43 et 87 millions de tokens selon votre taux de cache (le détail des quotas chez Atoms).
  • Cloudflare Workers AI : GLM-5.3 y est déployé depuis le 28 août à 1,40 $ le million de tokens d'entrée (changelog Cloudflare), sur la grille du flagship précédent. Pratique pour de l'appel ponctuel sans abonnement.

Pour situer : 12,60 $ par mois pour un agent qui tient des sessions de trois heures, aucun acteur américain ne s'en approche. La contrepartie, c'est le système de crédits — et il faut le comprendre avant de signer, parce que le compteur descend d'autant plus vite que le thinking mouline.

Brancher GLM-5.3 dans Claude Code : la config en 10 minutes

Z.ai expose un endpoint compatible avec l'API de Claude. Claude Code ne voit pas la différence. La marche à suivre :

  1. Souscrire le Coding Plan sur z.ai et générer une clé API dans le dashboard.
  2. Éditer ~/.claude/settings.json pour rediriger Claude Code vers Z.ai :
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "votre-cle-zai",
    "ANTHROPIC_MODEL": "glm-5.3"
  }
}

Relancez claude, tapez /status : si le modèle affiché est glm-5.3, c'est branché. Dix minutes chrono, paiement compris. Pour valider, j'ai lancé une tâche calibrée : ajouter un endpoint d'export CSV sur l'API du CRM que je maintiens, avec ses tests. Dix-huit minutes, tests verts du premier coup, 210 crédits consommés. Bon début.

Revenir à Claude en une commande

Le bloc env n'écrase rien : supprimez-le (ou commentez les trois lignes) et Claude Code repart sur votre compte Anthropic. Je garde deux fichiers de settings et un alias shell pour basculer. Aucun lock-in, c'est l'intérêt du format.

reasoning_effort : le réglage qui a fondu mes crédits

Ma première soirée a mal tourné. Effort par défaut : max. J'ai demandé un renommage de composant React — une tâche à deux minutes pour Sonnet 5. GLM-5.3 a réfléchi. Beaucoup. Résultat correct, mais 25 minutes au compteur, et au bilan de la session : 1 400 crédits engloutis sur les 2 000 de la fenêtre de 5 heures. À ce rythme, le plan Lite ne tient pas la semaine d'un dev à temps plein.

Le paramètre se passe dans le corps de requête ("reasoning_effort": "low"), mais Claude Code ne l'expose pas nativement. Mon contournement : OpenCode, qui accepte les options provider dans son fichier de config, prend les petites tâches en effort low ; Claude Code garde les tâches de fond en max. Si vous hésitez entre les deux harnais, notre comparatif OpenCode / Claude Code pose le décor.

GLM-5.3 vs Sonnet 5 vs GPT-5.6 Sol : mes mesures sur un vrai backlog

J'ai rejoué 14 tâches réelles de mon backlog : migrations, endpoints, refactos, tests. Bilan : 11 bouclées sans moi, 2 reprises à la main, 1 abandon — une migration de schéma où le modèle a tourné en rond 25 minutes avant que je coupe. Sonnet 5, mon quotidien, garde l'avantage sur l'architecture et les décisions ambiguës. Mais sur l'exécution outillée — lancer les tests, lire les erreurs, corriger, relancer — GLM-5.3 tient la distance, ce que GLM-5.2 ne faisait pas.

Les benchmarks publics racontent la même chose : 28,3 sur Terminal-Bench 3.0 contre 34,6 pour GPT-5.6 Sol et 33,7 pour Claude Fable 5 ; 28,5 sur Agents' Last Exam (CLI) contre 28,6 pour Sol — écart symbolique. Et sur CyberGym, GLM-5.3 passe même devant avec 84,5 % contre 83,8 % pour Claude Mythos. Détail piquant : les deux modèles qui le dominent sont précisément ceux dont l'accès se complique pour les boîtes françaises depuis que Washington a mis GPT-5.6 Sol sous clé. Un modèle à 90 % du niveau, accessible sans conditions et 5 à 10 fois moins cher, ce n'est plus un lot de consolation.

Open weights fantômes et données en Chine : les deux angles morts

Z.ai avait promis les poids ouverts « environ deux semaines » après le lancement du 14 août. La fiche Hugging Face zai-org/GLM-5.3 affichait le 28 août comme date de publication. Le 28 est passé : rien, et aucune nouvelle date.

Deuxième angle mort : la donnée. L'API Z.ai traite vos prompts hors Union européenne, chez un acteur chinois. Pour du code open source ou un side-project, à vous de voir ; pour du code métier avec données clients, c'est non — même logique que celle qu'on détaillait dans notre guide Cloud Act, AI Act : où poser votre IA. Le passage par Workers AI déplace le sujet (infra Cloudflare, droit américain) sans le régler. Et pour un panorama des open-weights réellement téléchargeables en PME, notre comparatif Kimi K3 / DeepSeek V4 / GLM-5.2 reste d'actualité.

Faut-il adopter GLM-5.3 dans Claude Code ?

Mon verdict après dix jours : GLM-5.3 est devenu mon second modèle, pas mon premier. Les tâches d'exécution — tests, migrations simples, endpoints, corvées de refacto — partent chez Z.ai pour 12,60 $ par mois. L'architecture, les bugs vicieux et tout ce qui touche aux données clients restent sur Sonnet 5. La config se fait en dix minutes et se défait aussi vite : le coût d'essai est quasi nul, c'est rare.

Qui devrait s'abstenir : ceux qui traitent des données personnelles (API hors UE), ceux qui ont besoin de vision (GLM-5.3 est texte seul), et ceux qui attendaient les poids ouverts — ils n'existent toujours pas. Pour les autres, dev solo ou petite équipe qui regarde sa facture API tous les mois : prenez le Lite en promo, réglez l'effort sur low, et faites tourner vos propres tâches dessus avant la fin du mois de promo. C'est le seul benchmark qui compte.

FAQ

GLM-5.3 est-il gratuit ?
Non. L'accès passe par le GLM Coding Plan (Lite à 12,60 $/mois en promo, 18 $ ensuite ; Pro à 56 $, puis 80 $) ou par Cloudflare Workers AI à 1,40 $ le million de tokens d'entrée. Les poids ouverts, annoncés pour fin août, n'étaient toujours pas publiés au 29 août 2026. L'API directe Z.ai n'a pas encore de grille tarifaire.
GLM-5.3 fonctionne-t-il avec Claude Code ?
Oui. Z.ai expose un endpoint compatible avec l'API Anthropic : trois variables d'environnement dans ~/.claude/settings.json (ANTHROPIC_BASE_URL, ANTHROPIC_AUTH_TOKEN, ANTHROPIC_MODEL) suffisent pour que Claude Code utilise GLM-5.3. La bascule est réversible en supprimant le bloc. OpenCode et Cline sont aussi supportés.
Quelle différence entre GLM-5.3 et GLM-5.2 ?
Même base (744 Md de paramètres MoE, 1 M de contexte), mais un post-training massivement renforcé sur les tâches agentiques longues. Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9. En pratique, GLM-5.3 tient des sessions outillées de plusieurs heures là où GLM-5.2 décrochait. Contrepartie : le thinking est permanent et consomme des crédits.
Peut-on utiliser GLM-5.3 avec des données clients (RGPD) ?
Déconseillé en l'état : l'API Z.ai traite les prompts hors Union européenne. Réservez-le au code sans données personnelles, ou attendez la publication des poids ouverts pour un déploiement self-hosted. Le passage par Cloudflare Workers AI reste soumis au droit américain (Cloud Act), ce qui ne règle pas la question souveraineté.
GLM-5.3 vaut-il le coup face à Claude Sonnet 5 ?
Comme second modèle, oui. Sur mes 14 tâches de test, il en a bouclé 11 en autonomie, à environ un dixième du coût. Sonnet 5 reste devant sur l'architecture, les bugs complexes et tout ce qui demande du jugement. Le duo — GLM-5.3 pour l'exécution, Sonnet 5 pour la décision — est la combinaison la plus rentable que j'aie testée cette année.
Partager
Résumé vidéoen cours…