Ploy.ai a migré son agent de production de GPT-5 vers GPT-5.6. Résultat mesuré sur 10 000 tâches réelles : latence divisée par 2,2 et facture API réduite de 27 %. L'agent tourne maintenant à 4,8 secondes par tâche contre 10,6 secondes avant migration.
Le calcul unit economics tient : GPT-5.6 coûte 2,50 dollars par million de tokens input (vs 3 dollars pour GPT-5), mais génère des réponses plus courtes grâce à son fine-tuning sur des tâches structurées. Résultat net : économie de 1 200 dollars par mois pour Ploy.ai qui traite environ 300 000 tâches mensuelles.
Les chiffres
Le benchmark publié par Ploy détaille les métriques avant/après sur un échantillon représentatif :
- Latence moyenne : 10,6 secondes (GPT-5) → 4,8 secondes (GPT-5.6)
- Coût par tâche : 0,0053 dollar (GPT-5) → 0,0039 dollar (GPT-5.6)
- Tokens output moyens : 420 (GPT-5) → 310 (GPT-5.6)
- Taux de réussite : 94,2 % (GPT-5) → 95,1 % (GPT-5.6)
L'amélioration de latence vient de deux sources : réduction de la longueur de génération (-26 % de tokens output) et optimisation d'inférence côté OpenAI. GPT-5.6 a été spécifiquement entraîné pour produire des réponses plus concises sur des tâches agents (tool calling, structured output).
Pour Ploy, qui tourne à 300 000 tâches par mois, ça représente une économie mensuelle de 1 200 dollars (0,0053 - 0,0039 × 300 000). Sur un an : 14 400 dollars récupérés sans aucune régression de qualité.
Le calcul
Tarification OpenAI (juin 2026) :
- GPT-5 : 3 dollars/M tokens input, 15 dollars/M output
- GPT-5.6 : 2,50 dollars/M input, 12,50 dollars/M output
Scénario type : agent qui traite 1 000 tâches/jour, contexte moyen 1 500 tokens input, 400 tokens output.
GPT-5 :
- Input : 1 000 × 1 500 = 1,5 M tokens → 4,50 dollars/jour
- Output : 1 000 × 400 = 400 000 tokens → 6 dollars/jour
- Total : 10,50 dollars/jour, soit 315 dollars/mois
GPT-5.6 (avec -26 % output observé) :
- Input : 1 000 × 1 500 = 1,5 M tokens → 3,75 dollars/jour
- Output : 1 000 × 296 = 296 000 tokens → 3,70 dollars/jour
- Total : 7,45 dollars/jour, soit 224 dollars/mois
Économie mensuelle : 91 dollars (-29 %). La latence divisée par 2 est gratuite — aucun coût d'infrastructure supplémentaire.
Ce que ça révèle
OpenAI a compris que les agents de production tournent à des millions de tâches par mois et que chaque milliseconde de latence et chaque cent de coût comptent. GPT-5.6 n'est pas un modèle « meilleur » au sens benchmark — c'est un modèle optimisé pour les marges d'exploitation des entreprises qui déploient des agents à l'échelle.
Le précédent qui confirme la stratégie : Anthropic avec Haiku 4 (lancé mars 2026) a gagné 23 % de parts de marché agents en trois mois grâce à son ratio latence/coût imbattable. OpenAI réplique avec GPT-5.6, qui vise exactement le même segment : agents structurés, tool calling intensif, déploiements high-volume.
Les labos IA ne se battent plus sur MMLU ou HumanEval. Ils se battent sur le coût par tâche terminée dans des pipelines agents réels. Et les utilisateurs comme Ploy migrent dès que l'économie tient.
À surveiller
- Claude Sonnet 4.8 : Anthropic prépare une riposte au tarif GPT-5.6. Sortie attendue Q3 2026.
- Part de marché GPT-5.6 : surveiller les rapports d'adoption sur les 6 prochains mois. Si 30 % des agents en production migrent d'ici septembre, OpenAI aura gagné son pari.
- Fine-tuning agents : OpenAI pourrait ouvrir le fine-tuning de GPT-5.6 sur des datasets privés pour aller chercher encore -10 à -15 % de coût chez les gros clients (comme il l'a fait avec GPT-4 Turbo début 2025).
L'essentiel
Ploy.ai a migré son agent vers GPT-5.6 : latence divisée par 2,2, coût réduit de 27 %, soit 1 200 dollars économisés par mois sur 300 000 tâches. Les modèles IA ne se battent plus sur les benchmarks académiques mais sur les marges d'exploitation des agents en production.
Newsletter
Cet article t'a intéressé ? Reçois les suivants.
Chaque matin à 8h, les chiffres qui comptent. Gratuit, sans spam.


