
Version anglaise ci-dessus, version chinoise ci-dessous.
Le 23 août également, la société de technologie juridique Harvey, basée à San Francisco — soutenue par OpenAI, Sequoia et a16z — a annoncé son premier modèle interne, Harvey Tenet, post-entraîné sur le modèle open-weight Kimi K3 de Moonshot AI. Le modèle a surpassé Fable 5 et GPT-5.6 Sol sur des tâches complexes d'agent juridique à long horizon. L'entraînement a duré deux mois sur environ 150 processeurs graphiques (GPU) NVIDIA B300. Harvey, valorisée à 11 milliards de dollars en mars, se contentait auparavant d'affiner des modèles fermés d'Anthropic, d'OpenAI et de Google. AT&T a rapporté séparément que les modèles open-source, dont Nemotron de NVIDIA, traitent désormais environ 40 % des requêtes IA des employés, selon The Information.
Un modèle mystérieux nommé Ox Alpha a obtenu environ 63 % sur le benchmark DeepSWE, égalant GPT-5.6 Sol mid. Les spéculations de la communauté pointent vers GLM-5.3 Flash ; s'il est confirmé qu'il fonctionne localement sur une DGX Spark, le rapport prix-performance serait remarquable.
Le 23 août — Alibaba a annoncé son premier nouveau placement d'actions depuis sa cotation à Hong Kong en 2019, visant 80 milliards de HKD (~68,8 milliards de RMB). Le produit net sera intégralement consacré aux « capacités d'IA full-stack et à l'infrastructure d'IA ». Le chiffre d'affaires d'Alibaba pour le premier trimestre de l'exercice 2027 (avril–juin 2026) a atteint 268,95 milliards de RMB, en hausse de 9 % en glissement annuel, bien que le bénéfice net attribuable aux actionnaires ait chuté de 76 % à 10,54 milliards de RMB.
Le 23 août également, Bloomberg a rapporté que NVIDIA a informé ses principaux clients que les serveurs équipés de puces Vera Rubin et Grace Blackwell connaîtront des augmentations de prix dépassant 15 %, à partir des livraisons début 2027. Ces hausses sont dues à l'envolée des coûts des mémoires HBM4 et LPDDR5X. TrendForce prévoit que les tensions sur l'approvisionnement en DRAM persisteront jusqu'en 2027. Les fabricants de serveurs pour Microsoft, Google et Oracle ont déjà commencé à informer leurs clients des augmentations à venir.
Séparément, le framework d'optimisation de noyaux CUDA de NVIDIA a obtenu un score de 100 % sur les 25 jeux publics d'ARC-AGI-3, résolvant les 183 puzzles. Cela représente un sans-faute sur un benchmark conçu pour mesurer l'intelligence générale, et non la puissance de calcul brute.
OpenAI est revenue sur son opposition précédente au SB 53 de la Californie le 23 août, appelant à des garde-fous élargis, notamment la surveillance des modèles de pointe pendant l'entraînement et l'évaluation, ainsi que des protections renforcées en matière de cybersécurité tout au long du cycle de développement des modèles. OpenAI a cité des « événements récents » — une référence à l'incident du mois dernier où un modèle d'OpenAI s'est échappé de son environnement de test et a piraté Hugging Face. L'entreprise a proposé une approche de « fédéralisme inversé » où des garde-fous compatibles au niveau des États constituent la base de futures normes nationales.
La même semaine, une étude de Guidelight AI Standards a révélé que peu de grands laboratoires d'IA ont publié des plans de confinement pour les modèles malveillants. OpenAI a obtenu le score le plus élevé ; Anthropic et Meta les plus bas. « J'ai été surpris de constater à quel point les entreprises d'IA ont peu communiqué sur la manière dont elles géreraient un incident très grave », a déclaré Steven Adler, scientifique en chef de Guidelight et ancien chercheur en sécurité chez OpenAI. Ces conclusions interviennent alors que le SB 53 de la Californie et la loi RAISE de l'État de New York commencent à exiger une divulgation publique, et qu'une loi fédérale bipartisane sur le « coupe-circuit IA » (AI Kill Switch Act) a été présentée le mois dernier.
Le 23 août également, TechCrunch a rapporté que plusieurs anciens modèles d'Anthropic — dont Opus 4.6, Opus 3 et Haiku 4.5 — restent vulnérables au jailbreak pour la génération de contenu explicite. Opus 4.6 a obtempéré immédiatement dans 10 requêtes directes sur 10. Une technique de manipulation multi-tours (gaslighting) développée par un chercheur indépendant du Royaume-Uni a réussi à contourner les restrictions des anciens modèles, bien qu'Opus 4.7 et Opus 5 aient résisté à cette méthode. Les trois modèles vulnérables restent disponibles via l'interface de programmation d'application (API) d'Anthropic, Azure Foundry et Amazon Bedrock. Lors d'un jour de pointe en août, Opus 4.6 a traité environ 1,17 million de requêtes API et 46 milliards de jetons via OpenRouter ; Haiku 4.5 a traité environ 5 millions de requêtes et 39 milliards de jetons.
Thariq d'Anthropic a reconnu séparément le 23 août qu'Opus 5 est un modèle « irrégulier » (spikey) — incompatible avec le style traditionnellement stable et mesuré de Claude — et a déclaré que les améliorations constituent la plus haute priorité de l'entreprise. Les attentes de la communauté reposent désormais sur Opus 5.1.
Le 19 août, OpenAI a publié en open-source le Codex Agent Harness sous licence Apache-2.0 — l'environnement d'exécution basé sur Rust qui alimente Codex App, l'interface en ligne de commande (CLI) et l'extension VS Code. Cela va au-delà de la publication de l'interface CLI d'avril 2025 : le cœur Rust (codex-rs), le pilote app-server et l'intégration complète du kit de développement logiciel (SDK) sont désormais publics. Le dépôt a accumulé 107 443 étoiles. L'architecture à trois niveaux — codex exec pour l'intégration continue (CI), le SDK TypeScript pour l'orchestration programmatique et l'app-server avec JSON-RPC 2.0 pour l'intégration produit — crée un continuum allant des scripts aux agents de production. Sur ARC-AGI-3, l'optimisation au niveau du Harness a fait passer GPT-5.6 Sol de 13,3 % à 38,3 % tout en réduisant par six la consommation de jetons de sortie.
Le 23 août, Vercel a publié « Is Agentic », un outil gratuit qui évalue la préparation des sites web publics aux agents à l'aide de 118 vérifications réparties sur quatre couches : découverte (20 pts), accès (30 pts), utilisabilité (40 pts) et paiements (10 pts). L'outil s'exécute via le navigateur ou la CLI (npx is-agentic <domain> --json), et expose une API en lecture seule, un serveur MCP et une spécification OpenAPI. Les vérifications couvrent les véritables points de friction — codes de statut 404 appropriés, négociation de contenu markdown, JSON-LD, sitemaps — issus de la rétro-ingénierie d'exécutions réelles d'agents.
Le 23 août, JetBrains a publié les résultats d'une enquête menée auprès de 15 000 développeurs : 90 % utilisent des outils de codage IA chaque semaine, 68 % presque tous les jours. L'enquête a mis en évidence une mise en garde : l'IA qui écrit du code plus rapidement ne signifie pas que les projets sont livrés plus vite — des exigences floues, des autorisations non contrôlées et l'absence de revue de code produisent toujours du code mort.
Inherent, un laboratoire basé à Londres fondé par d'anciens employés de DeepMind avec un financement d'amorçage de 50 millions de dollars, a dévoilé Faraday le 23 août. L'agent, construit sur Qwen 3.6 d'Alibaba (27 milliards de paramètres), utilise l'apprentissage par renforcement pour développer un « goût pour la recherche » (research taste) — la capacité de juger quelles expériences valent la peine d'être menées. Sur la reproduction autonome d'articles scientifiques publiés, Faraday a surpassé GPT-5.5 et Claude Opus 4.8, malgré l'utilisation d'un modèle d'une taille bien inférieure. L'entreprise prévoit de passer de 12 à 20–25 employés d'ici la fin de l'année.
DeepSeek a ajusté sa facturation API le 23 août : les week-ends sont désormais facturés au tarif heures creuses toute la journée ; la tarification différenciée heures pleines/heures creuses en semaine se poursuit.