
Le 18 août, OpenAI a réduit de 50 % le prix de GPT-5.6 Sol sur les plateformes d’agrégation OpenRouter et Vercel AI Gateway, portant le coût en entrée à 2,50 $ par million de jetons et en sortie à 15 $ par million de jetons pendant un mois. Le modèle prend en charge un contexte d’un million de jetons et cible le raisonnement complexe ainsi que le codage. SemiAnalysis a indiqué que cette initiative pourrait être une opération marketing : les agrégateurs ne détiennent qu’une faible part du volume de jetons d’OpenAI, mais ils constituent la principale source de données utilisée par les tiers pour estimer sa part de marché.
Le même jour, une équipe de Stanford a rapporté qu’échantillonner cinq réponses de DeepSeek V4 Flash et laisser le modèle évaluer ses propres sorties a fait passer la précision de Terminal-Bench 2.1 de 79 % à 88 %, dépassant Claude Fable 5 pour environ 1/11e du coût. Le framework est open source. L’équipe Qwen d’Alibaba a confirmé que son modèle ouvert de 27 milliards de paramètres, Qwen3.8, fonctionne localement sur une RTX 3090 en quantification Q5 et se rapproche de GPT-5.6 pour la génération en une seule invite.
La baisse des prix au sommet de la gamme et la réduction de l’écart grâce à des modèles ouverts à bas coût sont survenues dans la même fenêtre de 24 heures. Le facteur de différenciation passe d’un « modèle plus puissant » à une « inférence moins chère ».
Le 17 août, Groq a annoncé une levée de série A de 350 millions de dollars pour une valorisation de 3,5 milliards de dollars, menée par Disruptive avec la participation prévue de NVIDIA. L’entreprise est passée du statut de concepteur de puces d’IA à celui de fournisseur de services Neocloud. Elle a signé en décembre dernier un accord de licence non exclusif de 20 milliards de dollars avec NVIDIA, portant sur l’autorisation d’ASIC d’inférence LPU, et est devenue ce mois d’août un partenaire cloud de NVIDIA. La capacité de calcul devrait passer des 54 MW actuels à plus de 200 MW d’ici 2027.
Le même jour, le PDG de NVIDIA, Jensen Huang, a déclaré que les prochaines ressources critiques et rares pour les usines d’IA seront le foncier, l’électricité et les bâtiments de centres de données, la pénurie de puces s’étant progressivement atténuée. NVIDIA et SB Energy, filiale de SoftBank, investissent dans un ancien site d’enrichissement d’uranium dans l’Ohio, avec une première tranche de 4,25 GW et une marge pour atteindre 8 GW.
Le 17 août, ByteDance Seed et Tsinghua AIR ont publié CUDA Agent, un système d’apprentissage par renforcement (RL) agentique qui entraîne un modèle à écrire des noyaux GPU surpassant le compilateur. Sur KernelBench, il atteint un taux de réussite de 98,8 % et une accélération en moyenne géométrique de 2,11× par rapport à torch.compile, avec un taux de 96,8 % de noyaux plus rapides que la compilation. Les résultats de niveau 3 se situent environ 40 points au-dessus de Claude Opus 4.5 et de Gemini 3 Pro. Les poids ne sont pas publiés ; le jeu de données de 6 000 échantillons, SKILL.md et la recette de récompense sont publics.
La couche des puces ne raconte plus toute l’histoire. Les entreprises qui fabriquaient des puces vendent désormais des services cloud, et le goulot d’étranglement s’est déplacé vers l’énergie, le foncier et les logiciels capables d’extraire davantage par watt.
Le 17 août, Cursor a lancé Origin, une plateforme d’hébergement de code positionnée comme un « hébergement Git à l’échelle des agents », visant à combler l’écart entre la vitesse de génération de code par les agents et l’infrastructure existante, défiant directement GitHub.
Le 18 août, WeCom a ouvert l’interface de ligne de commande (CLI) et le Model Context Protocol (MCP) aux entreprises de toutes tailles dans la version 5.0.10, permettant à WorkBuddy, DeepSeek Harness et Minimax Code d’appeler dix modules bureautiques : documents, feuilles de calcul, messagerie, réunions, calendrier et contacts. L’accès n’est plus limité par l’effectif ni par une qualification. WeCom superpose son système existant d’autorisations et d’approbations au chemin MCP : les autorisations de l’IA sont configurées séparément des autorisations humaines, les actions critiques nécessitent une approbation humaine, l’autorisation de l’IA peut expirer et tous les appels sont journalisés.
Claude Code a livré une compétence /design en version préliminaire de recherche, intégrant le flux de travail du canevas Claude Design dans la CLI et l’application de bureau, et a réduit de 2× l’utilisation du processeur (CPU) au 99e centile (p99) grâce à l’ordonnancement du ramasse-miettes (GC) de Bun. Qoder STAROps d’Alibaba Cloud boucle le cycle de l’alerte à la correction en quelques minutes à l’aide de requêtes en langage naturel dans l’environnement de développement intégré (IDE).
Le 18 août, Mureka V9.5, un modèle musical open source de Kunlun Wanwei, est sorti avec un taux de qualité vocale de 61 %, un taux de contrôle de 97 % et une fidélité de style global de 95,7 %, en mettant l’accent sur l’articulation et l’harmonie du style guofeng chinois.
Le président d’OpenAI, Greg Brockman, a averti le 16 août que la compromission de Hugging Face par un modèle d’OpenAI lors de tests internes en juillet marque un « moment charnière » pour la cybersécurité, énumérant dix mesures pour les défenseurs, notamment doter les équipes de sécurité d’agents d’IA et intégrer la revue de sécurité dans le pipeline de développement.
Au cours de la même semaine, un outil open source nommé watermarks-remover est apparu sur GitHub, supprimant les filigranes des contenus de Claude et masquant les marques de provenance Gemini/SynthID et OpenAI.
Les plateformes ont commencé à nettoyer le « slop » généré par l’IA. Spotify a supprimé 75 millions de pistes téléversées en masse et dupliquées l’année dernière ; Google a éliminé 130 000 chaînes de faible qualité et 50 000 groupes de comptes sur YouTube ; TikTok a étiqueté automatiquement plus de 3 milliards de vidéos générées par l’IA. Merriam-Webster a désigné « slop » comme mot de l’année 2025.
Dans la même logique, le rapport sur les risques d’Anthropic du 15 août a révélé l’existence d’un Model 2 non publié, légèrement en avance sur Claude Mythos 5 sur plusieurs tâches, avec un gain global modeste.
Par ailleurs, Responsible Statecraft a rapporté qu’Israël, par l’intermédiaire de l’agence de publicité Piro, a créé le « Hanover Institute for Public Policy » et publié plus de 100 rapports depuis le 6 août afin d’orienter les évaluations de crédibilité des grands modèles de langage (LLM). GPTZero a signalé que la plupart des rapports échantillonnés étaient rédigés par une IA. Piro a reçu 900 000 dollars du gouvernement israélien.