
Le 13 août, OpenAI et Cerebras ont lancé le mode Ultrafast, un niveau de service reposant sur le Wafer-Scale Engine de Cerebras, exécutant GPT-5.6 Sol jusqu'à 750 jetons de sortie par seconde. Cerebras indique que ce mode est 11 fois plus rapide que Fable 5 et 5 fois plus rapide que Opus 4.8 en mode Fast, sans dégradation de la qualité. Sur Humanity's Last Exam, un benchmark de 2 500 questions auquel seuls des spécialistes de niveau doctorat peuvent répondre, Ultrafast a terminé en 11 heures et 11 minutes, alors que Claude Fable 5 a eu besoin de 78 heures et 27 minutes. Sur GDP-Val, un benchmark dédié aux travaux de connaissance à valeur économique, Ultrafast a apporté une accélération de bout en bout de 5,6 fois. Le service est d'abord disponible dans l'API OpenAI pour un groupe restreint de clients.
Le 13 août, Google a publié Gemini 3.7 Flash, destiné aux cas d'usage de codage et d'agents, trois semaines seulement après la version 3.6 Flash. Jusqu'au 31 décembre, le modèle est facturé à la moitié du prix de 3.6 Flash — $0.75 par million de jetons d'entrée et $3.75 par million de jetons de sortie. Google intègre également le modèle dans Gemini Spark pour les abonnés AI Pro et Ultra dans plus de 160 régions.
Le 14 août, DeepSeek a annoncé une tarification API en heures pleines et en heures creuses, effective à compter du 17 août, les heures creuses étant facturées à la moitié du tarif de pointe. Certains modèles voient leurs prix augmenter de plus de 3 fois. Le modèle phare deepseek-v4-pro enregistre une hausse notable du prix par million de jetons pendant les heures de pointe. Cette décision inverse la position antérieure de DeepSeek en tant que fournisseur à bas coût.
Le 13 août, Lenovo a publié ses résultats du T1 FY2026 : le chiffre d'affaires lié à l'IA a progressé de 60 % en glissement annuel pour atteindre 8,5 milliards de dollars, soit 35 % du chiffre d'affaires total. Le président Yang Yuanqing a déclaré aux médias que l'allocation de calcul est en train de passer d'une phase initiale « 80 % d'entraînement » à un objectif de « 80 % d'inférence, 20 % d'entraînement », la répartition actuelle étant d'environ 50/50.
Les annonces groupées du même jour — un modèle de pointe à 750 jetons par seconde, un modèle Flash à moitié prix et un fournisseur chinois qui augmente ses prix pendant que d'autres les réduisent — montrent que la concurrence est passée de « qui est le plus puissant » à « qui est le plus rapide et le moins cher ».
Le 14 août, DeepSeek a publié la version officielle de V4-Pro, un modèle de 1 600 milliards de paramètres dont les poids sont publiés sous licence MIT, avec une prise en charge native de l'API OpenAI Responses et une adaptation ciblée pour Codex. L'écosystème de plugins Harness est entré en phase de test public.
Le même jour, GLM-5.3 de Zhipu a été signalé avec un modèle de base de 743 milliards de paramètres, obtenant un score de 84,5 sur CyberGym, supérieur à GPT-5.6 Sol, et conçu pour la cyberdéfense et le codage. Meituan a lancé LongCat-2.0, un modèle à mélange d'experts (MoE) de 1 600 milliards de paramètres avec une fenêtre de contexte d'un million de jetons, qui a obtenu 70,8 sur Terminal-Bench 2.1 et est axé sur le codage agentique.
Le 14 août, Grok 4.6 a pris la tête du classement de codage en conditions réelles CursorBench, devant Claude Opus 5 et GPT-5.6 Sol. xAI a également publié en open source les poids de Phoenix, son algorithme de classement pour X, un transformeur basé sur Grok dont les pondérations de scores synthétiques privilégient l'intention de propagation et la conversation authentique, les mentions « J'aime » étant traitées comme le signal le moins coûteux.
Le 13 août, une étude Meta/Oxford a montré que le préentraînement multimodal n'a besoin que de 5 % de données de génération d'images, le mélange optimal étant de 70 % de langage, 25 % de compréhension d'images et 5 % de génération d'images, ce qui réduit de 5 fois les jetons de génération d'images.
La dynamique des poids ouverts menée par DeepSeek, Meituan et xAI, ainsi que les benchmarks spécialisés pour le codage et la cyberdéfense, marque une évolution vers des modèles spécialisés par capacité, en concurrence sur des tâches étroites et mesurables plutôt que sur des revendications de capacité générale.
Le 13 août, Fortune a rapporté qu'Anthropic prévoyait une introduction en bourse (IPO) en octobre pour une valorisation de 2 000 milliards de dollars, ce qui dépasserait l'introduction en bourse de SpaceX de 1 770 milliards de dollars réalisée le 12 juin, la plus importante jamais enregistrée. Le revenu annualisé d'Anthropic a dépassé 47 milliards de dollars en mai, et la société a déposé confidentiellement auprès de la SEC en juin.
Le 14 août, Nikkei a rapporté que Tencent allait acquérir la participation de Meta dans le développeur d'IA Manus pour en devenir le principal actionnaire. Manus, lancé en mars 2025 par Butterfly Effect, a transféré son siège social à Singapour et réduit ses activités en Chine après un investissement américain. En avril, l'examen de sécurité des investissements étrangers en Chine a interdit l'acquisition de Manus par Meta ; le 11 août, Manus a annoncé se détacher de Meta et rétablir son fonctionnement indépendant.
Le 14 août, des médias ont rapporté que Google DeepMind se restructurait, abandonnant la recherche sur les modèles de pointe au profit de modèles de classe Flash à coût efficient, avec des licenciements pouvant atteindre un tiers ou plus des effectifs. Demis Hassabis a quitté ses fonctions de PDG le 5 août pour devenir président et scientifique en chef d'Alphabet. Cette restructuration est liée aux retards du prochain modèle Gemini phare de Google et à des désaccords internes sur les priorités de développement.
Le 14 août, Reuters a rapporté qu'Apple a entraîné un grand modèle de langage (LLM) spécifique au marché chinois avec Alibaba, mettant fin à sa dépendance antérieure aux modèles tiers. Apple Intelligence devrait être lancé en Chine dans les prochains mois, après le dépôt le 15 juillet du service d'IA générative sur appareil « Apple Intelligence » auprès des régulateurs.
Le 13 août, Musk a déclaré aux employés de SpaceX que la capacité électrique du centre de données de SpaceXAI (anciennement xAI) augmenterait d'environ 7 fois pour atteindre 10 GW d'ici fin 2027, contre 1,4 GW actuellement entre Memphis et Southaven. Il a estimé que 10 GW pourraient générer entre 300 et 500 milliards de dollars de revenus annuels.
Le même jour a apporté deux signaux de l'ordre de 2 000 milliards de dollars et deux mouvements sur le marché chinois : la valorisation de l'introduction en bourse d'Anthropic et la stratégie d'Apple pour son modèle chinois — tandis que Tencent absorbait Manus et que Google se retirait du front de la recherche de pointe.
Le 13 août, lors du symposium USENIX Security à Baltimore, des chercheurs de l'université de Birmingham et de l'université de Durham ont divulgué « Download More RAM », une attaque exploitant l'absence de protection en écriture dans les puces SPD DDR4/DDR5 pour contourner les défenses de Windows 11 sans accès physique. La faille permet à un logiciel de réécrire les données de configuration de la mémoire, ce qui amène Windows à indiquer à tort une capacité de RAM double et crée des alias de mémoire pour lire ou modifier des régions protégées. Elle peut désactiver l'antivirus, compromettre des systèmes d'entreprise verrouillés et contourner l'anti-triche du noyau. Microsoft a attribué le CVE-2026-23670 et a ajouté une mesure d'atténuation dans la mise à jour de sécurité d'avril 2026 ; les systèmes sur lesquels le démarrage sécurisé est activé sont protégés. Corsair, G.Skill et ADATA avaient chacun au moins une gamme de produits grand public touchée.
Le 6 août, un article accepté pour l'ACM AI Leadership Summit a montré que les détecteurs d'IA commerciaux ne peuvent pas distinguer de manière fiable la modification par IA d'une rédaction complète. Les légères modifications de type « refine abstract only » ont été signalées à 64–80 % (Pangram/GPTZero), tandis que les originaux non modifiés de 2023–2025 ont été signalés à 9–15 %. Après l'humanisation par « Undetectable AI », moins de 4 % des réécritures étiquetées comme générées par IA restent signalées. Une modification honnête par IA comporte un risque de sanction plus élevé que l'évasion assistée par un humaniseur.
Cette semaine également, une analyse technique a soutenu que les filigranes des textes générés par IA seront toujours faciles à supprimer, avant l'exigence de l'article 50 du règlement européen sur l'intelligence artificielle (AI Act) selon laquelle les sorties doivent être « détectables comme générées artificiellement », applicable à partir d'août 2026. L'échantillonnage de jetons de type SynthID peut être éliminé en paraphrasant au moyen de n'importe quel LLM faible, et les filigranes par homoglyphes Unicode peuvent être supprimés en remplaçant les caractères. L'analyse note que Claude Code a déjà utilisé la stéganographie par homoglyphes pour marquer certaines requêtes.
Le 13 août, OpenAI a lancé Computer History pour l'application ChatGPT Mac, remplaçant l'aperçu basé sur des captures d'écran Chronicle par une journalisation des événements d'accessibilité macOS (clics, frappe, raccourcis, changements d'application). Les événements sont stockés localement pendant 48 heures maximum, puis supprimés après la génération de mémoire côté serveur. L'activité en mode confidentialité est exclue. La fonctionnalité est déployée auprès des utilisateurs Pro, Business et Enterprise, à l'exception de l'Espace économique européen (EEE), de la Suisse et du Royaume-Uni.
Le 14 août, ChatGPT a acquis la capacité de modifier directement Google Docs, Sheets et Slides sans changer d'onglet, avec un déploiement auprès des utilisateurs Plus, Pro, Business et Enterprise.
L'attaque au niveau matériel, les détecteurs défaillants et le filigrane facilement supprimable partagent un même constat : l'infrastructure de vérification des contenus générés par IA et de sécurisation des systèmes est en retard sur les modèles eux-mêmes.