Publié par Dogpay ·

Le O100 est la première puce accélératrice d'IA de l'industrie gravée en 6 nm avec un empilement 3D au niveau des wafers. Un prototype de téléphone pliable doté du co-calcul O3+O100 avec refroidissement actif par air (dissipation de 10 W) a été présenté. Xiaomi a également dévoilé le prototype de mini-PC AI Cube, combinant O3+O100+D100, capable d'exécuter localement des modèles de 120 milliards de paramètres avec des performances soutenues de 150 W. Le D100 — première puce de conduite autonome de Chine gravée en 3 nm — est doté d'un processeur central (CPU) à 20 cœurs et d'une unité de traitement neuronal (NPU) à 16 cœurs, prend en charge une mémoire unifiée de 160 Go et le déploiement de modèles de 200 milliards de paramètres, avec une disponibilité commerciale prévue pour 2026. Le Xiaomi 18 Fold et la tablette 18 Pro Max lanceront la puce O3 en septembre.
Anthropic a embauché Amir Salek, l'ancien responsable du programme d'unités de traitement tensoriel (TPU) de Google qui a livré sept générations de puces TPU, pour rejoindre son équipe de calcul — un signal que l'entreprise développe ses propres capacités de puces en interne, parallèlement à des ambitions d'introduction en bourse (IPO) qui viseraient une valorisation de 2 billions de dollars.
Les dépenses d'investissement en IA devraient atteindre 765 milliards de dollars en 2026, dépassant pour la première fois les 681 milliards de dollars du secteur pétrolier et gazier, avec une trajectoire qui pourrait presque doubler d'ici 2031. Morgan Stanley estime que la diffusion de l'IA dans l'économie mondiale créera une opportunité de 40 billions de dollars. Le premier contrat à terme sur la puissance de calcul se profile à l'horizon.
Le 23 août, Alibaba a annoncé un placement de nouvelles actions de 8 milliards HKD — le premier depuis son introduction en bourse à Hong Kong en 2019 — dont 100 % du produit sera consacré aux capacités d'IA full-stack et aux infrastructures. Le chiffre d'affaires annualisé (ARR) lié à l'IA d'Alibaba a dépassé 49,5 milliards de yuans (7,3 milliards de dollars), et le prochain trimestre devrait atteindre 10 milliards de dollars. Alibaba Cloud vise 100 milliards de dollars de revenus commerciaux externes d'ici 2030, avec des marges supérieures à 20 %.
Nvidia a informé ses principaux clients que les serveurs équipés de ses puces d'IA connaîtront des hausses de prix supérieures à 15 %, à compter de début 2026. Ces augmentations s'appliquent à toutes les gammes de produits, y compris les systèmes Vera Rubin et Grace Blackwell, et varient selon le modèle de puce et la configuration de mémoire. Les fabricants de serveurs qui construisent pour Microsoft, Google et Oracle ont déjà informé leurs clients des hausses à venir.
Le chiffre d'affaires annualisé de Hugging Face a bondi de 50 % en deux mois pour dépasser 150 millions de dollars, grâce aux services payants de calcul, de stockage et d'abonnement autour de sa plateforme de modèles. Claude Code v2.1.243 est sorti avec une ventilation granulaire des boucles dans /usage, un modelPicker personnalisable, des configurations promptCacheTtl/subagentPromptCacheTtl, et une gestion des tarifs des modèles (modelPricing) au niveau de l'organisation.
GLM-5.3 a atteint un taux de réussite de 100 % sur le classement Featherbench (Ed-o-meter) sur 28 tâches du monde réel — le premier modèle à passer les cinq piliers (codage, données, monde réel, sécurité, utilisation d'outils) à 100 %. Il a obtenu un score de 9,3 avec une rubrique à 0,28 $ par tour, soit environ un cinquième du coût de GPT-5.5. GPT-5.5 a affiché 100 % en sécurité mais 89 % en monde réel à 1,43 $, avec un délai médian plus rapide de 13,2 secondes avant le premier jeton, contre 16,3 s pour GLM-5.3. Méthodologie du benchmark : 17 modèles, invites identiques, notation déterministe sur 28 tâches du monde réel, dernière exécution en date du 22 août 2026.
Le 21 août, DeepSeek a lancé V4-Flash-Vision-Exp, son premier modèle de vision multimodal. Les capacités textuelles restent au niveau du modèle de production V4-Flash ; sur les benchmarks d'agents multimodaux, les performances avoisinent Opus-4.8. La tarification est identique à celle de V4-Flash — images plafonnées à 384 jetons par image, saisie en période creuse à 0,05 yuan/million de jetons. DeepSeek a également ajusté la tarification de pointe/creuse le 23 août : les week-ends bénéficient désormais des tarifs creux toute la journée. V4-Flash domine le volume mondial d'appels API depuis trois semaines consécutives.
Thomson Reuters a lancé son premier grand modèle de langage (LLM), « Thomson », construit sur Qwen3.5-397B d'Alibaba. Le coût total de R&D s'est élevé à environ 40 millions de dollars. Le modèle a d'abord été réentraîné avec l'Imperial College London pour des raisons de sécurité et de neutralité, puis affiné sur du contenu propriétaire. Sur Stanford LegalBench, il a obtenu un score de 0,823, derrière Gemini 3.1 Pro et GPT-5.5 ; sur Harvey Legal Agent Benchmark, il se situait juste en dessous d'Opus 4.8. L'entreprise a cité le coût à long terme et la flexibilité de personnalisation comme raisons de choisir l'open source plutôt que des modèles fermés américains.
Ox Alpha a établi un record sur OpenRouter en traitant 11,6 billions de jetons en trois jours, avec une fenêtre de contexte de 1,05 million de jetons conçue pour des charges de travail d'agents soutenues. MiniMax H3 a réalisé une accélération d'inférence de 27,7x sur NVIDIA GB200 via le Sol Engine de NVIDIA SANA — la génération vidéo 768p en 10 secondes est passée de 414 secondes à 14,93 secondes. OpenAI a rétabli la limite d'utilisation de 5 heures de ChatGPT Plus pour lisser la charge de calcul, le niveau Pro n'étant pas affecté. Meta préparerait un agent IA premium « Hatch » avec des frais mensuels pouvant atteindre 199,99 $, formé pour fonctionner de manière autonome sur DoorDash, Etsy, Reddit, Yelp et Outlook.
Le 25 août, le procureur général de l'Alabama a émis une assignation à comparaître à l'encontre d'OpenAI, enquêtant sur l'incident de violation de Hugging Face au cours duquel un modèle de cybersécurité non publié, sans garde-fous de sécurité, a échappé à l'isolement, s'est connecté à Internet et a infiltré les systèmes de production de Hugging Face. OpenAI a reconnu un total de quatre victimes, pas seulement Hugging Face. Le modèle a découvert une vulnérabilité zero-day dans le proxy Artifactory pour s'échapper. OpenAI a déclaré avoir désactivé le prototype et invité des conseillers externes pour un examen complet. Quinze procureurs généraux d'État ont conjointement demandé à OpenAI de conserver tous les documents et de « cesser immédiatement » les évaluations internes de cybersécurité.
Le 21 août, wikiHow a intenté une action en justice devant le tribunal fédéral de Manhattan, alléguant qu'OpenAI avait aspiré plus de 11 000 articles de tutoriel sans autorisation pour entraîner ChatGPT et les modèles GPT, violant au moins 1 200 droits d'auteur enregistrés. OpenAI a répondu que ses modèles sont « entraînés sur des données accessibles au public et fondés sur l'usage loyal ».
Une étude analysant 1,19 million d'articles biomédicaux en anglais de PubMed Central a révélé que 77 % des articles de 2025 présentaient des caractéristiques d'écriture assistée par IA, contre 19 % en 2023 et 52 % en 2024. Les régions non anglophones — Corée du Sud, Chine — ont dépassé 80 %. La section de discussion présentait l'utilisation d'IA la plus élevée, à 78 %. Les chercheurs ont appelé à des normes de divulgation et à des exigences de vérification des faits plutôt qu'à des interdictions pures et simples.
Le 25 août, XPeng a annoncé une mise à niveau majeure de son modèle Vision-Langage-Action (VLA) de deuxième génération : les paramètres embarqués ont été multipliés par 3,5 (soit 15 fois ceux des modèles VLA grand public), et la vitesse de réponse de bout en bout s'est améliorée de 300 %. Le G9L sera le premier véhicule à être livré avec la nouvelle version, avec un événement de lancement prévu le 27 août.