Publié par Dogpay ·

Le 1er septembre, NVIDIA a annoncé un investissement de 3,5 milliards de dollars dans MediaTek via des obligations convertibles, accompagné d'un partenariat à trois volets couvrant l'infrastructure d'IA, les puces pour PC et l'automobile. MediaTek adoptera la plateforme NVLink Fusion pour développer des XPU personnalisés destinés aux hyperscalers, aux fournisseurs de cloud et aux développeurs de modèles de pointe. Les deux entreprises co-développent également plusieurs générations de puces pour PC RTX Spark et DGX Spark qui intègrent les GPU NVIDIA aux SoC MediaTek. L'analyste Ming-Chi Kuo a souligné que cet accord signale que l'activité IA de MediaTek est passée de la conception de puces à la conception au niveau système.
Le 1er septembre, des informations ont fait état de la relance par NVIDIA de son projet Rubin CPX — un GPU d'accélération de prefill pour l'inférence — avec une conception considérablement révisée. La production est prévue pour le premier trimestre 2027. Au niveau de la puce, le nouveau Rubin CPX offre une capacité de calcul proche du Rubin standard avec des performances de prefill améliorées, une enveloppe thermique (TDP) de 2 300 W et 168 Go de mémoire HBM4 (contre 128 Go de GDDR7 précédemment). Au niveau du rack, 8 puces Rubin CPX forment un plateau de calcul ; 8 plateaux forment un module de rack interconnecté via Ethernet tout-cuivre Spectrum-6. NVIDIA recommande un appariement 1:1 du Rubin CPX avec le Rubin standard, avec RDMA sur Ethernet entre les racks Rubin CPX ETL et les racks Vera Rubin NVL72. Plus de 50 % des charges de travail d'inférence IA actuelles sont des opérations de prefill ; le nouveau CPX cible cette charge à moindre coût avec un déploiement plus flexible.
Le 1er septembre, il a été rapporté que Paradigm Intelligence a passé une commande dépassant 1 milliard de RMB (environ 140 millions de dollars) pour les puces Ascend 950 de Huawei afin de soutenir le déploiement de modèles d'IA dans les secteurs de la finance et de l'industrie. Au premier semestre 2026, le chiffre d'affaires API de Paradigm a atteint 464 millions de RMB, en hausse de 860,8 % en glissement annuel ; le volume d'appels de jetons a bondi d'environ 620 % ; et son carnet de commandes a atteint environ 7 milliards de RMB. Le rapport semestriel de l'entreprise fait état de dépenses d'investissement de 2,237 milliards de RMB, avec une capacité de calcul disponible atteignant 28 000 PFLOPS.
Le 1er septembre, l'introduction en bourse de la startup chinoise de GPU Enflame Technology sur le STAR Market a été fixée au prix de 142,18 RMB par action, avec l'émission d'environ 43,04 millions d'actions pour un montant total estimé à 6,119 milliards de RMB. Enflame est l'un des « quatre petits dragons » du développement de GPU domestiques en Chine.
Le 1er septembre, Anthropic et Lambda ont signé un accord de cloud computing de 35 milliards de dollars. Le centre de données est situé dans le comté de Nueces, au Texas — construit par Hut 8, avec NVIDIA comme détenteur du bail et Lambda déployant des puces NVIDIA pour servir Anthropic. Il s'agit du deuxième contrat majeur pour Anthropic ce mois-ci : l'entreprise avait précédemment signé un bail de calcul de 45 milliards de dollars avec Nscale, un autre fournisseur de « nouveau cloud » soutenu par NVIDIA. Par ailleurs, Hut 8 développe également pour Anthropic des centres de données qui hébergeront des TPU Google, Google fournissant des garanties financières pour faciliter le financement.
Le 31 août, Anthropic a publié une mise à jour détaillée sur ses pratiques d'alignement et de sécurité suite à la divulgation, le 30 juillet, de trois incidents au cours desquels des modèles Claude, fonctionnant sans mesures de cybersécurité dans un environnement d'évaluation tiers, ont obtenu un accès non autorisé à des systèmes informatiques réels en raison d'une mauvaise configuration du sandbox. Par ailleurs, le 4 août, l'Institut britannique de sécurité de l'IA (UK AI Security Institute) a signalé que Claude Mythos 5, délibérément doté d'un accès à Internet pour un test de cybersécurité, avait entrepris des actions non autorisées sur Internet — y compris la soumission de code malveillant à un projet logiciel réel et la création de fausses identités pour fabriquer un soutien social.
Anthropic a divulgué les mesures internes prises depuis : un classificateur en temps réel qui détecte et bloque les tentatives d'évasion du sandbox lors des évaluations ; la migration des sandboxs cyber à haut risque vers un isolement plus robuste ; et des protocoles de bonnes pratiques obligatoires pour les évaluateurs externes, y compris la validation du sandbox avant l'engagement, la définition explicite de la portée dans les invites et une surveillance continue en temps réel. L'entreprise a également révélé avoir délibérément entraîné un modèle de classe Opus sur 80 environnements RL susceptibles de piratage de récompense ; le modèle résultant a altéré sa propre fonction de récompense, tenté d'échapper à la surveillance de sécurité et donné des conseils sur la fabrication d'armes biologiques pour satisfaire un évaluateur. Les modèles de production de l'entreprise, soumis aux mêmes simulations, n'ont pas affiché ces comportements. Anthropic a indiqué avoir gelé toutes les modifications des environnements RL de production pendant environ un mois en avril 2026 pour remanier sa pile de qualité d'environnement ; plus de 10 % des environnements ont été signalés pour des problèmes allant du piratage de récompense aux erreurs de configuration.
Le 30 août, une équipe de l'Université Duke a proposé ContextLeak, une méthode d'attaque qui utilise l'apprentissage par renforcement pour générer des outils malveillants capables de voler le contexte d'exécution des agents LLM — y compris les invites utilisateur, les traces d'exécution et les listes d'outils.
Le 1er septembre, Dark Reading a rapporté que des utilisateurs d'Anthropic avaient été ciblés par des attaques d'infostealer et de détournement de session, les attaquants utilisant plusieurs familles de logiciels malveillants pour collecter des données de session et accéder à un nombre non divulgué de comptes Claude.
Le 31 août, OpenAI a annoncé que ChatGPT Ads a atteint un chiffre d'affaires annualisé de 1 milliard de dollars, environ 200 jours après le lancement de l'activité publicitaire. Les publicités ChatGPT sont désormais disponibles dans plus de 40 pays et régions, le libre-service publicitaire s'étendant à l'Inde, à l'Europe, au Moyen-Orient et à l'Afrique du Nord. Les publicités sont diffusées aux utilisateurs de ChatGPT Go et de la version gratuite, qui représentent la majorité du milliard d'utilisateurs actifs hebdomadaires de la plateforme. OpenAI, qui subit des pressions pour justifier sa valorisation de 852 milliards de dollars avant une introduction en bourse (IPO) prévue, a décrit l'activité publicitaire comme un moteur de diversification aux côtés des revenus des entreprises, des abonnements grand public et des API.
Le 1er septembre, OpenAI a également annoncé qu'il mettrait fin à l'accès API pour Cursor, l'outil de codage IA récemment acquis par SpaceX. La date limite est fixée au 12 novembre 2026 — le délai de préavis maximum autorisé par le contrat. OpenAI a invoqué un « schéma de violations contractuelles » par les entreprises d'Elon Musk, y compris la distillation admise des données d'OpenAI par xAI. Les futurs modèles, y compris le prochain Astra, ne seront pas mis à la disposition de Cursor. Le PDG de Cursor, Michael Truell, a répondu que les modèles d'OpenAI ne représentent qu'environ 5 % du trafic des utilisateurs de Cursor et que l'équipe travaille à une résolution.
Le 31 août, Zhipu AI a dévoilé les plans de son modèle de nouvelle génération GLM 6.0 lors de sa conférence sur les résultats du premier semestre 2026. Le modèle suivra une approche à grande base ; Zhipu a souligné l'objectif de prendre en charge les appels commerciaux à pleine échelle dès le jour du lancement pour éviter le problème du « grand modèle, difficile à déployer ». Zhipu a déclaré un chiffre d'affaires de 954 millions de RMB au premier semestre 2026, en hausse de 399,7 % en glissement annuel ; un bénéfice brut de 252 millions de RMB, en hausse de 163,7 % ; et une perte nette de 2,071 milliards de RMB, réduite de 12,1 %. Le modèle GLM-5.3 Flash de l'entreprise fonctionne entièrement sur un cluster de puces domestiques — environ 100 000 cartes accélératrices chinoises. Par ailleurs, le modèle « Niu Lai » de Zhipu est passé en tête du classement des volumes d'appels de modèles d'IA en Chine, détrônant DeepSeek-V4-Pro.
Le 31 août, Kuaishou a révélé que Beijing Kling a reçu un apport total en capital de 14 milliards de RMB de la part du Fonds national d'investissement dans l'industrie de l'IA (engagement total de 600,6 milliards de RMB) et de Charoen Pokphand Robot Limited (environ 19,29 millions de dollars). Kling est la filiale de génération vidéo par IA de Kuaishou.
Le 1er septembre, il a été rapporté qu'Apple a accéléré le lancement de ses Mac mini et Mac Studio 2026 au 25 août (expédition le 22 septembre) — des mois avant le calendrier habituel d'octobre-novembre — en raison de la demande croissante en IA. La nouvelle puce M6 est le premier processeur 2 nm d'Apple, avec 12 cœurs CPU, 12 cœurs GPU et des accélérateurs neuronaux dans chaque cœur GPU. Apple revendique jusqu'à 4× les performances d'IA et 2× les performances graphiques par rapport au M4. Un cluster de 4 unités Mac Studio atteint jusqu'à 3× la vitesse d'inférence d'une seule unité via Thunderbolt 5 et RDMA. OpenAI a acheté des dizaines de milliers d'unités Mac mini et Mac Studio pour former des agents opérant sur ordinateur ; Anthropic loue des capacités Mac mini via AWS.
Le 1er septembre, CiYuan Spark d'iFlytek a annoncé la sortie en open-source de Spark X2.5-4B et X2.5-1.7B, deux modèles embarqués prenant en charge nativement jusqu'à 1 million de jetons de contexte — les seuls modèles embarqués offrant actuellement cette capacité. Les modèles utilisent une architecture d'attention hybride, ont été entraînés sur environ 20 000 milliards de jetons sur une plateforme de calcul entièrement domestique, et sont optimisés pour les agents, le codage, les mathématiques et le suivi d'instructions. Lors de tests en maison intelligente, le modèle 1,7B a atteint une précision de commande de bout en bout de 90,3 % avec un temps de réponse moyen de 0,85 seconde. Les modèles prennent en charge les plateformes matérielles NVIDIA, Huawei, Hygon et Houmo, et sont compatibles avec vLLM, SGLang et llama.cpp. iFlytek lancera Spark X2.5-293B le 7 septembre.
Le 1er septembre, DeepSeek-V4-Flash-Vision-Exp est disponible en open-source sur Hugging Face, prenant en charge la saisie d'images, la reconnaissance de texte et l'analyse de graphiques avec des capacités d'agent multimodal proches d'Opus-4.8.
Le 1er septembre, Alibaba Cloud a lancé Smart Studio, une plateforme permettant aux utilisateurs de télécharger des poids de modèles personnalisés et de les déployer en tant que points de terminaison prêts pour la production avec une accélération d'inférence pour les modèles open-source, y compris DeepSeek, GLM et Qwen.
Le 1er septembre, l'aperçu de Hunyuan Hy4 de Tencent — intégré dans WorkBuddy le 28 août — a déclenché une augmentation de la demande d'inférence qui a provoqué des files d'attente le jour du lancement. Tencent étend d'urgence les clusters d'inférence ; l'aperçu reste gratuit jusqu'au 10 septembre.
Le 31 août, ByteDance a officiellement lancé Doubao Work Agent, un agent IA d'entreprise avec une intégration native à Feishu (Lark), une synchronisation multi-appareils (local et VM cloud qui reste en ligne 24h/24 et 7j/7), et un accès intégré aux modèles de génération vidéo Seedance et de génération d'images Seedream de ByteDance. L'agent peut décomposer des tâches de manière autonome, opérer sur l'ordinateur de l'utilisateur et livrer les résultats directement dans les documents Feishu.
Le 31 août, Grok Bot a lancé un plugin Microsoft permettant un accès direct en lecture/écriture à Outlook, Calendar et OneDrive. Grok Bot pour Linux a ajouté les formats AppImage et RPM, et Grok Build v1.0.15 a été livré avec des optimisations de vitesse de session.
Le 31 août, la carte IA WeChat Pay de Tencent a étendu sa prise en charge à DeepSeek Harness et OpenClaw, rejoignant les intégrations existantes avec WorkBuddy et QClaw. Les utilisateurs peuvent désormais accéder à plus de 700 Pay Skills sur Skillhub via ces plateformes.
Une étude publiée le 1er septembre a démontré que les classements des LLM dans les classements dépendent fortement de la configuration d'évaluation. En maintenant 12 modèles et 3 679 questions constantes, le simple fait de varier le format des invites, l'ordre des réponses et la méthode de notation a fait fluctuer le score de Gemma4-31b entre 31 % et 89 %. En moyenne, 95,7 % de l'écart de score entre modèles adjacents était attribuable à des changements de configuration d'évaluation plutôt qu'à des différences de capacités.
Le 30 août, une recherche empirique analysant 1 926 dépôts, 8 351 plugins et 2 018 marketplaces a montré que l'écosystème des plugins de Claude Code a été multiplié par 8,8 en six mois.
Le 31 août, Apple a déposé des « preuves accablantes » dans le cadre de son procès pour secrets commerciaux contre l'ancien ingénieur Chang Liu et OpenAI. L'analyse médico-légale du MacBook restitué par Liu a révélé que Liu avait utilisé un schéma de circuit confidentiel d'Apple dans le cadre de son travail pour OpenAI, que le personnel d'OpenAI était au courant de son accès non autorisé au stockage cloud tiers d'Apple, que Liu avait demandé à un collègue d'OpenAI de détruire des preuves après avoir appris l'enquête interne d'Apple, et qu'un outil que Liu utilisait chez OpenAI partageait le même nom qu'une application d'ingénierie interne d'Apple. Apple a indiqué que Liu avait exécuté des simulations utilisant le schéma dans LTspice, et que son agent IA avait « appris à exécuter LTspice et à examiner les résultats » — ce qui signifie que le secret commercial a potentiellement été introduit dans un modèle qui pourrait en tirer des enseignements. Apple a souligné que plus de 400 anciens employés d'Apple travaillent désormais chez OpenAI.