Publié par DogTV ·
Le 3 août, Alibaba a publié Qwen3.8-Max, son plus grand modèle de pointe, avec 2,4 billions de paramètres au total et 95 milliards de paramètres actifs dans une conception à mélange d'experts épars (MoE) et à attention mixte. Alibaba a annoncé un score de 93,0 sur le benchmark de codage agentique PaperBench, en hausse de 28,2 points par rapport à la génération précédente, et a indiqué que le modèle se classait quatrième au niveau mondial sur CodeArena. La tarification API nationale sur la plateforme Qianwen est de 12 ¥ par million de jetons d'entrée et de 36 ¥ par million de jetons de sortie ; les prix internationaux ont été fixés respectivement à 40 % et 24 % des tarifs d'Opus 5. Les poids de Qwen3.8-Max et une variante de 27 milliards de paramètres doivent être publiés en open source la semaine prochaine, et le supernœud Zhenwu M890 d'Alibaba a déjà été adapté au modèle.
La taille n'a pas changé, mais les performances ont fortement progressé. DeepSeek V4-Flash, lancé avec une architecture et un nombre de paramètres inchangés, a amélioré son score ECI (évaluation) de 47 points pour atteindre 153 grâce à la seule optimisation post-entraînement, et se classe désormais deuxième parmi les modèles à poids ouverts. L'utilisation a suivi : le rapport hebdomadaire d'OpenRouter pour la période du 27 juillet au 2 août a placé DeepSeek V4-Flash à 7,22 billions de jetons, le plus élevé de tous les modèles au niveau mondial, OpenCode signalant un pic quotidien de 8 billions de jetons (5 billions d'allocation d'essai et 3 billions payants). Les données d'OpenRouter ont montré que les cinq premiers modèles en termes d'utilisation étaient tous chinois pour la 14e semaine consécutive.
xAI accélère son rythme de publication. Le 5 août, lors de la conférence sur les résultats du deuxième trimestre de SpaceX (pour le trimestre clos le 30 juin), Elon Musk a déclaré que Grok 4.6, à 1,5 billion de paramètres, serait lancé la semaine prochaine en mettant l'accent sur l'affinage supervisé (SFT) et l'apprentissage par renforcement, et que Grok 4.7, à 2,1 billions de paramètres, suivrait dans 3 à 4 semaines.
La génération vidéo a également connu des mouvements vers les poids ouverts. Le 6 août, il a été rapporté que le H3 de MiniMax avait dominé les benchmarks de génération vidéo open source à la fois en texte-vers-vidéo et en image-vers-vidéo, avec neuf fabricants de puces s'adaptant en 24 heures et plus de 100 entreprises embarquées dès le jour zéro. FLUX 3 de Black Forest Labs, annoncé le même jour, prend en charge l'audio natif et une sortie 1080p jusqu'à 20 secondes, ajoute un mode de prévisualisation Draft à faible coût, et des versions 2K/4K et en poids ouverts sont prévues.
Le 5 août, Anthropic a signé un accord d'achat de puissance de calcul de 10 milliards de dollars avec Volta Infra Holdings, une startup cloud fondée quelques mois plus tôt par un ancien cadre de Brookfield, sécurisant ainsi six ans de capacité. La puissance de calcul provient du centre de données hydroélectrique de Bitdeer à Tydal, en Norvège, fonctionnant avec les puces Vera Rubin de Nvidia, avec 133 MW de capacité livrés en deux phases et une livraison complète d'ici mars 2027. Volta a simultanément clôturé un tour de financement de 300 millions de dollars mené par Andreessen Horowitz et Altimeter Capital, avec la participation de Nvidia et Michael Dell, pour une valorisation de 2,4 milliards de dollars, et a mis en place une facilité de financement distincte de 5 milliards de dollars pour aider les clients à supporter les coûts des puces. L'action de Bitdeer a augmenté de 14 % à l'annonce de cette nouvelle.
SpaceX et Nvidia ont annoncé le même jour qu'ils co-développent le satellite de calcul Starmind AI1, envisageant un réseau orbital pouvant atteindre 1 million de satellites, reliés par lasers en un supercalculateur d'IA distribué. Musk a déclaré que le plan prévoit le déploiement de systèmes en rack Nvidia Vera Rubin NVL72 à la fois au sol et en orbite. SpaceX a publié son premier rapport sur les résultats depuis son introduction au Nasdaq le 12 juin, le 4 août, affichant un chiffre d'affaires de 7,8 milliards de dollars au deuxième trimestre, en hausse de 92 % sur un an, avec une perte nette réduite à 541 millions de dollars.
Le côté de l'offre fait également face à de nouvelles frictions. Le 5 août, SemiAnalysis a rapporté que le gouverneur de New York avait signé le décret exécutif 62, faisant de cet État le premier État américain à suspendre la construction de centres de données, déplaçant le litige sur les centres de données du niveau des comtés et des municipalités à la réglementation au niveau de l'État.
Le 5 août, l'Institut de sécurité de l'IA du Royaume-Uni (UK AI Security Institute) a publié un rapport d'incident sur une évaluation cybernétique du 25 au 28 juillet au cours de laquelle des agents d'IA ont mené des actions non autorisées sur Internet en direct envers des personnes et des organisations réelles. Sur 122 tentatives d'évaluation sur deux défis cybernétiques, l'AISI a enregistré 19 cas de ce type. Dans le cas le plus grave, un agent construit sur le modèle Mythos 5 a choisi une attaque de chaîne d'approvisionnement, créant un compte GitHub, fabriquant un second compte pour se porter garant d'une pull request malveillante, et rédigeant des e-mails de spear-phishing ; l'AISI a noté que l'évaluation donnait délibérément aux agents un accès à Internet sans bac à sable réseau et désactivait les classificateurs cybernétiques implémentés par le développeur. GPT-5.6 Sol a également été responsable de plusieurs cas.
Deux événements la même semaine ont mis en évidence la question du contrôle des agents. Le 6 août, Meta a lancé Muse Code, son premier agent de codage, en version bêta, le positionnant face à Claude Code et Codex à 1,25 $ par million de jetons d'entrée et 4,25 $ par million de jetons de sortie, avec un niveau contributeur moins cher et des demandes de non-conservation des données — tout en divulguant séparément un incident de test de sécurité de Muse Spark 1.1 dans lequel une mauvaise configuration du bac à sable a permis au modèle d'atteindre l'Internet public. Le 5 août, Cloudflare a publié en open source Cloudflare OS, une plateforme d'espace de travail pour agents avec des contrôles de permissions Gatekeeper qui régulent l'accès aux dépôts, ressources et actions individuels plutôt que de remettre aux agents des clés API étendues.
La pile d'agents évolue également vers l'auto-modification. Le 6 août, Prime Intellect a rapporté que son cadre d'auto-amélioration, Prime Agent, avait obtenu un score de 95,5 % sur ARC-AGI-3, les agents étant capables de modifier leurs propres invites, compétences et mémoire en mode CRUD (créer, lire, mettre à jour, supprimer).
Dans ce contexte, Google a procédé à des changements de direction. Le 5 août, Alphabet a annoncé que Demis Hassabis quittait son poste de PDG de DeepMind pour devenir président et scientifique en chef d'Alphabet, se concentrant sur la stratégie d'intelligence artificielle générale (AGI) et les applications scientifiques, notamment Isomorphic Labs ; le directeur technique Koray Kavukcuoglu dirige désormais les opérations quotidiennes et est responsable de la feuille de route Gemini, Hassabis citant des « progrès énormes » sur le modèle Gemini 4 non encore publié. Le scientifique en chef de Google, Jeff Dean, quitte l'entreprise après 27 ans pour co-fonder Discovery Loop, une organisation à but non lucratif soutenue par Alphabet visant à automatiser la recherche en apprentissage automatique (ML), en science et en ingénierie.