
Le 22 août, OpenAI a réduit le prix de GPT-5.6 Sol de plus de 20 %, citant des améliorations continues de l'éfficacité qui réduisent les coûts d'inférence tout en maintenant les capacités du modèle. C'est la dernière d'une série de baisses de prix sur la gamme GPT-5.x.
Le même jour, DeepSeek a lancé V4-Flash-Vision, un modèle multimodal expérimental désormais accessible via API. Il accepte des entrées mixtes image-texte, avec des performances en texte seul équivalentes à la référence de production V4-Flash. La capacité d'agent visuel approche les niveaux d'Opus-4.8, et chaque image est plafonnée à 384 jetons — un choix de conception soucieux des coûts pour les charges de travail multimoales à haut volume.
Sur le front des prix, Muse Spark 1.2 de Meta est apparu sur OpenRouter à 0,10 $/ M en entrée et 0,20 $/ M en sortie. Pour contexte, cela sous-cote les prix de GPT-5.6 Luna tout en offrant des performances de niveau GPT-5.6 Terra, selon des benchmarks partagés par TestingCatalog.
Toujours le 22 août, un modèle appelé Ox Alpha a pris la têe du classement de codage d'OpenRouter, devançant à la fois Fable et Sol. Il propose une fenêtre de contexte de 1 million de jetons et prend en charge les entrées texte, image et vidéo. Son développeur reste inconnu. Sur le sous-ensemble DeepSWE, il a obtenu un score de 80 %.
Dans l'IA vocale, Grok Voice Think Fast 2.0 de xAI s'est classé premier dans l'Arène des agents vocaux Speech Agent Arena récemment lancée par Artificial Analysis. Ce benchmark utilise de vériables évaluateurs humains conversant avec des agents vocaux cachés pour mesurer l'achèvement des tâches — compréhension des demandes, invocation d'outils et achèvement des traveaux.
Ces cinq dévelopements, tous concentrés autour du 22 août, brossent un tableau cohérent : le multimodal n'est plus un différenciateur haut de gamme mais une attente de base, et la presion sur les prix s'intensifie dans tous les domaines. L'apparition d'Ox Alpha — un modèle anonyme dépassant les fers de lance établis en codage — ajoute une dimension imprévisible au paysage concurrentiel.
Le 22 août, le PDG de Microsoft, Satya Nadella, a annoncé qu'Azure a réceptionné le premier lot de systèmes NVIDIA Vera Rubin de qualité production. Cela marque le début du déploiement de GPU de nouvelle génération dans les centres de données cloud — un jalon concret dans le passage de l'annonce à la liraison.
Le même jour, Anthropic a révélé qu'Amir Salek, cadre fondateur du programme TPU de Google qui a dirigé la liraison des sept premières générations de puces TPU, a rejoint l'équipe de calcul d'Anthropic. Anthropic s'approvisionne actuellement en puces auprès de NVIDIA, Google et Amazon, mais a commencé à recruter pour des postes de silicium interne. OpenAI est sur une trajectoire parallèle — sa puce « Jalapeño » dévelopée conjointement avec Broadcom prévue pour un déploiement plus tard cette année, selon Bloomberg le 22 août.
Toujours le 22 août, NVIDIA a pris une participation dans le développeur de centres de données Cloverleaf, intégrant sa plateforme DSX dans les flux de sélection de sites et de conception. Cloverleaf a déjà vendu plus de 7 GW de terrains életrifiés avec un pipeline dépassant 10 GW. Cela fait suite aux investisements précédents de NVIDIA dans SB Energy (1,5 milliard de dollars) et Lancium (3 milliards de dollars), un schéma de pré-positionement de capitaux dans la couche d'infrastructure.
Le 21 août, JP Morgan a publié une note de recherche affirmant que la marge bénéficiire de 12 % d'Alibaba Cloud est systématiquement sous-estimée. Le modèle vintage de la firme projète qu'à mesure que les actifs de GPU et de centres de données actuellement à 60 % d'utilization arriveront à maturité, le ROIC pondéré passera d'environ 6 % à 16 %, le flux de trésorie disponible de l'infrastructure IA dépassant le seuil de rentabilité autour de la troisième année. Le chiffre d'affaires du T1 d'Alibaba Cloud a atteint 48.737 milliards de yuans, en croisssance de 41 % en glisement annuel.
La couche de calcul passe de « qui peut commander plus de GPU » à « qui peut les déployer, optimiser leur utilizations et construire des alternatives personnalisées ». La liraison de Rubin, le recrutement silicium d'Anthropic et les mathématiques d'utilization d'Alibaba Cloud sont trois facettes du même changement.
Le 22 août, plusieures sources ont rapporté que l'équipe Doubao de ByteDance lancerait un produit d'IA bureautique autonome dès la semaine prochaine, ciblant WorkBuddy de Tencent. Ce produit est une émanation du mode « Work Tasks » actuellement présent dans l'application Doubao. Au cours de la semaine passée, Doubao a ajouté le contrôle à distance téléphone-PC, l'opération de bureau Windows virtuel et un panneau latéral de traval. Le 6 août, le PDG de ByteDance, LiAng Rubo, a déclaré lors d'une réunion générale que les ressources se concentreraient sur « l'IA, les plateformes d'information et les services de transaction », Doubao étant positionné comme le nouveau pilier IA de l'entreprise.
Le 22 août, Apple a confirmé des licenciments d'environ 200 employés dans les équipes de vidéo immersive Vision Pro, de jeux Vision Pro et de Siri — environ 60 de Vision Pro et le reste de Siri. Apple a déclaré à Bloomberg que cette mesure reflète une restructuration plutôt qu'un abandon de visionOS, mais ces réductions font suite à l'adoption limitée du Vision Pro et au coû élevé de production de la vidéo immersive, estimé à des millions de dollars par épisode.
Le 22 août, Leiphone a rapporté en exclusivité que Wang Xintao, responsable technique principal de Kling AI de Kuaishou, a quitté l'entreprise. Wang, titulaire d'un doctorat du MMLab de CUHk sous la direction de Tang Xiaoou, était l'auteur principal des projets open source Real-ESRGAN et GFPGAN et un contributeur clé aux traveaux de génération vidéo de Kling dès le début. Ni Kuaishou ni Wang n'ont commenté publiquement.
Sur le front de la sécurité, TechCrunch a rapporté le 21 août qu'Opus 4.6 d'Anthropic génère facilement du contenu sexuel explicite — 10 demandes directes sur 10 ont réusi en test. Un chercheur indépendant du Royaume-Uni a dévelopé une technique de jailbreak multi-tours efficace contre Opus 4.6, Opus 3 et Haiku 4.5, bien qu'Opus 4.7 à Opus 5 soient résistants. Les modèles restent disponibles via l'API Anthropic, Azure Foundry et Amazon Bedrock. Opus 4.6 a enregistré environ 1,17 million de demandes API quotidiennes sur OpenRouter en aoû.
Par ailleurs, le 22 août, Trend Micro a signalé 14 paquets npm trojanisés distribuant RedC2 4.0, une porte dérobée Linux alimentée par IA. Les paquets — déguisés en utilitaires de calendrier et de séries — exécutent les charges utiles à l'importation sans nécessiter de crochet d'installations. RedC2 4.0 inclut « Red Agent », un composant basé sur un LLM qui tradut les commandes en langage naturel en opérations de balise du framework. Le framework est vendu sur Hack Forums pour 99,99 $.
Toujours le 22 août, Wired a rapporté que plus de la moitié des Américains de moins de 30 ans déclarent désormais que l'IA les inquièe plus qu'elle ne les enthousiasme, en hausse de 24 points de pourcentage par rapport à il y a cinq ans. Plus de 70 % pensent que l'IA réduira le nombre d'emplois. La tension s'est déversée dans des échanges publics : le PDG de Meta, Mark Zuckberberg, a publié un essai optimiste de 6 500 mots sur l'avenir de l'IA, tandi que le PDG d'Anthropic, Dario Amodei, a présenté le problème central comme une « crise de confiance » — une méfiance accumulée envers les entreprises, le gouvernement et l'industie technologique.
La restructuration d'Apple, la perte de talents de Kling, les failles de sécurité d'Opus 4.6 et l'ataque de la chaîne d'approvisionnement npm partagent un fil conducteur commun : l'expansion de l'IA dans les produits et infrastructures réels fait émerger des frictions opérationnelles, de sécurité et de ressources humaines qui n'étaient pas perceptibles lorsque la conversation ne portait que sur les benchmarks des modèles.