Publié par Dogpay ·
25 août — Deux cadres supérieurs commerciaux embauchés par OpenAI auprès de Salesforce sont retournés chez leur ancien employeur. Par ailleurs, Chris Malone, responsable des centres de données d’OpenAI, arrivé en mars 2025 en provenance de Meta (après plus d’une décennie chez Google), a quitté l’entreprise la semaine dernière. Le départ de Malone fait suite à une réorganisation de l’organisation des infrastructures, dans le cadre de laquelle il a cessé de rendre compte directement au président Greg Brockman pour relever du vice-président Sachin Katti. Cela porte à au moins 13 le nombre total de départs de cadres dirigeants chez OpenAI en 2026, dont l’ancien directeur des opérations (COO) Brad Lightcap, la responsable produit Fidji Simo, la responsable de l’éthique Chloé Bakalar, et l’équipe de préparation dissoute. L’introduction en bourse d’OpenAI, initialement prévue pour 2026, aurait été repoussée à 2027. (TechCrunch)
26 août — Une étude a révélé que le même modèle d’IA obtenait un score compris entre 31 % et 89 % sur 26 configurations d’évaluation également raisonnables, simplement en modifiant l’ordre des réponses et la formulation des invites. Pour Gemma4-31B, les questions sensibles à la configuration représentaient 95,7 % de l’écart de score entre modèles adjacents. (DAIR.AI via X)
26 août — Plusieurs sources ont indiqué que les problèmes de contexte et de mémoire dans les modèles d’IA de pointe auraient été « résolus », ouvrant la voie à des modèles capables de s’auto-améliorer avec un apprentissage continu. Un bond de capacité comparable au saut entre o3 et Fable pourrait se produire dans les 8 prochains mois. (Kimmonismus via X)
Ce qui est en jeu : OpenAI mise à la fois sur la puissance de calcul (Bel + Jalapeño) et sur le discours, tandis qu’Anthropic parie sur le plus grand récit de marché total adressable (TAM) de l’histoire pour son introduction en bourse. Les deux laboratoires sont confrontés à des tests de crédibilité — l’un du fait du turnover des cadres, l’autre du scepticisme sur la valorisation.
25 août — Oasis Security a divulgué une vulnérabilité dans NVIDIA NemoClaw qui permet à une page web contrôlée par un attaquant de prendre le contrôle non authentifié d’une instance locale d’Ollama et d’injecter des instructions cachées dans le modèle de conversation du modèle. NemoClaw démarre Ollama avec OLLAMA_HOST=0.0.0.0:11434, liant le serveur du modèle à toutes les interfaces réseau. L’API non authentifiée sur le port 11434 est accessible via rebinding DNS : le domaine de l’attaquant se résout d’abord vers son propre serveur, puis vers 127.0.0.1, tandis que le navigateur traite les requêtes comme étant de même origine. Le modèle de conversation empoisonné persiste d’une conversation à l’autre et résiste à la fourniture par l’agent de sa propre invite système. NemoClaw v0.0.35 a corrigé le problème sur macOS et Linux ; le chemin Windows/WSL reste non corrigé à la date du rapport. Aucun CVE n’a été attribué et aucune exploitation n’a été signalée. (The Hacker News)
26 août — Generalist, une startup de robotique fondée en 2024 par d’anciens chercheurs de Google DeepMind et Boston Dynamics, a atteint une valorisation de 3 milliards de dollars après avoir levé près de 200 millions de dollars dans le cadre d’une extension de son tour de table de série B mené par 8VC, portant le montant total du tour de série B à 600 millions de dollars. Le modèle Gen 1.5 récemment dévoilé par l’entreprise permet aux robots d’apprendre de nouvelles tâches à partir de démonstrations vidéo d’une durée allant de 3 à 12 secondes. Parmi ses concurrents figurent Physical Intelligence (valorisation de 11 milliards de dollars), Skild AI (14 milliards de dollars) et Genesis AI (en discussions pour une valorisation de 3 milliards de dollars). (TechCrunch)
26 août — Stability AI a levé 76 millions de dollars lors d’un tour de table de série B auprès d’un ensemble de soutiens de l’industrie du divertissement, parmi lesquels Universal Music Group, Sony Music Group, Warner Music Group et Electronic Arts, ainsi qu’AMD Ventures et Pacific Alliance Ventures. Ce tour de table porte le financement total de Stability AI à 232 millions de dollars depuis son recentrage sur le marché américain. L’entreprise prévoit d’utiliser les fonds pour sa suite de produits de « production créative » et l’expansion de ses services professionnels. Stability a récemment obtenu gain de cause dans un procès pour violation de droits d’auteur intenté par Getty Images au Royaume-Uni, bien qu’une affaire similaire aux États-Unis soit toujours en cours. (TechCrunch)
Ce qui est en jeu : Les vulnérabilités de sécurité dans l’infrastructure d’IA locale (NemoClaw) et l’afflux rapide de capitaux dans le matériel robotique (Generalist) et les outils d’IA créative (Stability AI) montrent que l’investissement dans les infrastructures s’accélère à tous les niveaux, tandis que la posture de sécurité de ces infrastructures reste inégale.
26 août — Breeze TTS 2 s’est hissé en tête du classement de la synthèse vocale open source avec un score Elo de 1215, devançant Fish Audio S2 Pro de 90 points et se classant 6e au classement général parmi tous les systèmes de synthèse vocale (TTS). (Artificial Analysis via X)
Ce qui est en jeu : L’IA passe de la génération de contenu (texte, images, code) à l’exécution de tâches (navigateurs, applications de bureau, outils d’entreprise, soumissions sur les boutiques d’applications). Les entreprises chinoises comme américaines lancent des produits d’agents dans la même fenêtre, ce qui suggère que l’industrie a convergé vers l’« exécution de tâches » comme nouvelle frontière produit.
26 août — La Corée du Sud se classe troisième au niveau mondial en matière de capacité des modèles d’IA, derrière les États-Unis et la Chine, avec Motif 3 (score 47) et Upstage Solar Pro 4 (score 42) comme les modèles les mieux notés en dehors des deux pays leaders. Plusieurs laboratoires, dont SK Telecom et LG, ont des modèles dépassant le score de 30. (Artificial Analysis via X)
26 août — Une expérience de contrôle sur les benchmarks d’agents a montré que le changement du harnais d’évaluation a provoqué une fluctuation de score de 13,0 points pour GLM-5.1, tandis que le fait de garder le harnais fixe et de changer le modèle ne produisait qu’une variance de 3,0 à 5,0 points. Le harnais contribuait à une variance 7,8 fois supérieure à celle du modèle lui-même. (DAIR.AI via X)
Ce qui est en jeu : Alors que l’évaluation des modèles devient de plus en plus centrale pour les décisions d’investissement et de produit, le constat que les harnais d’évaluation sont une source de variance des scores plus importante que le modèle lui-même remet en question la fiabilité des classements actuels des benchmarks d’agents.