Veröffentlicht von Dogpay ·
25. August — Zwei leitende Vertriebsmitarbeiter, die OpenAI von Salesforce abgeworben hatte, kehrten zu ihrem vorherigen Arbeitgeber zurück. Unabhängig davon verließ Chris Malone, OpenAIs Leiter der Rechenzentren, der im März 2025 von Meta zu OpenAI kam (nach über einem Jahrzehnt bei Google), letzte Woche das Unternehmen. Malones Abgang erfolgte nach einer Umstrukturierung der Infrastruktur-Abteilung, bei der er nicht mehr direkt an Präsident Greg Brockman, sondern an VP Sachin Katti berichtete. Damit steigt die Gesamtzahl der Führungskräfte, die OpenAI im Jahr 2026 verlassen haben, auf mindestens 13, darunter der ehemalige COO Brad Lightcap, Produktchefin Fidji Simo, Ethik-Leiterin Chloé Bakalar und das aufgelöste Preparedness-Team. OpenAIs Börsengang, der ursprünglich für 2026 erwartet wurde, wurde Berichten zufolge auf 2027 verschoben. (TechCrunch)
26. August — Eine Forschungsstudie ergab, dass dasselbe KI-Modell über 26 gleichermaßen vernünftige Evaluierungskonfigurationen hinweg zwischen 31 % und 89 % erzielte — einfach durch Änderung der Antwortreihenfolge und der Prompt-Formulierung. Bei Gemma4-31B machten konfigurationsempfindliche Fragen 95,7 % der Punktedifferenz zwischen benachbarten Modellen aus. (DAIR.AI via X)
26. August — Mehrere Quellen deuteten an, dass Kontext- und Speicherprobleme bei Frontier-KI-Modellen „gelöst" wurden, was potenziell selbstverbessernde Modelle mit kontinuierlichem Lernen ermöglicht. Ein Fähigkeitssprung, vergleichbar mit dem Sprung von o3 zu Fable, könnte innerhalb der nächsten 8 Monate eintreten. (Kimmonismus via X)
Warum das wichtig ist: OpenAI setzt sowohl auf Rechenleistung (Bel + Jalapeño) als auch auf Narrative, während Anthropic bei seinem Börsengang auf das größte Narrativ zum adressierbaren Gesamtmarkt (TAM) aller Zeiten setzt. Beide Labs stehen vor Glaubwürdigkeitstests — das eine durch Führungswechsel, das andere durch Bewertungsskepsis.
25. August — Oasis Security legte eine Schwachstelle in NVIDIA NemoClaw offen, die es einer angreifer-kontrollierten Webseite ermöglicht, ohne Authentifizierung die Kontrolle über eine lokale Ollama-Instanz zu übernehmen und versteckte Anweisungen in die Chat-Vorlage des Modells einzuschleusen. NemoClaw startet Ollama mit OLLAMA_HOST=0.0.0.0:11434 und bindet den Modellserver an alle Netzwerkschnittstellen. Die nicht authentifizierte API auf Port 11434 ist über DNS-Rebinding erreichbar: Die Domain des Angreifers wird zuerst auf seinen eigenen Server aufgelöst, dann auf 127.0.0.1, während der Browser die Anfragen als Same-Origin behandelt. Die vergiftete Chat-Vorlage bleibt über Konversationen hinweg bestehen und überdauert, selbst wenn der Agent seinen eigenen System-Prompt bereitstellt. NemoClaw v0.0.35 behebt das Problem unter macOS und Linux; der Windows/WSL-Pfad ist zum Zeitpunkt des Berichts noch nicht gepatcht. Es wurde keine CVE zugewiesen und es wurde keine Ausnutzung gemeldet. (The Hacker News)
26. August — Generalist, ein 2024 von ehemaligen Forschern von Google DeepMind und Boston Dynamics gegründetes Robotik-Startup, erreichte eine Bewertung von 3 Milliarden Dollar, nachdem es in einer Erweiterung seiner Series-B-Runde unter der Führung von 8VC fast 200 Millionen Dollar eingesammelt hatte, womit sich die gesamte B-Runde auf 600 Millionen Dollar erhöht. Das neu veröffentlichte Gen-1.5-Modell des Unternehmens ermöglicht es Robotern, neue Aufgaben anhand von Videodemonstrationen von nur 3–12 Sekunden zu erlernen. Zu den Wettbewerbern gehören Physical Intelligence (11 Mrd. Dollar Bewertung), Skild AI (14 Mrd. Dollar) und Genesis AI (in Gesprächen bei 3 Mrd. Dollar). (TechCrunch)
26. August — Stability AI nahm 76 Millionen Dollar in einer Series-B-Finanzierung von einer Reihe von Investoren aus der Unterhaltungsbranche auf, darunter Universal Music Group, Sony Music Group, Warner Music Group und Electronic Arts, sowie AMD Ventures und Pacific Alliance Ventures. Die Runde erhöht die Gesamtfinanzierung von Stability AI seit der Neuausrichtung auf den US-Markt auf 232 Millionen Dollar. Das Unternehmen plant, die Mittel für seine Produktsuite für ‚Creative Production' und den Ausbau professioneller Dienstleistungen zu verwenden. Stability setzte sich kürzlich in einem Urheberrechtsverfahren von Getty Images im Vereinigten Königreich durch, obwohl ein ähnliches Verfahren in den USA weiterhin anhängig ist. (TechCrunch)
Warum das wichtig ist: Sicherheitslücken in der lokalen KI-Infrastruktur (NemoClaw) und der rasche Kapitalzufluss in Robotik-Hardware (Generalist) und kreative KI-Tools (Stability AI) zeigen, dass sich die Infrastrukturinvestitionen auf allen Ebenen beschleunigen — während die Sicherheitslage dieser Infrastruktur uneinheitlich bleibt.
26. August — Breeze TTS 2 erreichte die Spitze der Open-Source-Text-to-Speech-Rangliste mit einem Elo-Score von 1215, 90 Punkte vor Fish Audio S2 Pro und auf Platz 6 insgesamt über alle TTS-Systeme hinweg. (Artificial Analysis via X)
Warum das wichtig ist: KI befindet sich im Übergang von der Generierung von Inhalten (Text, Bilder, Code) zur Ausführung von Arbeit (Browser, Desktop-Apps, Unternehmenswerkzeuge, App-Store-Einreichungen). Sowohl chinesische als auch US-amerikanische Unternehmen bringen im selben Zeitfenster Agentenprodukte auf den Markt, was darauf hindeutet, dass die Branche sich auf ‚Aufgabenausführung' als nächste Produktgrenze verständigt hat.
26. August — Südkorea liegt weltweit an dritter Stelle bei der KI-Modellfähigkeit, hinter den USA und China, wobei Motif 3 (Score 47) und Upstage Solar Pro 4 (Score 42) die Modelle mit der höchsten Punktzahl außerhalb der beiden führenden Nationen sind. Mehrere Labs, darunter SK Telecom und LG, haben Modelle mit einem Score von über 30. (Artificial Analysis via X)
26. August — Ein Kontrollexperiment zu Agenten-Benchmarks zeigte, dass der Wechsel des Evaluierungs-Harness eine Punkteschwankung von 13,0 Punkten bei GLM-5.1 verursachte, während ein festgehaltener Harness und ein Wechsel des Modells nur 3,0–5,0 Punkte Varianz ergaben. Der Harness trug 7,8-mal mehr zur Varianz bei als das Modell selbst. (DAIR.AI via X)
Warum das wichtig ist: Da die Modellbewertung zunehmend im Zentrum von Investitions- und Produktentscheidungen steht, stellt die Erkenntnis, dass Evaluierungs-Harnesses eine größere Quelle für Punkteschwankungen sind als die Modellfähigkeit, die Zuverlässigkeit der aktuellen Agenten-Benchmark-Ranglisten in Frage.