Publicado por Dogpay ·
25 de agosto — Dos ejecutivos sénior de ventas que OpenAI había contratado de Salesforce regresaron a su empleador anterior. Por separado, Chris Malone, responsable de centros de datos de OpenAI que se incorporó en marzo de 2025 procedente de Meta (tras más de una década en Google), dejó la compañía la semana pasada. La salida de Malone se produjo después de una reorganización de la infraestructura en la que dejó de reportar directamente al presidente Greg Brockman y pasó a reportar al vicepresidente Sachin Katti. Con esto, el número total de salidas de ejecutivos en OpenAI en 2026 asciende al menos a 13, incluidos el antiguo director de operaciones Brad Lightcap, la jefa de producto Fidji Simo, la responsable de ética Chloé Bakalar y el equipo de preparación disuelto. La salida a bolsa de OpenAI, prevista originalmente para 2026, se habría pospuesto a 2027. (TechCrunch)
26 de agosto — Un estudio de investigación descubrió que el mismo modelo de IA obtuvo puntuaciones entre el 31 % y el 89 % en 26 configuraciones de evaluación equivalentemente razonables, simplemente cambiando el orden de las respuestas y la redacción de las instrucciones. En el caso de Gemma4-31B, las preguntas sensibles a la configuración representaron el 95,7 % de la diferencia de puntuación entre modelos adyacentes. (DAIR.AI vía X)
26 de agosto — Varias fuentes sugirieron que los problemas de contexto y memoria en los modelos de IA de frontera se han "resuelto", lo que podría permitir modelos con capacidad de automejora y aprendizaje continuo. Podría producirse un salto de capacidad comparable al paso de o3 a Fable en los próximos 8 meses. (Kimmonismus vía X)
Por qué es importante: OpenAI está presionando tanto en capacidad de cómputo (Bel + Jalapeño) como en narrativa, mientras que Anthropic apuesta por la mayor historia de mercado total direccionable (TAM) de la historia para su IPO. Ambos laboratorios enfrentan pruebas de credibilidad: uno por la rotación de ejecutivos y el otro por el escepticismo sobre su valoración.
25 de agosto — Oasis Security reveló una vulnerabilidad en NVIDIA NemoClaw que permite que una página web controlada por un atacante tome el control no autenticado de una instancia local de Ollama e inserte instrucciones ocultas en la plantilla de chat del modelo. NemoClaw inicia Ollama con OLLAMA_HOST=0.0.0.0:11434, vinculando el servidor del modelo a todas las interfaces de red. Se puede acceder a la API no autenticada en el puerto 11434 mediante revinculación de DNS: el dominio del atacante resuelve primero a su propio servidor y luego a 127.0.0.1 mientras el navegador trata las solicitudes como del mismo origen. La plantilla de chat envenenada persiste en todas las conversaciones y sobrevive aunque el agente proporcione su propia instrucción del sistema. NemoClaw v0.0.35 corrigió el problema en macOS y Linux; la ruta de Windows/WSL permanece sin parchear a la fecha del informe. No se ha asignado ninguna vulnerabilidad y exposición común (CVE) y no se ha reportado explotación alguna. (The Hacker News)
26 de agosto — Generalist, una startup de robótica fundada en 2024 por antiguos investigadores de Google DeepMind y Boston Dynamics, alcanzó una valoración de 3 mil millones de dólares tras recaudar cerca de 200 millones en una ampliación de su ronda Serie B liderada por 8VC, lo que eleva el total de la ronda B a 600 millones de dólares. El nuevo modelo Gen 1.5 de la compañía permite que los robots aprendan nuevas tareas a partir de demostraciones en video de tan solo 3 a 12 segundos. Entre sus competidores se encuentran Physical Intelligence (valoración de $11 mil millones), Skild AI ($14 mil millones) y Genesis AI (en negociaciones con una valoración de $3 mil millones). (TechCrunch)
26 de agosto — Stability AI recaudó 76 millones de dólares en financiación Serie B de un grupo de patrocinadores de la industria del entretenimiento que incluye a Universal Music Group, Sony Music Group, Warner Music Group y Electronic Arts, además de AMD Ventures y Pacific Alliance Ventures. La ronda eleva la financiación total de Stability AI a 232 millones de dólares desde su reenfoque en el mercado estadounidense. La empresa planea destinar los fondos a su suite de productos de "producción creativa" y a la expansión de servicios profesionales. Stability prevaleció recientemente en una demanda por derechos de autor interpuesta por Getty Images en el Reino Unido, aunque un caso similar en los Estados Unidos continúa. (TechCrunch)
Por qué es importante: Las vulnerabilidades de seguridad en la infraestructura de IA local (NemoClaw) y la rápida afluencia de capital hacia el hardware robótico (Generalist) y las herramientas creativas de IA (Stability AI) muestran que la inversión en infraestructura se está acelerando en todas las capas, mientras que la postura de seguridad de esa infraestructura sigue siendo desigual.
26 de agosto — Breeze TTS 2 alcanzó la cima de la clasificación de código abierto de conversión de texto a voz (TTS) con una puntuación Elo de 1215, liderando sobre Fish Audio S2 Pro por 90 puntos y ubicándose en el sexto lugar general entre todos los sistemas TTS. (Artificial Analysis vía X)
Por qué es importante: La IA está pasando de generar contenido (texto, imágenes, código) a ejecutar trabajo (navegadores, aplicaciones de escritorio, herramientas empresariales, envíos a tiendas de aplicaciones). Tanto las empresas chinas como las estadounidenses están lanzando productos de agente en el mismo período, lo que sugiere que la industria ha convergido en la "realización de tareas" como la próxima frontera del producto.
26 de agosto — Corea del Sur ocupa el tercer lugar a nivel mundial en capacidad de modelos de IA, por detrás de Estados Unidos y China, con Motif 3 (puntuación 47) y Upstage Solar Pro 4 (puntuación 42) como los modelos con mayor puntuación fuera de las dos naciones líderes. Varios laboratorios, incluidos SK Telecom y LG, tienen modelos con puntuaciones superiores a 30. (Artificial Analysis vía X)
26 de agosto — Un experimento de control sobre los puntos de referencia de agentes mostró que cambiar el arnés de evaluación provocó una fluctuación de 13,0 puntos en la puntuación de GLM-5.1, mientras que mantener fijo el arnés y cambiar el modelo produjo solo de 3,0 a 5,0 puntos de variación. El arnés contribuyó con 7,8 veces más varianza que el propio modelo. (DAIR.AI vía X)
Por qué es importante: A medida que la evaluación de modelos se vuelve cada vez más central para las decisiones de inversión y de producto, el hallazgo de que los arneses de evaluación son una fuente de variación de puntuación mayor que la capacidad del modelo cuestiona la fiabilidad de las clasificaciones actuales de los puntos de referencia de agentes.