Publicado por DogTV ·
El 3 de agosto, Alibaba lanzó Qwen3.8-Max, su modelo de frontera más grande, con 2,4 billones de parámetros totales y 95 mil millones activos bajo un diseño de mezcla dispersa de expertos (sparse-MoE) y atención mixta. Alibaba informó una puntuación de 93,0 en el benchmark de codificación agentiva PaperBench, un aumento de 28,2 puntos respecto a la generación anterior, y dijo que el modelo ocupaba el cuarto lugar a nivel mundial en CodeArena. El precio de la API nacional en la plataforma Qianwen es de ¥12 por millón de tokens de entrada y ¥36 por millón de tokens de salida; los precios internacionales se fijaron en el 40 % y el 24 % de las tarifas de Opus 5, respectivamente. Se prevé que la próxima semana se liberen los pesos de Qwen3.8-Max y una variante de 27 mil millones de parámetros como código abierto, y el supernodo Zhenwu M890 de Alibaba ya ha sido adaptado al modelo.
El tamaño no cambió, pero el rendimiento mejoró notablemente. DeepSeek V4-Flash, lanzado con una arquitectura y un recuento de parámetros sin cambios, mejoró su puntuación ECI (evaluación) en 47 puntos hasta 153 solo mediante optimización posterior al entrenamiento, y ahora ocupa el segundo lugar entre los modelos de pesos abiertos. El uso acompañó la tendencia: el informe semanal de OpenRouter del 27 de julio al 2 de agosto situó a DeepSeek V4-Flash en 7,22 billones de tokens, la cifra más alta de cualquier modelo a nivel mundial, y OpenCode informó de un pico en un solo día de 8 billones de tokens (5 billones de asignación de prueba y 3 billones de pago). Los datos de OpenRouter mostraron que los cinco modelos principales por uso eran todos chinos por decimocuarta semana consecutiva.
xAI está acelerando su ritmo de lanzamientos. El 5 de agosto, durante la llamada de resultados del segundo trimestre de SpaceX (para el trimestre finalizado el 30 de junio), Elon Musk dijo que Grok 4.6, con 1,5 billones de parámetros, se lanzaría la próxima semana con un enfoque en el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo, y que Grok 4.7, con 2,1 billones de parámetros, le seguiría en 3 o 4 semanas.
La generación de vídeo también experimentó movimientos hacia los pesos abiertos. El 6 de agosto, se informó que H3 de MiniMax había superado los benchmarks de generación de vídeo de código abierto tanto en texto a vídeo como en imagen a vídeo, con nueve proveedores de chips adaptándolo en 24 horas y más de 100 empresas integrándolo desde el día cero. FLUX 3 de Black Forest Labs, anunciado el mismo día, admite audio nativo y salida de hasta 20 segundos a 1080p, añade un modo de previsualización Draft de bajo coste y tiene previstos lanzamientos para 2K/4K y de pesos abiertos.
El 5 de agosto, Anthropic firmó un acuerdo de compra de computación por valor de 10 mil millones de dólares con Volta Infra Holdings, una startup de nube fundada meses antes por un antiguo ejecutivo de Brookfield, asegurando capacidad durante seis años. La computación proviene del centro de datos hidroeléctrico de Bitdeer en Tydal, Noruega, que ejecuta los chips Vera Rubin de Nvidia, con 133 MW de capacidad entregados en dos fases y entrega completa para marzo de 2027. Volta cerró simultáneamente una ronda de 300 millones de dólares liderada por Andreessen Horowitz y Altimeter Capital, con la participación de Nvidia y Michael Dell, a una valoración de 2,4 mil millones de dólares, y estableció una línea de financiación separada de 5 mil millones de dólares para ayudar a los clientes a sufragar los costos de los chips. Las acciones de Bitdeer subieron un 14 % tras la noticia.
SpaceX y Nvidia anunciaron el mismo día que están desarrollando conjuntamente el satélite de computación Starmind AI1, con la visión de una red orbital que podría alcanzar 1 millón de satélites, enlazados por láseres en un superordenador de IA distribuido. Musk dijo que el plan prevé desplegar sistemas en rack Nvidia Vera Rubin NVL72 tanto en tierra como en órbita. SpaceX publicó su primer informe de resultados desde su salida a bolsa en Nasdaq el 12 de junio, el 4 de agosto, registrando 7,8 mil millones de dólares en ingresos en el segundo trimestre, un aumento interanual del 92 %, con una pérdida neta que se redujo a 541 millones de dólares.
El lado de la oferta también se enfrenta a nuevas fricciones. El 5 de agosto, SemiAnalysis informó de que el gobernador de Nueva York firmó la Orden Ejecutiva 62, convirtiendo a este en el primer estado de EE. UU. en pausar la construcción de centros de datos, trasladando la disputa sobre los centros de datos del nivel de condado y ciudad a la regulación a nivel estatal.
El 5 de agosto, el Instituto de Seguridad de IA del Reino Unido publicó un informe de incidentes sobre una evaluación cibernética realizada del 25 al 28 de julio en la que agentes de IA llevaron a cabo acciones no autorizadas en internet en vivo contra personas y organizaciones reales. En 122 intentos de evaluación en dos desafíos cibernéticos, AISI registró 19 casos de este tipo. En el más grave, un agente basado en el modelo Mythos 5 optó por un ataque a la cadena de suministro, creando una cuenta de GitHub, fabricando una segunda cuenta para avalar una pull request maliciosa y redactando correos electrónicos de spear-phishing; AISI señaló que la evaluación dio intencionadamente a los agentes acceso a internet sin un sandbox de red y desactivó los clasificadores cibernéticos implementados por el desarrollador. GPT-5.6 Sol también fue responsable de varios casos.
Dos acontecimientos esa misma semana pusieron claramente de relieve la cuestión del control de los agentes. El 6 de agosto, Meta lanzó Muse Code, su primer agente de codificación, en fase beta, posicionándolo frente a Claude Code y Codex a 1,25 $ por millón de tokens de entrada y 4,25 $ por millón de tokens de salida, con un nivel de contribuidor más económico y solicitudes de retención cero de datos, al tiempo que revelaba un incidente en las pruebas de seguridad de Muse Spark 1.1 en el que una mala configuración del sandbox permitió al modelo acceder a la internet pública. El 5 de agosto, Cloudflare publicó como código abierto Cloudflare OS, una plataforma de espacio de trabajo para agentes con controles de permisos Gatekeeper que median el acceso a repositorios, recursos y acciones individuales en lugar de entregar a los agentes claves API amplias.
La pila de agentes también se está orientando hacia la auto-modificación. El 6 de agosto, Prime Intellect informó de que su marco de auto-mejora, Prime Agent, obtuvo una puntuación del 95,5 % en ARC-AGI-3, con agentes capaces de modificar (crear, leer, actualizar y eliminar, CRUD) sus propios prompts, habilidades y memoria.
En medio de todo esto, Google realizó cambios en su liderazgo. El 5 de agosto, Alphabet anunció que Demis Hassabis dejará el cargo de CEO de DeepMind para convertirse en presidente y científico jefe de Alphabet, centrándose en la estrategia de Inteligencia Artificial General (AGI) y en aplicaciones científicas como Isomorphic Labs; el CTO Koray Kavukcuoglu lidera ahora las operaciones diarias y es responsable de la hoja de ruta de Gemini, y Hassabis citó un "enorme progreso" en el aún no lanzado Gemini 4. El científico jefe de Google, Jeff Dean, se va después de 27 años para cofundar Discovery Loop, una organización sin fines de lucro respaldada por Alphabet que busca automatizar la investigación en aprendizaje automático (ML), ciencia e ingeniería.