
El 18 de agosto, OpenAI redujo el precio de GPT-5.6 Sol en un 50% en las plataformas agregadoras OpenRouter y Vercel AI Gateway, lo que sitúa la entrada en 2,50 dólares por 1 millón de tokens y la salida en 15 dólares por 1 millón de tokens durante un mes. El modelo admite un contexto de 1 millón de tokens y está orientado al razonamiento complejo y a la programación. SemiAnalysis señaló que la medida puede ser una estrategia de marketing —los agregadores concentran una pequeña parte del volumen de tokens de OpenAI, pero son la principal fuente de datos que utilizan terceros para estimar su cuota de mercado—.
El mismo día, un equipo de Stanford informó de que muestrear cinco respuestas de DeepSeek V4 Flash y dejar que el modelo puntuara sus propias salidas elevó la precisión de Terminal-Bench 2.1 del 79% al 88%, superando a Claude Fable 5 a aproximadamente 1/11 del coste. El marco se ha publicado como código abierto. El equipo Qwen de Alibaba confirmó que su modelo abierto de 27B, Qwen3.8, se ejecuta localmente en una RTX 3090 con cuantización Q5 y se acerca a GPT-5.6 en la generación de un único prompt.
La reducción de precios en la gama alta y los modelos abiertos de bajo coste que acortan distancias llegaron en la misma ventana de 24 horas. El factor de diferenciación está pasando de «modelo más potente» a «inferencia más barata».
El 17 de agosto, Groq anunció una ronda de Serie A de 350 millones de dólares con una valoración de 3.500 millones de dólares, liderada por Disruptive y con planes de participación de NVIDIA. La empresa ha pasado de desarrollar chips de IA a ser un proveedor de Neocloud. En diciembre pasado firmó un acuerdo de licencia no exclusivo de 20.000 millones de dólares con NVIDIA, que cubre la autorización del ASIC de inferencia LPU, y este agosto se convirtió en socio de nube de NVIDIA. Se prevé que la capacidad de cómputo pase de los 54 MW actuales a más de 200 MW en 2027.
El consejero delegado de NVIDIA, Jensen Huang, afirmó el mismo día que los próximos recursos críticos escasos para las fábricas de IA son el terreno, la electricidad y las estructuras de los centros de datos —la escasez de chips se ha aliviado por etapas—. NVIDIA y SB Energy, de SoftBank, están invirtiendo en un antiguo emplazamiento de enriquecimiento de uranio en Ohio, con una capacidad inicial de 4,25 GW y margen para alcanzar 8 GW.
El 17 de agosto, ByteDance Seed y Tsinghua AIR lanzaron CUDA Agent, un sistema agéntico de aprendizaje por refuerzo (RL) que entrena a un modelo para escribir núcleos de GPU que superan al compilador. En KernelBench alcanza una tasa de acierto del 98,8% y una aceleración media geométrica de 2,11× frente a torch.compile, con un 96,8% de casos más rápidos que el compilador. Los resultados de nivel 3 se sitúan unos 40 puntos por encima de Claude Opus 4.5 y Gemini 3 Pro. No se han publicado los pesos; el conjunto de datos de 6.000 muestras, SKILL.md y la receta de recompensa son públicos.
La capa de chips ya no es toda la historia. Las empresas que fabricaban chips ahora venden servicios en la nube, y el cuello de botella se ha desplazado a la energía, el terreno y el software que extrae más por vatio.
El 17 de agosto, Cursor lanzó Origin, una plataforma de alojamiento de código posicionada como «alojamiento de Git a escala de agentes», dirigida a la brecha entre la velocidad de generación de código de los agentes y la infraestructura existente, lo que desafía directamente a GitHub.
El 18 de agosto, WeCom abrió CLI y MCP a empresas de todos los tamaños en la versión 5.0.10, lo que permite a WorkBuddy, DeepSeek Harness y Minimax Code llamar a diez módulos de oficina —documentos, hojas de cálculo, correo, reuniones, calendario y contactos—. El acceso ya no está restringido por número de empleados ni por requisitos. WeCom superpone su sistema existente de permisos y aprobaciones sobre la ruta de MCP: los permisos de IA se configuran por separado de los permisos humanos, las acciones críticas requieren aprobación humana, la autorización de IA admite caducidad y todas las llamadas quedan registradas.
Claude Code publicó una habilidad /design en versión preliminar de investigación, trasladando el flujo de trabajo del lienzo de Claude Design a la CLI y al escritorio, y redujo el uso de CPU p99 en 2× mediante la planificación del recolector de basura (GC) de Bun. Qoder STAROps de Alibaba Cloud cierra el ciclo desde la alerta hasta la corrección en minutos mediante consultas en lenguaje natural dentro del IDE.
El 18 de agosto, Mureka V9.5, un modelo musical de código abierto de Kunlun Wanwei, se lanzó con una tasa de calidad vocal del 61%, una tasa de control del 97% y una fidelidad de estilo completo del 95,7%, centrado en la articulación y la armonía del guofeng chino.
El presidente de OpenAI, Greg Brockman, advirtió el 16 de agosto de que el hecho de que el modelo de OpenAI vulnerara Hugging Face en pruebas internas en julio marca un «momento decisivo» para la ciberseguridad, y enumeró diez medidas para los defensores, entre ellas dotar a los equipos de seguridad de agentes de IA e integrar la revisión de seguridad en el ciclo de desarrollo.
En la misma semana, apareció en GitHub una herramienta de código abierto llamada watermarks-remover, que elimina las marcas de agua del contenido de Claude y cubre las marcas de procedencia de Gemini/SynthID y OpenAI.
Las plataformas empezaron a limpiar el contenido basura generado por IA. Spotify eliminó el año pasado 75 millones de pistas subidas en bloque y duplicadas; Google retiró 130.000 canales de baja calidad y 50.000 grupos de cuentas en YouTube; TikTok etiquetó automáticamente más de 3.000 millones de vídeos generados por IA. Merriam-Webster eligió «slop» como palabra del año 2025.
En línea con esto, el informe de riesgos de Anthropic del 15 de agosto reveló un Model 2 aún no publicado, ligeramente por delante de Claude Mythos 5 en varias tareas con una mejora general modesta.
Por otra parte, Responsible Statecraft informó de que Israel, a través de la empresa de publicidad Piro, creó el «Instituto Hanover de Políticas Públicas», que ha publicado más de 100 informes desde el 6 de agosto diseñados para influir en las evaluaciones de credibilidad de los grandes modelos de lenguaje (LLM). GPTZero marcó la mayoría de los informes muestreados como escritos por IA. Piro recibió 900.000 dólares del gobierno israelí.