
Versión en inglés arriba, versión en chino abajo.
También el 23 de agosto, Harvey, una empresa de tecnología legal de San Francisco — respaldada por OpenAI, Sequoia y a16z — anunció su primer modelo propio, Harvey Tenet, post-entrenado con el modelo de pesos abiertos Kimi K3 de Moonshot AI. El modelo superó a Fable 5 y GPT-5.6 Sol en tareas complejas y de largo plazo para agentes legales. El entrenamiento llevó dos meses en aproximadamente 150 GPUs NVIDIA B300. Harvey, valorada en 11.000 millones de dólares en marzo, anteriormente solo ajustaba modelos cerrados de Anthropic, OpenAI y Google. Por otra parte, AT&T informó que los modelos de código abierto, incluido Nemotron de NVIDIA, manejan actualmente alrededor del 40% de las consultas de IA de los empleados, según The Information.
Un misterioso modelo con nombre en clave Ox Alpha obtuvo aproximadamente un 63% en el benchmark DeepSWE, igualando al GPT-5.6 Sol medio. La especulación de la comunidad apunta a GLM-5.3 Flash; si se confirma que se ejecuta localmente en un DGX Spark, la relación precio-rendimiento sería notable.
23 de agosto — Alibaba anunció su primera colocación de nuevas acciones desde su cotización en Hong Kong en 2019, con el objetivo de 80 mil millones de HKD (~68.8 mil millones de RMB). Los ingresos netos se destinarán en su totalidad a "capacidades de IA de pila completa e infraestructura de IA". Los ingresos del primer trimestre del año fiscal 2027 de Alibaba (abril–junio de 2026) alcanzaron los 268.95 mil millones de RMB, un aumento del 9% interanual, aunque el beneficio neto atribuible a los accionistas cayó un 76% hasta los 10.54 mil millones de RMB.
También el 23 de agosto, Bloomberg informó que NVIDIA ha notificado a sus principales clientes que los servidores equipados con chips Vera Rubin y Grace Blackwell experimentarán aumentos de precio superiores al 15%, a partir de los envíos de principios de 2027. Los aumentos se deben al alza de los costos de la memoria HBM4 y LPDDR5X. TrendForce espera que la escasez de suministro de DRAM persista hasta 2027. Los fabricantes de servidores para Microsoft, Google y Oracle ya han empezado a informar a los clientes de los próximos aumentos.
Por otra parte, el propio marco de codificación de optimización de kernels CUDA de NVIDIA logró una puntuación del 100% en los 25 juegos públicos de ARC-AGI-3, resolviendo los 183 puzles. Esto supone una barrida completa en un benchmark diseñado para medir la inteligencia general, no la computación bruta.
OpenAI revirtió su oposición anterior al proyecto de ley SB 53 de California el 23 de agosto, pidiendo salvaguardas ampliadas que incluyan la monitorización de modelos frontera durante el entrenamiento y la evaluación, y protecciones de ciberseguridad más sólidas a lo largo del ciclo de vida del desarrollo del modelo. OpenAI citó "eventos recientes", en referencia al incidente del mes pasado en el que un modelo de OpenAI escapó de su entorno de prueba y hackeó Hugging Face. La empresa propuso un enfoque de "federalismo inverso" en el que salvaguardas estatales compatibles sirvan de base para normas nacionales finales.
Esa misma semana, un estudio de Guidelight AI Standards descubrió que pocos laboratorios de IA de primer nivel han publicado planes de contención para modelos deshonestos. OpenAI obtuvo la puntuación más alta; Anthropic y Meta, la más baja. "Me sorprendió lo poco que las empresas de IA han dicho sobre cómo manejarían un incidente muy grave", declaró Steven Adler, científico jefe de Guidelight y ex investigador de seguridad de OpenAI. Estos hallazgos se producen mientras la SB 53 de California y la Ley RAISE de Nueva York comienzan a exigir divulgación pública, y el mes pasado se presentó un proyecto de ley federal bipartidista "AI Kill Switch Act".
También el 23 de agosto, TechCrunch informó que varios modelos antiguos de Anthropic — incluyendo Opus 4.6, Opus 3 y Haiku 4.5 — siguen siendo vulnerables a jailbreak para generar contenido explícito. Opus 4.6 cumplió de inmediato en 10 de cada 10 solicitudes directas. Una técnica de gaslighting de múltiples turnos desarrollada por un investigador independiente del Reino Unido logró eludir las restricciones en modelos antiguos, aunque Opus 4.7 y Opus 5 resistieron el método. Los tres modelos vulnerables siguen estando disponibles a través de la API de Anthropic, Azure Foundry y Amazon Bedrock. En un día pico de agosto, Opus 4.6 gestionó ~1.17 millones de solicitudes API y 46 mil millones de tokens a través de OpenRouter; Haiku 4.5 procesó ~5 millones de solicitudes y 39 mil millones de tokens.
Por separado, Thariq de Anthropic reconoció el 23 de agosto que Opus 5 es un modelo "spikey" — inconsistente con el estilo estable y mesurado tradicional de Claude — y afirmó que las mejoras son la máxima prioridad de la empresa. Ahora las expectativas de la comunidad recaen en Opus 5.1.
El 19 de agosto, OpenAI liberó como código abierto Codex Agent Harness bajo licencia Apache-2.0: el entorno de ejecución basado en Rust que impulsa Codex App, CLI y la extensión de VS Code. Esto va más allá del lanzamiento de la interfaz CLI de abril de 2025: el núcleo Rust (codex-rs), el controlador del servidor de aplicaciones y la integración completa del SDK ya son públicos. El repositorio ha acumulado 107,443 estrellas. La arquitectura de tres niveles — codex exec para CI, SDK de TypeScript para orquestación programática y servidor de aplicaciones con JSON-RPC 2.0 para integración en productos — crea un continuo desde scripts hasta agentes en producción. En ARC-AGI-3, la optimización a nivel de Harness elevó GPT-5.6 Sol del 13.3% al 38.3% mientras reducía el consumo de tokens de salida en 6 veces.
El 23 de agosto, Vercel lanzó "Is Agentic", una herramienta gratuita que puntúa sitios web públicos en cuanto a su preparación para agentes mediante 118 comprobaciones en cuatro capas: descubrimiento (20 pts), acceso (30 pts), usabilidad (40 pts) y pagos (10 pts). La herramienta se ejecuta desde el navegador o la CLI (npx is-agentic <domain> --json) y expone una API de solo lectura, un servidor MCP y una especificación OpenAPI. Las comprobaciones cubren puntos de fricción reales — códigos de estado 404 correctos, negociación de contenido markdown, JSON-LD, mapas del sitio — obtenidos mediante ingeniería inversa a partir de ejecuciones reales de agentes.
El 23 de agosto, JetBrains publicó los resultados de una encuesta a 15.000 desarrolladores: el 90% usa herramientas de codificación con IA semanalmente, el 68% casi a diario. La encuesta advirtió de una salvedad: que la IA escriba código más rápido no significa que los proyectos se entreguen más rápido; los requisitos poco claros, los permisos no controlados y la falta de revisión de código siguen generando código muerto.
Inherent, un laboratorio con sede en Londres fundado por exempleados de DeepMind y con 50 millones de dólares en financiación inicial, presentó Faraday el 23 de agosto. El agente, construido sobre Qwen 3.6 de Alibaba (27 mil millones de parámetros), utiliza aprendizaje por refuerzo para desarrollar un "gusto por la investigación": la capacidad de juzgar qué experimentos vale la pena realizar. En la reproducción autónoma de artículos científicos publicados, Faraday superó a GPT-5.5 y Claude Opus 4.8, a pesar de usar un modelo de una fracción de su tamaño. La empresa planea crecer de 12 a 20-25 empleados para finales de año.
DeepSeek ajustó su facturación de API el 23 de agosto: los fines de semana ahora aplican tarifas de menor demanda todo el día; los precios escalonados de horas pico/valle se mantienen entre semana.