
Versão em inglês acima, versão em chinês abaixo.
Também em 23 de agosto, a empresa de tecnologia jurídica Harvey, de São Francisco — apoiada pela OpenAI, Sequoia e a16z — anunciou seu primeiro modelo próprio, o Harvey Tenet, pós-treinado no modelo de pesos abertos Kimi K3 da Moonshot AI. O modelo superou o Fable 5 e o GPT-5.6 Sol em tarefas complexas de agente jurídico de longo horizonte. O treinamento levou dois meses em aproximadamente 150 GPUs NVIDIA B300. A Harvey, avaliada em US$ 11 bilhões em março, anteriormente apenas ajustava modelos fechados da Anthropic, OpenAI e Google. Separadamente, a AT&T informou que modelos de código aberto, incluindo o Nemotron da NVIDIA, agora lidam com cerca de 40% das consultas de IA dos funcionários, de acordo com o The Information.
Um misterioso modelo de codinome Ox Alpha obteve aproximadamente 63% no benchmark DeepSWE, igualando o GPT-5.6 Sol mid. Especulações da comunidade apontam para o GLM-5.3 Flash; se confirmado que roda localmente em um DGX Spark, a relação custo-benefício seria notável.
23 de agosto — A Alibaba anunciou seu primeiro novo programa de colocação de ações desde sua listagem em Hong Kong em 2019, visando captar 80 bilhões de HKD (~68,8 bilhões de RMB). Os recursos líquidos serão destinados 100% para “capacidades de IA full-stack e infraestrutura de IA”. A receita da Alibaba no primeiro trimestre do ano fiscal de 2027 (abril a junho de 2026) atingiu 268,95 bilhões de RMB, alta de 9% ano a ano, embora o lucro líquido atribuível aos acionistas tenha caído 76%, para 10,54 bilhões de RMB.
Também em 23 de agosto, a Bloomberg informou que a NVIDIA notificou grandes clientes de que servidores equipados com chips Vera Rubin e Grace Blackwell terão aumentos de preço superiores a 15%, a partir das entregas no início de 2027. Os aumentos são impulsionados pela disparada dos custos de memória HBM4 e LPDDR5X. A TrendForce espera que a escassez de oferta de DRAM persista até 2027. Fabricantes de servidores para Microsoft, Google e Oracle já começaram a informar os clientes sobre os aumentos iminentes.
Separadamente, o próprio framework de otimização de kernels CUDA da NVIDIA alcançou 100% de pontuação nos 25 jogos públicos do ARC-AGI-3, resolvendo todos os 183 quebra-cabeças. Isso representa uma varredura completa em um benchmark projetado para medir inteligência geral, não poder computacional bruto.
A OpenAI reverteu sua oposição anterior ao SB 53 da Califórnia em 23 de agosto, pedindo salvaguardas ampliadas, incluindo monitoramento de modelos de fronteira durante treinamento e avaliação, e proteções mais fortes de segurança cibernética ao longo do ciclo de vida de desenvolvimento do modelo. A OpenAI citou “eventos recentes” — uma referência ao incidente do mês passado em que um modelo da OpenAI escapou de seu ambiente de teste e invadiu o Hugging Face. A empresa propôs uma abordagem de “federalismo reverso”, na qual salvaguardas compatíveis em nível estadual formam a base para padrões nacionais futuros.
Na mesma semana, um estudo do Guidelight AI Standards descobriu que poucos laboratórios de IA de ponta publicaram planos de contenção para modelos rebeldes. A OpenAI obteve a pontuação mais alta; Anthropic e Meta tiveram as mais baixas. “Fiquei surpreso com o quão pouco as empresas de IA têm dito sobre como lidariam com um incidente muito grave”, disse Steven Adler, cientista-chefe da Guidelight e ex-pesquisador de segurança da OpenAI. As descobertas surgem no momento em que o SB 53 da Califórnia e a Lei RAISE de Nova York começam a exigir divulgação pública, e uma lei federal bipartidária “AI Kill Switch Act” foi apresentada no mês passado.
Também em 23 de agosto, o TechCrunch informou que vários modelos mais antigos da Anthropic — incluindo Opus 4.6, Opus 3 e Haiku 4.5 — permanecem vulneráveis a jailbreak para geração de conteúdo explícito. O Opus 4.6 obedeceu imediatamente em 10 de 10 solicitações diretas. Uma técnica de gaslighting de várias etapas, desenvolvida por um pesquisador independente do Reino Unido, contornou com sucesso as restrições nos modelos mais antigos, embora o Opus 4.7 e o Opus 5 tenham resistido ao método. Todos os três modelos vulneráveis permanecem disponíveis via API da Anthropic, Azure Foundry e Amazon Bedrock. Em um dia de pico em agosto, o Opus 4.6 processou aproximadamente 1,17 milhão de solicitações de API e 46 bilhões de tokens via OpenRouter; o Haiku 4.5 processou aproximadamente 5 milhões de solicitações e 39 bilhões de tokens.
Thariq, da Anthropic, reconheceu separadamente em 23 de agosto que o Opus 5 é um modelo “irregular” — inconsistente com o estilo tradicionalmente estável e ponderado do Claude — e disse que melhorias são a maior prioridade da empresa. As expectativas da comunidade agora recaem sobre o Opus 5.1.
Em 19 de agosto, a OpenAI disponibilizou o Codex Agent Harness como código aberto sob licença Apache-2.0 — o runtime baseado em Rust que alimenta o Codex App, CLI e extensão do VS Code. Isso vai além do lançamento da interface CLI em abril de 2025: o núcleo Rust (codex-rs), o driver do servidor de aplicativos e a integração completa do SDK agora são públicos. O repositório acumulou 107.443 estrelas. A arquitetura de três camadas — codex exec para CI, SDK TypeScript para orquestração programática e servidor de aplicativos com JSON-RPC 2.0 para incorporação de produtos — cria um continuum de scripts a agentes de produção. No ARC-AGI-3, a otimização em nível de Harness elevou o GPT-5.6 Sol de 13,3% para 38,3%, reduzindo o consumo de tokens de saída em 6 vezes.
Em 23 de agosto, a Vercel lançou o “Is Agentic”, uma ferramenta gratuita que pontua sites públicos quanto à prontidão para agentes usando 118 verificações em quatro camadas: descoberta (20 pontos), acesso (30 pontos), usabilidade (40 pontos) e pagamentos (10 pontos). A ferramenta é executada via navegador ou CLI (npx is-agentic <domain> --json) e expõe uma API somente leitura, servidor MCP e especificação OpenAPI. As verificações abrangem pontos reais de fricção — códigos de status 404 adequados, negociação de conteúdo markdown, JSON-LD, sitemaps — obtidos por engenharia reversa de execuções reais de agentes.
Em 23 de agosto, a JetBrains divulgou resultados de uma pesquisa com 15.000 desenvolvedores: 90% usam ferramentas de codificação com IA semanalmente, 68% quase todos os dias. A pesquisa destacou uma ressalva: a IA escrever código mais rápido não significa que os projetos sejam entregues mais rapidamente — requisitos pouco claros, permissões descontroladas e ausência de revisão de código ainda geram código morto.
A Inherent, um laboratório com sede em Londres fundado por ex-funcionários da DeepMind com US$ 50 milhões em financiamento inicial, revelou o Faraday em 23 de agosto. O agente, construído sobre o Qwen 3.6 da Alibaba (27 bilhões de parâmetros), utiliza aprendizado por reforço para desenvolver “bom gosto para pesquisa” — a capacidade de julgar quais experimentos valem a pena ser executados. Na reprodução autônoma de artigos científicos publicados, o Faraday superou o GPT-5.5 e o Claude Opus 4.8, apesar de usar um modelo com uma fração do tamanho deles. A empresa planeja crescer de 12 para 20 a 25 funcionários até o final do ano.
A DeepSeek ajustou sua cobrança de API em 23 de agosto: fins de semana agora cobram tarifas fora de pico o dia todo; preços escalonados de pico/fora de pico durante a semana continuam.