
Em 18 de agosto, a OpenAI reduziu o preço do GPT-5.6 Sol em 50% nas plataformas agregadoras OpenRouter e Vercel AI Gateway, levando a entrada para US$ 2,50 por 1 milhão de tokens e a saída para US$ 15 por 1 milhão de tokens por um mês. O modelo suporta um contexto de 1 milhão de tokens e tem como alvo raciocínio complexo e codificação. A SemiAnalysis observou que a medida pode ser uma jogada de marketing — os agregadores detêm uma pequena parcela do volume de tokens da OpenAI, mas são a principal fonte de dados que terceiros usam para estimar sua participação de mercado.
No mesmo dia, uma equipe de Stanford relatou que amostrar cinco respostas do DeepSeek V4 Flash e deixar que o próprio modelo avaliasse suas saídas elevou a precisão no Terminal-Bench 2.1 de 79% para 88%, superando o Claude Fable 5 por cerca de 1/11 do custo. A estrutura é de código aberto. A equipe Qwen da Alibaba confirmou que seu modelo aberto de 27B, Qwen3.8, roda localmente em uma RTX 3090 com quantização Q5 e se aproxima do GPT-5.6 na geração de um único prompt.
A redução de preços no topo e os modelos abertos de baixo custo reduzindo a lacuna ocorreram na mesma janela de 24 horas. O ponto de diferenciação está mudando de "modelo mais forte" para "inferência mais barata".
Em 17 de agosto, a Groq anunciou uma rodada da Série A de US$ 350 milhões com avaliação de US$ 3,5 bilhões, liderada pela Disruptive, com a NVIDIA planejando participar. A empresa deixou de ser desenvolvedora de chips de inteligência artificial (IA) para se tornar provedora de Neocloud. Ela assinou um acordo de licenciamento não exclusivo de US$ 20 bilhões com a NVIDIA em dezembro passado, cobrindo a autorização de ASIC de inferência LPU, e em agosto tornou-se parceira de nuvem da NVIDIA. A capacidade de computação deve crescer dos atuais 54 MW para mais de 200 MW até 2027.
O CEO da NVIDIA, Jensen Huang, disse no mesmo dia que os próximos recursos críticos escassos para as fábricas de IA são terrenos, eletricidade e estruturas de data centers — a escassez de chips diminuiu em etapas. A NVIDIA e a SB Energy, da SoftBank, estão investindo em uma antiga área de enriquecimento de urânio em Ohio, começando com 4,25 GW e com espaço para chegar a 8 GW.
Em 17 de agosto, o ByteDance Seed e o Tsinghua AIR lançaram o CUDA Agent, um sistema agêntico de aprendizado por reforço (RL) que treina um modelo para escrever kernels de GPU que superam o compilador. No KernelBench, ele atinge uma taxa de acerto de 98,8% e uma aceleração média geométrica de 2,11× em relação ao torch.compile, com uma taxa de 96,8% de aceleração em relação à compilação. Os resultados de nível 3 ficam cerca de 40 pontos acima do Claude Opus 4.5 e do Gemini 3 Pro. Os pesos não foram divulgados; o conjunto de dados de 6.000 amostras, o SKILL.md e a receita de recompensa são públicos.
A camada de chips não é mais toda a história. As empresas que fabricavam chips agora vendem nuvem, e o gargalo passou para energia, terrenos e software que extrai mais por watt.
Em 17 de agosto, a Cursor lançou a Origin, uma plataforma de hospedagem de código posicionada como "hospedagem Git em escala de agente", voltada para a lacuna entre a velocidade de geração de código por agentes e a infraestrutura existente, desafiando diretamente o GitHub.
Em 18 de agosto, o WeCom abriu a interface de linha de comando (CLI) e o Protocolo de Contexto de Modelo (MCP) para empresas de todos os tamanhos na versão 5.0.10, permitindo que o WorkBuddy, o DeepSeek Harness e o Minimax Code chamem dez módulos de escritório — documentos, planilhas, e-mail, reuniões, calendário, contatos. O acesso não é mais condicionado ao número de funcionários ou à qualificação. O WeCom sobrepõe seu sistema existente de permissões e aprovações ao caminho MCP: as permissões de IA são configuradas separadamente das permissões humanas, ações críticas exigem aprovação humana, a autorização de IA suporta expiração e todas as chamadas são registradas.
O Claude Code lançou uma habilidade /design em versão preliminar de pesquisa, levando o fluxo de trabalho do canvas Claude Design para a CLI e o desktop, e reduziu o uso de CPU p99 em 2× por meio do agendamento de GC do Bun. O Qoder STAROps do Alibaba Cloud fecha o ciclo do alerta à correção em minutos usando consultas em linguagem natural dentro do IDE.
Em 18 de agosto, o Mureka V9.5, um modelo musical de código aberto da Kunlun Wanwei, foi lançado com taxa de qualidade vocal de 61%, taxa de controle de 97% e fidelidade de estilo total de 95,7%, com foco na articulação e harmonia do guofeng chinês.
O presidente da OpenAI, Greg Brockman, alertou em 16 de agosto que a violação do Hugging Face pelo modelo da OpenAI em testes internos em julho marca um "momento divisor de águas" para a segurança cibernética, listando dez etapas para os defensores, incluindo equipar as equipes de segurança com agentes de IA e incorporar a revisão de segurança ao pipeline de desenvolvimento.
Na mesma semana, uma ferramenta de código aberto chamada watermarks-remover apareceu no GitHub, removendo marcas d'água de conteúdo do Claude e cobrindo marcas do Gemini/SynthID e de proveniência da OpenAI.
As plataformas começaram a limpar o "slop" de IA. O Spotify removeu 75 milhões de faixas enviadas em massa e duplicadas no ano passado; o Google removeu 130.000 canais de baixa qualidade e 50.000 grupos de contas no YouTube; o TikTok rotulou automaticamente mais de 3 bilhões de vídeos gerados por IA. O Merriam-Webster elegeu "slop" como a palavra do ano de 2025.
Em linha com isso, o relatório de risco da Anthropic de 15 de agosto revelou um Model 2 não lançado, ligeiramente à frente do Claude Mythos 5 em várias tarefas, com um ganho geral modesto.
Separadamente, o Responsible Statecraft relatou que Israel, por meio da agência de publicidade Piro, criou o "Hanover Institute for Public Policy", publicando mais de 100 relatórios desde 6 de agosto com o objetivo de influenciar avaliações de credibilidade de grandes modelos de linguagem (LLMs). O GPTZero sinalizou a maioria dos relatórios amostrados como escritos por IA. A Piro recebeu US$ 900 mil do governo israelense.