
Em 13 de agosto, a OpenAI e a Cerebras lançaram o modo Ultrafast, um nível de serviço alimentado pelo Wafer-Scale Engine da Cerebras, executando o GPT-5.6 Sol a até 750 tokens de saída por segundo. A Cerebras afirma que isso é 11x mais rápido que o Fable 5 e 5x mais rápido que o Opus 4.8 no modo Fast, sem degradação de qualidade. No Humanity's Last Exam, um benchmark de 2.500 perguntas que só pode ser respondido por especialistas de nível de doutorado, o Ultrafast concluiu em 11 horas e 11 minutos, enquanto o Claude Fable 5 precisou de 78 horas e 27 minutos. No GDP-Val, um benchmark para trabalhos de conhecimento economicamente valiosos, o Ultrafast proporcionou uma aceleração de ponta a ponta de 5,6x. O serviço está disponível primeiro na API da OpenAI para um grupo seleto de clientes.
Em 13 de agosto, o Google lançou o Gemini 3.7 Flash, voltado para casos de uso de codificação e agentes, apenas três semanas após o 3.6 Flash. Até 31 de dezembro, o modelo terá preço equivalente à metade do preço do 3.6 Flash — US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. O Google também está incorporando o modelo ao Gemini Spark para assinantes do AI Pro e Ultra em mais de 160 regiões.
Em 14 de agosto, a DeepSeek anunciou uma precificação de API com tarifas de pico e fora de pico a partir de 17 de agosto, com horários fora de pico pela metade da tarifa de pico. Alguns modelos apresentam aumentos de preço de mais de 3x. O carro-chefe deepseek-v4-pro tem um aumento notável no preço por milhão de tokens durante os horários de pico. A medida reverte a postura anterior da DeepSeek como provedora de baixo custo.
Em 13 de agosto, a Lenovo divulgou os resultados do primeiro trimestre do ano fiscal de 2026: a receita relacionada a IA cresceu 60% em relação ao ano anterior, para US$ 8,5 bilhões, 35% da receita total. O presidente do conselho Yang Yuanqing disse à mídia que a alocação de computação está mudando do estágio inicial de "80% treinamento" para uma meta de "80% inferência, 20% treinamento", com a divisão atual em torno de 50/50.
O mesmo conjunto de anúncios do dia — um modelo de fronteira de 750 tokens por segundo, um modelo Flash pela metade do preço e uma fornecedora chinesa aumentando preços enquanto outras reduzem — mostra que a concorrência passou de "quem é mais forte" para "quem é mais rápido e mais barato".
Em 14 de agosto, a DeepSeek lançou a versão oficial do V4-Pro, um modelo de 1,6 trilhão de parâmetros com pesos liberados sob licença MIT, suporte nativo à API Responses da OpenAI e adaptação direcionada ao Codex. O ecossistema de plugins do Harness entrou em testes públicos.
No mesmo dia, o GLM-5.3 da Zhipu foi noticiado com um modelo-base de 743B marcando 84,5 no CyberGym, acima do GPT-5.6 Sol, criado para defesa cibernética e codificação. A Meituan lançou o LongCat-2.0, um modelo MoE com 1,6T de parâmetros e janela de contexto de 1M, marcando 70,8 no Terminal-Bench 2.1, focado em codificação agêntica.
Em 14 de agosto, o Grok 4.6 liderou o ranking de codificação em cenários reais do CursorBench, à frente do Claude Opus 5 e do GPT-5.6 Sol. A xAI também liberou os pesos do Phoenix, seu algoritmo de classificação no X, um transformer baseado no Grok cujos pesos de pontuação sintética favorecem a intenção de propagação e as conversas genuínas, com as curtidas tratadas como o sinal mais barato.
Em 13 de agosto, um estudo da Meta/Oxford descobriu que o pré-treinamento multimodal precisa de apenas 5% de dados de geração de imagem, com a combinação ideal de 70% de linguagem, 25% de compreensão de imagem e 5% de geração de imagem — reduzindo os tokens de geração de imagem em 5x.
O impulso de pesos abertos da DeepSeek, da Meituan e da xAI, juntamente com benchmarks especializados para codificação e defesa cibernética, marca uma mudança em direção a modelos especializados por capacidade que competem em tarefas restritas e mensuráveis, em vez de alegações gerais de capacidade.
Em 13 de agosto, a Fortune informou que a Anthropic planeja um IPO em outubro com avaliação de US$ 2 trilhões, o que superaria o IPO de US$ 1,77 trilhão da SpaceX, em 12 de junho, como o maior de todos os tempos. A receita anualizada da Anthropic ultrapassou US$ 47 bilhões em maio, e a empresa protocolou confidencialmente na SEC em junho.
Em 14 de agosto, o Nikkei informou que a Tencent adquirirá a participação da Meta na desenvolvedora de IA Manus para se tornar sua maior acionista. A Manus, lançada em março de 2025 pela Butterfly Effect, transferiu sua sede para Singapura e cortou operações na China após investimento dos EUA. Em abril, a revisão de segurança de investimento estrangeiro da China proibiu a aquisição Meta-Manus; em 11 de agosto, a Manus anunciou que estava se desvinculando da Meta e retomando a operação independente.
Em 14 de agosto, a mídia informou que a Google DeepMind está se reestruturando, afastando-se da pesquisa de modelos de fronteira em direção a modelos econômicos da classe Flash, com demissões que podem chegar a um terço ou mais. Demis Hassabis deixou o cargo de CEO em 5 de agosto, tornando-se presidente do conselho e cientista-chefe da Alphabet. A reestruturação está ligada a atrasos do próximo modelo Gemini principal do Google e a disputas internas sobre prioridades de desenvolvimento.
Em 14 de agosto, a Reuters informou que a Apple treinou um LLM específico para o mercado da China com a Alibaba, encerrando sua dependência anterior de modelos de terceiros. O Apple Intelligence deve ser lançado na China em poucos meses, após o registro, em 15 de julho, do serviço de IA generativa no dispositivo "Apple Intelligence" junto aos órgãos reguladores.
Em 13 de agosto, Musk disse aos funcionários da SpaceX que a capacidade de energia do data center da SpaceXAI (antiga xAI) cresceria cerca de 7x para 10 GW até o final de 2027, a partir dos atuais 1,4 GW em Memphis e Southaven. Ele estimou que 10 GW poderiam gerar de US$ 300 bilhões a US$ 500 bilhões em receita anual.
O mesmo dia trouxe dois sinais na escala de US$ 2 trilhões e dois movimentos no mercado da China: a avaliação do IPO da Anthropic e a estratégia de modelo da Apple para a China — enquanto a Tencent absorveu a Manus e o Google recuou da fronteira.
Em 13 de agosto, no USENIX Security Symposium em Baltimore, pesquisadores da Universidade de Birmingham e da Universidade de Durham divulgaram o "Download More RAM", um ataque que explora uma falha decorrente da ausência de proteção contra gravação nos chips SPD de DDR4/DDR5 para contornar as defesas do Windows 11 sem acesso físico. A falha permite que o software reescreva os dados de configuração da memória, fazendo o Windows relatar incorretamente a RAM com o dobro da capacidade e criando aliases de memória para ler ou modificar regiões protegidas. Ela pode desativar o antivírus, comprometer sistemas corporativos bloqueados e contornar o anti-cheat do kernel. A Microsoft atribuiu o CVE-2026-23670 e adicionou uma mitigação na atualização de segurança de abril de 2026; sistemas com Secure Boot habilitado estão protegidos. Corsair, G.Skill e ADATA tinham, cada uma, pelo menos uma linha de produtos de consumo afetada.
Em 6 de agosto, um artigo aceito no ACM AI Leadership Summit constatou que detectores comerciais de IA não conseguem distinguir com confiabilidade a edição de IA de rascunhos completos. Edições leves do tipo "refinar apenas o resumo" foram sinalizadas em 64–80% (Pangram/GPTZero), enquanto originais não modificados de 2023–2025 foram sinalizados em 9–15%. Após a humanização com "Undetectable AI", menos de 4% das reescritas rotuladas como IA permanecem sinalizadas. A edição honesta de IA acarreta um risco de sanção maior do que a evasão assistida por humanizador.
Também nesta semana, uma análise técnica argumentou que marcas d'água de IA em texto sempre serão triviais de remover, antes da exigência do Artigo 50 da Lei de IA da UE de que as saídas sejam "detectáveis como geradas artificialmente", aplicável a partir de agosto de 2026. A amostragem de tokens no estilo SynthID pode ser removida por parafraseamento por meio de qualquer LLM fraco, e marcas d'água de homóglifos Unicode podem ser removidas com a substituição de caracteres. A análise observa que o Claude Code usou anteriormente esteganografia de homóglifos para marcar determinadas solicitações.
Em 13 de agosto, a OpenAI lançou o Computer History para o aplicativo do ChatGPT para Mac, substituindo a prévia baseada em capturas de tela do Chronicle pelo registro de eventos de acessibilidade do macOS (cliques, digitação, atalhos, troca de aplicativos). Os eventos são armazenados localmente por até 48 horas e, em seguida, excluídos após a geração de memória no servidor. A atividade no modo de privacidade é excluída. O recurso é disponibilizado para usuários Pro, Business e Enterprise, excluindo o EEE, a Suíça e o Reino Unido.
Em 14 de agosto, o ChatGPT ganhou a capacidade de editar diretamente o Google Docs, o Sheets e o Slides sem trocar de abas, com lançamento para usuários Plus, Pro, Business e Enterprise.
O ataque em nível de hardware, os detectores falhos e a marca d'água trivialmente removível compartilham uma premissa comum: a infraestrutura para verificar conteúdo de IA e proteger sistemas está ficando para trás em relação aos próprios modelos.