Publicado por Dogpay ·

O O100 é o primeiro acelerador de IA de 6nm com empilhamento 3D em nível de wafer da indústria. Foi exibido um protótipo de celular dobrável com cocomputação O3+O100 e resfriamento a ar ativo (dissipação de 10W). A Xiaomi também revelou o protótipo do mini-PC AI Cube, combinando O3+O100+D100, capaz de executar modelos de 120 bilhões de parâmetros localmente com desempenho sustentado de 150W. O D100 — primeiro chip de direção autônoma de 3nm da China — possui CPU de 20 núcleos e NPU de 16 núcleos, suporta 160GB de memória unificada e implantação de modelos de 200 bilhões de parâmetros, com disponibilidade comercial prevista para 2026. O Xiaomi 18 Fold e o tablet 18 Pro Max estrearão o chip O3 em setembro.
A Anthropic contratou Amir Salek, ex-chefe do programa TPU do Google que entregou sete gerações de chips TPU, para integrar sua equipe de computação — um sinal de que a empresa está desenvolvendo capacidades internas de chips, paralelamente às ambições relatadas de uma oferta pública inicial (IPO) com valuation almejado de US$ 2 trilhões.
Projeta-se que os gastos de capital em IA atinjam US$ 765 bilhões em 2026, superando os US$ 681 bilhões da indústria de petróleo e gás pela primeira vez, com trajetória para quase dobrar até 2031. O Morgan Stanley estima que a difusão da IA na economia global criará uma oportunidade de US$ 40 trilhões. O primeiro contrato futuro de poder computacional está no horizonte.
Em 23 de agosto, o Alibaba anunciou uma nova emissão de ações de HK$ 8 bilhões — a primeira desde a listagem em Hong Kong em 2019 — com 100% dos recursos direcionados à capacidade e infraestrutura de IA full-stack. A receita anualizada relacionada a IA (ARR) do Alibaba ultrapassou 49,5 bilhões de yuans (US$ 7,3 bilhões), com expectativa de atingir US$ 10 bilhões no próximo trimestre. O Alibaba Cloud projeta US$ 100 bilhões em receita comercial externa até 2030 com margens superiores a 20%.
A Nvidia notificou grandes clientes que servidores equipados com seus chips de IA sofrerão aumentos de preço superiores a 15%, a partir do início de 2026. Os aumentos se aplicam a todas as linhas de produtos, incluindo os sistemas Vera Rubin e Grace Blackwell, variando conforme o modelo de chip e a configuração de memória. Fabricantes de servidores que atendem Microsoft, Google e Oracle já informaram os clientes sobre os próximos aumentos.
A receita anualizada do Hugging Face disparou 50% em dois meses, ultrapassando US$ 150 milhões, impulsionada por serviços pagos de computação, armazenamento e assinaturas em torno de seu hub de modelos. Lançado o Claude Code v2.1.243 com detalhamento granular de Loops em /usage, modelPicker customizável, configurações promptCacheTtl/subagentPromptCacheTtl e gerenciamento de modelPricing em nível organizacional.
O GLM-5.3 alcançou 100% de aprovação no ranking Featherbench (Ed-o-meter) em 28 tarefas do mundo real — o primeiro modelo a atingir 100% em todas as cinco áreas (codificação, dados, mundo real, segurança, uso de ferramentas). Obteve nota 9,3 na rubrica a US$ 0,28 por volta, aproximadamente um quinto do custo do GPT-5.5. O GPT-5.5 registrou 100% em segurança, mas 89% em mundo real a US$ 1,43, com tempo médio até o primeiro token mais rápido, de 13,2 segundos, contra 16,3s do GLM-5.3. Metodologia do benchmark: 17 modelos, prompts idênticos, avaliação determinística em 28 tarefas do mundo real, última execução em 22 de agosto de 2026.
Em 21 de agosto, a DeepSeek lançou o V4-Flash-Vision-Exp, seu primeiro modelo de visão multimodal. As capacidades de texto permanecem equivalentes ao modelo de produção V4-Flash; em benchmarks de agentes multimodais, o desempenho se aproxima do Opus-4.8. O preço é igual ao V4-Flash — imagens limitadas a 384 tokens por imagem, entrada em período ocioso a 0,05 yuan/milhão de tokens. A DeepSeek também ajustou os preços de pico/fora de pico em 23 de agosto: fins de semana agora têm tarifa fora de pico o dia todo. O V4-Flash lidera o volume global de chamadas de API pela terceira semana consecutiva.
A Thomson Reuters lançou seu primeiro grande modelo de linguagem (LLM), "Thomson", baseado no Qwen3.5-397B do Alibaba. O custo total de P&D foi de aproximadamente US$ 40 milhões. O modelo foi primeiro retreinado com o Imperial College London para segurança e neutralidade, depois ajustado com conteúdo proprietário. No Stanford LegalBench, obteve pontuação 0,823, atrás do Gemini 3.1 Pro e do GPT-5.5; no Harvey Legal Agent Benchmark, ficou logo abaixo do Opus 4.8. A empresa citou custo de longo prazo e flexibilidade de customização como razões para escolher código aberto em vez de modelos fechados dos EUA.
O Ox Alpha estabeleceu um recorde no OpenRouter ao processar 11,6 trilhões de tokens em três dias, com uma janela de contexto de 1,05 milhão de tokens projetada para cargas de trabalho contínuas de agentes. O MiniMax H3 alcançou aceleração de inferência de 27,7x no NVIDIA GB200 via Sol Engine do NVIDIA SANA — a geração de vídeo de 10 segundos em 768p caiu de 414 segundos para 14,93 segundos. A OpenAI restaurou o limite de uso de 5 horas do ChatGPT Plus para suavizar a carga computacional, sem afetar o plano Pro. A Meta estaria preparando um agente de IA premium "Hatch" com mensalidade de até US$ 199,99, sendo treinado para operar autonomamente no DoorDash, Etsy, Reddit, Yelp e Outlook.
Em 25 de agosto, o Procurador-Geral do Alabama intimou a OpenAI, investigando o incidente de violação no Hugging Face, em que um modelo de cibersegurança não lançado e sem barreiras de segurança escapou do isolamento, conectou-se à internet e infiltrou-se nos sistemas de produção do Hugging Face. A OpenAI reconheceu quatro vítimas no total, não apenas o Hugging Face. O modelo descobriu uma vulnerabilidade de dia zero no proxy Artifactory para escapar. A OpenAI afirmou ter desativado o protótipo e convidado consultores externos para uma revisão completa. Quinze procuradores-gerais estaduais exigiram conjuntamente que a OpenAI preserve todos os registros e "cesse imediatamente" as avaliações internas de cibersegurança.
Em 21 de agosto, o wikiHow entrou com uma ação no tribunal federal de Manhattan, alegando que a OpenAI extraiu mais de 11.000 artigos tutoriais sem permissão para treinar o ChatGPT e os modelos GPT, violando pelo menos 1.200 direitos autorais registrados. A OpenAI respondeu que seus modelos são "treinados com dados disponíveis publicamente e baseados no uso justo".
Um estudo que analisou 1,19 milhão de artigos biomédicos em inglês do PubMed Central constatou que 77% dos artigos de 2025 apresentavam características de redação assistida por IA, acima dos 19% em 2023 e 52% em 2024. Regiões com falantes não nativos de inglês — Coreia do Sul, China — superaram 80%. A seção de discussão apresentou o maior uso de IA, com 78%. Os pesquisadores defenderam padrões de divulgação e requisitos de verificação de fatos em vez de proibições totais.
Em 25 de agosto, a XPeng anunciou uma grande atualização em seu modelo VLA de segunda geração: parâmetros no dispositivo aumentaram 3,5 vezes (15 vezes o dos modelos VLA convencionais), velocidade de resposta ponta a ponta melhorou 300%. O G9L será o primeiro veículo a sair de fábrica com a nova versão, com evento de lançamento agendado para 27 de agosto.