Publicado por Dogpay ·
Anúncios em 8 e 9 de setembro mostraram sistemas de IA assumindo fluxos de trabalho cada vez mais completos. O TechCrunch informou que um modelo inédito da OpenAI gerou uma prova relacionada ao problema de Navier–Stokes por meio de cerca de 10,000 agentes coordenados ao longo de 88 horas, seguida de verificação formal no Lean. A OpenAI também lançou o ChatGPT Images 2.5 com geração mais rápida, conclusão de esboços, modelos e edição regional. A Inception informou que o Mercury 2.5 alcança 1,107 tokens por segundo com uma janela de contexto de 260,000 tokens.
Benchmarks da comunidade mostraram um modelo de mistura de especialistas Kimi K3 de 2.8 trilhões de parâmetros sendo executado a partir de quatro SSDs em um MacBook Pro M5 Max de 128 GB a cerca de um token por segundo. A Perplexity lançou o Portable Computer, um agente local construído com base no Qwen3.8-27B aberto da Alibaba e otimizado para o NVIDIA DGX Spark. A DeepSeek também anunciou preços mais baixos para o modelo Flash, incluindo uma redução de 60% na entrada em caso de acerto de cache durante horários fora de pico.
A Mistral fechou uma Série D de € 3 bilhões com uma avaliação reportada de € 21 bilhões, enquanto a Cognition alcançou uma avaliação reportada de US$ 48 bilhões. A Qualcomm e a Amazon anunciaram uma parceria multigeracional abrangendo chips para data centers, inferência e interconexões ópticas. O lançamento do Muse, da Meta, ilustrou a camada de agente pessoal, mas os testes internos também destacaram a necessidade de controles de autorização, monitoramento e confiabilidade.
A Anthropic confirmou que malware de roubo de informações foi usado para sequestrar sessões do Claude e consumir cotas de conta. O Grupo de Inteligência de Ameaças do Google informou que o TeamPCP utilizou uma estrutura multiagente autônoma para coletar credenciais após comprometimentos da cadeia de suprimentos. Resultados do PISA da OCDE sugerem ainda que a IA funciona melhor como andaime: estudantes que a usam uma ou duas vezes por semana superaram tanto os usuários de menor quanto de maior frequência, enquanto salas de aula voltadas para a avaliação tiveram melhor desempenho.