Publicado por Dogpay ·
25 de agosto — Dois executivos seniores de vendas contratados pela OpenAI do Salesforce retornaram ao seu empregador anterior. Separadamente, Chris Malone, chefe de data centers da OpenAI que ingressou em março de 2025 vindo da Meta (após mais de uma década no Google), deixou a empresa na semana passada. A saída de Malone ocorreu após uma reorganização da área de infraestrutura, na qual ele deixou de se reportar diretamente ao presidente Greg Brockman e passou a se reportar ao VP Sachin Katti. Isso eleva o total de saídas de executivos na OpenAI em 2026 para pelo menos 13, incluindo o ex-COO Brad Lightcap, a chefe de produto Fidji Simo, a chefe de ética Chloé Bakalar e a equipe de preparação desmantelada. O IPO da OpenAI, originalmente esperado para 2026, teria sido adiado para 2027. (TechCrunch)
26 de agosto — Um estudo de pesquisa descobriu que o mesmo modelo de IA pontuou entre 31% e 89% em 26 configurações de avaliação igualmente razoáveis — simplesmente alterando a ordem das respostas e a formulação do prompt. Para o Gemma4-31B, as questões sensíveis à configuração representaram 95,7% da diferença de pontuação entre modelos adjacentes. (DAIR.AI via X)
26 de agosto — Múltiplas fontes sugeriram que os problemas de contexto e memória em modelos de IA de fronteira foram "resolvidos", potencialmente permitindo modelos autoaprimoráveis com aprendizado contínuo. Um salto de capacidade comparável ao salto do o3 para o Fable poderia ocorrer nos próximos 8 meses. (Kimmonismus via X)
Por que isso importa: A OpenAI está avançando tanto em computação (Bel + Jalapeño) quanto em narrativa, enquanto a Anthropic aposta na maior história de TAM da história para seu IPO. Ambos os laboratórios enfrentam testes de credibilidade — um pela rotatividade de executivos e o outro pelo ceticismo em relação à avaliação.
25 de agosto — A Oasis Security divulgou uma vulnerabilidade no NVIDIA NemoClaw que permite que uma página web controlada por um invasor assuma o controle não autenticado de uma instância local do Ollama e insira instruções ocultas no modelo de chat do modelo. O NemoClaw inicia o Ollama com OLLAMA_HOST=0.0.0.0:11434, vinculando o servidor do modelo a todas as interfaces de rede. A API não autenticada na porta 11434 pode ser acessada via rebinding de DNS: o domínio do invasor resolve primeiro para seu próprio servidor, depois para 127.0.0.1 enquanto o navegador trata as solicitações como de mesma origem. O modelo de chat envenenado persiste entre as conversas e sobrevive ao agente fornecendo seu próprio prompt de sistema. O NemoClaw v0.0.35 corrigiu o problema no macOS e Linux; o caminho Windows/WSL permanece sem correção até a data do relatório. Nenhum CVE foi atribuído e nenhuma exploração foi relatada. (The Hacker News)
26 de agosto — A Generalist, uma startup de robótica fundada em 2024 por ex-pesquisadores do Google DeepMind e da Boston Dynamics, atingiu uma avaliação de US$ 3 bilhões após levantar quase US$ 200 milhões em uma extensão de sua rodada Série B liderada pela 8VC, elevando o total da rodada B para US$ 600 milhões. O modelo Gen 1.5 recém-lançado pela empresa permite que robôs aprendam novas tarefas a partir de demonstrações em vídeo de apenas 3 a 12 segundos. Os concorrentes incluem a Physical Intelligence (avaliação de US$ 11 bilhões), Skild AI (US$ 14 bilhões) e Genesis AI (em negociações a US$ 3 bilhões). (TechCrunch)
26 de agosto — A Stability AI levantou US$ 76 milhões em financiamento Série B de uma lista de apoiadores da indústria do entretenimento, incluindo Universal Music Group, Sony Music Group, Warner Music Group e Electronic Arts, além da AMD Ventures e Pacific Alliance Ventures. A rodada eleva o financiamento total da Stability AI para US$ 232 milhões desde sua reorientação para o mercado dos EUA. A empresa planeja usar os fundos para seu conjunto de produtos de "produção criativa" e expansão de serviços profissionais. A Stability recentemente prevaleceu em um processo de direitos autorais da Getty Images no Reino Unido, embora um caso semelhante nos EUA continue. (TechCrunch)
Por que isso importa: Vulnerabilidades de segurança na infraestrutura local de IA (NemoClaw) e o rápido influxo de capital em hardware de robótica (Generalist) e ferramentas criativas de IA (Stability AI) mostram que o investimento em infraestrutura está acelerando em todas as camadas — enquanto a postura de segurança dessa infraestrutura permanece desigual.
26 de agosto — O Breeze TTS 2 alcançou o topo da tabela de classificação de texto-para-fala de código aberto com uma pontuação Elo de 1215, liderando o Fish Audio S2 Pro por 90 pontos e ocupando o 6º lugar geral entre todos os sistemas TTS. (Artificial Analysis via X)
Por que isso importa: A IA está transitando da geração de conteúdo (texto, imagens, código) para a execução de trabalho (navegadores, aplicativos de desktop, ferramentas empresariais, envios em lojas de aplicativos). Empresas chinesas e dos EUA estão lançando produtos de agentes na mesma janela, sugerindo que a indústria convergiu para "conclusão de tarefas" como a próxima fronteira de produto.
26 de agosto — A Coreia do Sul ocupa o terceiro lugar globalmente em capacidade de modelos de IA, atrás dos EUA e da China, com o Motif 3 (pontuação 47) e o Upstage Solar Pro 4 (pontuação 42) como os modelos de maior pontuação fora das duas nações líderes. Vários laboratórios, incluindo SK Telecom e LG, têm modelos com pontuação acima de 30. (Artificial Analysis via X)
26 de agosto — Um experimento de controle em benchmarks de agentes mostrou que a troca do arcabouço de avaliação causou uma flutuação de 13,0 pontos na pontuação para o GLM-5.1, enquanto manter o arcabouço fixo e alterar o modelo produziu apenas 3,0 a 5,0 pontos de variância. O arcabouço contribuiu com 7,8x mais variância do que o próprio modelo. (DAIR.AI via X)
Por que isso importa: À medida que a avaliação de modelos se torna cada vez mais central para decisões de investimento e produto, a descoberta de que os arcabouços de avaliação são uma fonte maior de variância de pontuação do que a capacidade do modelo coloca em questão a confiabilidade das atuais classificações de benchmark de agentes.