Pesquisar

Gemini 3.8 Flash ao nível dos modelos de topo por um terço do preço, Muse Spark 1.3 na Meta, Qwen3.8-Max-0902 lidera o Code Arena WebDev

ai-powered-markdown-translator

Artigo traduzido do fr para o pt com gpt-5.6-sol.

Ver projeto no GitHub ↗

Quarenta e nove anúncios no dia 2 de setembro, o terceiro maior volume desde o início desta monitorização. Três modelos de primeiro plano foram lançados no mesmo dia — Gemini 3.8 Flash da Google, Muse Spark 1.3 da Meta Superintelligence Labs e Qwen3.8-Max-0902 da Alibaba — e nenhum dos três destacou a corrida pelas pontuações brutas.

Quatro tendências atravessam esta edição. Primeiro, o preço, que se tornou o argumento central dos três lançamentos. Depois, a inferência local, com a geração de vídeo a chegar a um computador pessoal e um motor de inferência para Apple Silicon cujo código foi aberto na mesma noite. A governação dos modelos nas empresas, em que o GitHub impõe a retenção de dados para um modelo e permite escolher a predefinição para todos os outros. E a cibersegurança, com um modelo dedicado reservado a defensores selecionados e uma aliança que se junta à Linux Foundation.


Gemini 3.8 Flash e 3.8 Flash Cyber, um modelo que trabalha mais pelo mesmo preço

2 de setembro — A Google apresentou dois modelos assinados por Tulsee Doshi (Senior Director, Product Management) e Raluca Ada Popa (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash e Gemini 3.8 Flash Cyber. É o terceiro lançamento Flash em seis semanas, e o 3.7 Flash tinha apenas três semanas de existência.

As duas variantes partilham a mesma inteligência de base, e a Google atribui explicitamente parte dos progressos em código e raciocínio a um treino intensivo no domínio da cibersegurança: o trabalho realizado para o modelo defensivo elevou o desempenho do modelo generalista. O preço de lançamento permanece inalterado em relação ao 3.7 Flash.

Característica do Gemini 3.8 FlashValor medido
Preço de entrada0,75 dólar por milhão de tokens
Preço de saída3,75 dólares por milhão de tokens
HLE-Verified54,9 %

Um ponto merece a atenção dos programadores, porque a Google o formula sem rodeios: o modelo consome mais. O ganho de fiabilidade resulta de uma opção de conceção — em tarefas complexas, o 3.8 Flash executa etapas adicionais de raciocínio e chama as ferramentas iterativamente. Nos níveis de esforço elevados, a fatura em tokens aumenta, pelo que a Google recomenda reduzir o nível de esforço ou permanecer no 3.7 Flash para cargas em que a eficiência computacional seja prioritária. A versão anterior continua a ser totalmente suportada.

A variante Cyber é a mais invulgar. Reservada a defensores de confiança através do programa Fairwind, lançado no mesmo dia, destina-se à descoberta autónoma de vulnerabilidades e, sobretudo, à sua correção automática.

Teste de cibersegurançaGemini 3.8 Flash CyberPontos de comparação
CyberGym Pass@1 (descoberta de falhas C/C++)86,2 %GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 %
Benchmark interno em 20 linguagensmais de 70 %Âmbito mais amplo do que apenas C/C++
CWE-Bench pass@1 (correção, Collinear)47,2 %Modelo de fronteira líder com 47,8 %, mas a um custo significativamente superior

Os números da implementação interna sustentam o posicionamento de custo/desempenho, em vez de uma supremacia bruta: a equipa Chrome Security obtém 2,6 vezes mais correções válidas do que com os melhores modelos comerciais, muito maiores; a Wiz mede uma taxa de recuperação entre 7,5 e 9,7 % superior no seu benchmark de testes de intrusão, por um custo entre 2,3 e 5,2 vezes inferior; e a equipa Cloud Vulnerability Research identificou uma vulnerabilidade fundamental crítica em menos de duas horas, quando a investigação normalmente exige meses. O modelo generalista já está implementado no Antigravity, na API Gemini através do Google AI Studio e do Android Studio, na geração de interfaces do Stitch, no Gemini Enterprise e, para os subscritores Google AI Pro e Ultra, na aplicação Gemini, no AI Mode da Google Search e no Google Sheets.

🔗 Anúncio do Gemini 3.8 Flash e 3.8 Flash Cyber

A pontuação do CursorBench que documenta o lançamento

O Cursor adicionou o Gemini 3.8 Flash ao seu seletor de modelos poucas horas após a apresentação, e o seu próprio banco de testes fornece a melhor medição disponível do valor do modelo em condições agênticas. O registo do CursorBench, datado do mesmo dia, indica que o 3.8 Flash foi promovido à versão Gemini «Latest» e que o 3.7 Flash passou para uma posição secundária.

Modelo e nível de esforçoPontuação CursorBench 3.2Custo médio por tarefaEtapas por tarefa
Fable 5.1 Max73,4 %9,64 dólares70
Grok 4.6 Extra High70,8 %2,81 dólares46
Fable 5.1 High69,4 %4,80 dólares44
Opus 5 Extra High69,3 %7,35 dólares72
Gemini 3.8 Flash High69,2 %2,38 dólares161
Gemini 3.8 Flash Medium67,0 %1,93 dólar136
Gemini 3.7 Flash High61,6 %1,20 dólar99

A leitura faz-se na diagonal: com 69,2 %, o Gemini 3.8 Flash High obtém uma pontuação equivalente à do Fable 5.1 High por cerca de metade do preço, e à do Opus 5 Extra High por um terço. A diferença em relação à geração anterior é de 7,6 pontos. Contudo, a coluna das etapas recorda o custo oculto da opção de conceção da Google: 161 etapas por tarefa, contra 44 para o Fable 5.1 High. O próprio Cursor apresenta duas ressalvas no rodapé — os resultados apresentam variância, e o custo indicado é reconstituído a partir dos preços públicos por milhão de tokens, não medido numa fatura.

🔗 Gemini 3.8 Flash no Cursor · 🔗 Resultados do CursorBench


Muse Spark 1.3, o modelo agêntico da Meta Superintelligence Labs

2 de setembro — A Meta Superintelligence Labs publicou o Muse Spark 1.3, sucessor do Muse Spark 1.2, implementado no mesmo dia no Muse Code e na Meta Model API acessível através de dev.meta.ai. É o segundo lançamento do laboratório em dois dias, depois do Muse Voice Transcribe.

O ângulo reivindicado não é a corrida pelas pontuações, mas a usabilidade real. O modelo foi concebido para sustentar trabalhos de longo prazo, gerindo vários fluxos numa única conversa: perante um objetivo aberto, utiliza ferramentas para construir o seu próprio contexto a partir de fontes desorganizadas e contraditórias, corrige as lacunas do seu plano e mantém um registo do que aprendeu. A parte mais invulgar diz respeito à colaboração: o Muse Spark 1.3 foi treinado para fazer perguntas de esclarecimento quando uma instrução é ambígua, pedir ajuda ao utilizador quando fica bloqueado e solicitar confirmação antes de uma ação com consequências. As comparações realizadas por engenheiros da Meta atribuem-lhe cerca de 20 % menos chamadas de ferramentas e 25 % menos tokens do que a versão 1.2 — uma diferença que se reflete diretamente na fatura.

Categoria avaliadaBenchmarkMuse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
AgenteGDPVal-AA v2 (trabalho intelectual)1754161517101824
AgenteOSWorld 2.0 (utilização agêntica do computador)66,947,662,768,3
AgenteDeepSearchQA (navegação agêntica)89,485,993,090,4
AgenteAutomationBench (fluxo empresarial de ponta a ponta)49,438,246,750,3
Contexto longoMRCR 512K-1M98,155,573,8
ProgramaçãoDeepSWE v1.1 (código agêntico longo)75,455,073,074,0
ProgramaçãoSWEAtlas CodeBase QnA59,446,253,552,7

Esta tabela merece uma leitura atenta. O Muse Spark 1.3 domina claramente no contexto longo e na programação, mas o Opus 5 supera-o nos quatro testes agênticos aqui considerados. Acima de tudo, a comparação não foi realizada em igualdade de condições, e é a metodologia publicada pela Meta que o afirma: o Muse Spark 1.3 e o 1.2 foram avaliados no nível de esforço xhigh, enquanto o Claude Opus 5 e o GPT-5.6 Sol foram avaliados no modo max. Há apenas uma exceção, o DeepSWE v1.1, no qual o Muse Spark 1.3 foi medido em max — precisamente o modo que ainda não está disponível, tendo a Meta indicado que chegará assim que os testes de segurança adicionais estiverem concluídos.

Um parágrafo do roteiro chama a atenção do ecossistema aberto.

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇵🇹 Fique atento a mais novidades em breve, incluindo modelos maiores, os pesos abertos do Muse Spark e muito mais.@AIatMeta no X

Depois de um ano em que a Meta reduziu claramente os seus lançamentos com pesos abertos, o compromisso é digno de nota — falta saber qual será a versão abrangida, uma vez que não foram fornecidos qualquer data ou âmbito.

🔗 Apresentação do Muse Spark 1.3


Qwen3.8-Max-0902 assume o primeiro lugar no Code Arena WebDev

2 de setembro — A Qwen publicou uma atualização do seu modelo de referência: Qwen3.8-Max-0902, um snapshot datado que também responde ao alias qwen3.8-max-2026-09-02. O modelo conserva as características estruturais da versão de agosto — 2,4 biliões de parâmetros e uma janela de contexto de 1 milhão de tokens —, mas recebeu uma fase adicional de pós-treino orientada para «Coding & Cowork».

Característica do modeloValor publicado
Parâmetros2,4 T
Janela de contexto1 M tokens
Entrada máxima991 K tokens (983 K no modo thinking)
Saída máxima131 K tokens
Orçamento de raciocínio262 K tokens
Preço de entrada e de saída2 dólares e 6 dólares por milhão de tokens
Leitura explícita da cache0,17 dólar por milhão de tokens
Leitura implícita da cache0,25 dólar por milhão de tokens
Criação explícita de cache2,50 dólares por milhão de tokens
Limites de débito1 M tokens por minuto, 15 K pedidos por minuto

O modelo aceita imagem, texto e vídeo como entrada e disponibiliza cinco ferramentas integradas através da Responses API: interpretador de código, pesquisa de imagem para imagem, pesquisa de texto para imagem, extrator web e pesquisa web. Ficou disponível através da API no QwenCloud no mesmo dia.

No mesmo dia, a Arena.ai publicou os seus resultados no Code Arena WebDev. O Qwen3.8-Max-0902 entra diretamente no primeiro lugar da classificação geral com 1 691 pontos, ou seja, 22 pontos acima da versão anterior, 3 pontos à frente do Claude Opus 5 na configuração Max e 17 pontos à frente do Kimi K3 na configuração Max. Com um preço misto de 5 dólares por milhão de tokens, o modelo ocupa a posição com a melhor classificação na fronteira de Pareto da Arena, isto é, a melhor relação entre pontuação e custo de toda a classificação.

O detalhe por categoria introduz nuances: primeiro em Data & Analytics e Consumer Product, segundo em Brand & Marketing, Gaming e Simulations, terceiro em Content Creation Tools e Reference-Based Design. A força do modelo reside, portanto, mais nas aplicações de dados e nos produtos de consumo do que nas tarefas predominantemente criativas. A Arena anuncia que as pontuações do Agent Arena serão divulgadas em breve.

🔗 Anúncio do Qwen3.8-Max-0902


A inferência abandona a cloud: vídeo num computador de secretária, um motor local com licença aberta

Esta é a tendência de fundo do dia, e não cabe em nenhum anúncio considerado isoladamente. Duas publicações importantes e quatro sinais mais discretos apontam na mesma direção: executar localmente aquilo que, até ontem, exigia um GPU de centro de dados.

2 de setembro — A equipa FastVideo do Hao AI Lab (UCSD) publicou a adaptação local do FastH3, a sua versão destilada do modelo de vídeo aberto MiniMax H3. Até agora, gerar vídeo e áudio em conjunto exigia um GPU de centro de dados; o modelo funciona agora numa NVIDIA DGX Spark, em duas DGX Spark ligadas por uma ligação QSFP ou num Mac Apple Silicon com pelo menos 36 GB de memória unificada.

A principal limitação não é a capacidade de cálculo, mas a memória. A DGX Spark inclui 128 GB de LPDDR5X unificada a cerca de 270 GB/s, aproximadamente um décimo da largura de banda de uma HBM de centro de dados, dos quais 121 GB estão efetivamente disponíveis para uma carga. Por isso, o pipeline funciona por fases: codificar o prompt, libertar o codificador de texto, carregar o transformer, remover o ruído, libertá-lo e, em seguida, carregar o VAE. Num GPU discreto, copiar novamente os pesos para o anfitrião liberta a memória do device; na Spark, essa cópia volta a ocupar o mesmo conjunto de memória. A equipa eliminou-a em favor do carregamento direto do DiT no GPU — o carregamento do transformer desce de 445 s para 39 s, e uma execução em 768×1344 com 124 imagens, de 772 s para 336 s.

Máquina de testePrimeira geraçãoGeração repetida
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

Face à receita pública vLLM-Omni para DGX Spark, que demora 1 881 s em 1024×576 para cinco segundos de vídeo e 50 etapas, o FastH3, em quatro etapas, desce para 268 s, ou seja, cerca de 7x; a relação sobe para 8,4x em 832×480 e volta a descer para 7,9x em 1344×768. No M4 Max, a codificação de um prompt que não esteja em cache passa de cerca de 80 s para cerca de 17 s, e o descodificador TAEH3 reduz a descodificação de 102 s para 1 s, baixando o pico de memória de 11,0 para 3,6 GiB. Os pesos MLX são publicados em INT8, INT6 e INT4 no Hugging Face, acompanhados pelo FastVideo Cookbook, publicado pela primeira vez. Próximo alvo anunciado: a família RTX, incluindo as 5090 e 4090.

Na mesma noite, a Perplexity abriu o código do Lily, o motor de inferência local que executa no dispositivo a componente do seu cálculo híbrido no Mac. O motor tinha sido apresentado no dia anterior numa publicação de investigação; a novidade é a publicação do código sob licença Apache-2.0 no repositório perplexityai/pplx-garden, onde se junta a fabric-lib e pplx-unigram.

O código confirma uma opção por uma especialização extrema. O Lily não é um motor genérico: carrega apenas um único checkpoint, o Qwen3.6-35B-A3B quantizado em 4 bits affine no formato MLX, com um tamanho de grupo de 64, verificado durante o carregamento. Os checkpoints Qwen densos, as variantes mais pequenas, BF16, GGUF, AWQ, GPTQ, int8 e fp8 são explicitamente recusados. Escrito em Rust, com kernels Metal compilados a partir do código-fonte durante o arranque, não utiliza PyTorch nem MLX no seu caminho de execução e exige um GPU Apple da família 10 ou posterior — um M5 ou mais recente — com, no mínimo, macOS 26. A superfície da API é igualmente restrita: apenas três rotas, descodificação sempre greedy, parâmetros de amostragem, streaming, ferramentas e conteúdo multimodal rejeitados em vez de ignorados. É esta estreiteza que se revela interessante: a Perplexity não apresenta um concorrente do MLX-LM, mas demonstra que um motor feito à medida para uma determinada plataforma e um determinado modelo supera um framework generalista.

Quatro outras publicações do dia seguem a mesma direção e são retomadas nas Breves: TranslatePsy-Nano, modelos de tradução de 17 a 42 MB que abrangem dezassete línguas; o trabalho da i64 Systems sobre os experts de um modelo MoE alojados em NVMe sem alterar um único byte do resultado; a publicação da Cohere em defesa do dimensionamento adequado dos pequenos modelos nas empresas; e a transmissão em direto DGX Spark da NVIDIA dedicada à execução local do Portable Computer da Perplexity. Nenhuma delas tem grande peso isoladamente, mas todas transferem o cálculo do centro de dados para o dispositivo.

🔗 FastH3 localmente · 🔗 Abertura do código do Lily · 🔗 Repositório pplx-garden


A Anthropic abre o código do Claude Commerce Agents

2 de setembro — A Anthropic publicou em open source o Claude Commerce Agents, um repositório de referência sob licença Apache 2.0 para criar agentes de comércio. O anúncio surge deliberadamente antes da época festiva, período em que as equipas de e-commerce planeiam as suas implementações.

O blueprint contém dois agentes completos. O agente de compras funciona na aplicação da empresa: pesquisa no catálogo, reúne um conjunto de artigos para um pedido formulado em linguagem natural, memoriza as preferências do cliente, apresenta produtos, comparações e o carrinho na conversa e, em seguida, encaminha para o checkout — além de responder a perguntas de apoio ao cliente no mesmo fio. O agente de comerciante destina-se às equipas que gerem a loja: análise de vendas, alertas sobre artigos esgotados antes de uma promoção, recomendações de preços baseadas no histórico e redação de campanhas.

Elemento do repositórioConteúdo disponibilizado
Agentes fornecidosAgente de compras (cliente) e agente de comerciante (back-office)
Verticais executáveisRetalho, viagens, telecomunicações, bilhética
RuntimesMessages API, Claude Agent SDK, Claude Managed Agents (beta)
Plataformas de implementaçãoClaude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI
Plugin Claude Codecommerce-builder@claude-commerce-agents
Pré-requisitos técnicosPython 3.11 ou posterior, Node 22
Resultados já observadosNos retalhistas que executam agentes de compras no Claude: carrinhos até 35 % maiores, compradores 60 % mais propensos a concluir a compra

A separação entre aquilo que o modelo decide e aquilo que é efetivamente executado é estrutural, não declarativa. Do lado do consumidor, a interface backend chamada pelo agente simplesmente não inclui qualquer método de pagamento. Do lado do comerciante, cada ferramenta de escrita produz uma alteração pendente, acompanhada por um identificador gerado no servidor, e a função apply_change só é concluída para identificadores aprovados através de uma verdadeira interface de validação humana. A Anthropic esclarece que se trata de uma implementação de referência sem manutenção, que não aceita contribuições: um ponto de partida para fazer fork, não uma dependência a acompanhar. Todas as empresas das demonstrações são fictícias, e nada efetua encomendas nem cobra cartões.

🔗 Anúncio do Claude Commerce Agents · 🔗 Repositório commerce-agents

A vertente técnica: cache, latência e salvaguardas no código

Publicado no mesmo dia e assinado por Ali Shazal e Matthew Koen, o guia de engenharia que acompanha o blueprint resume um ano de trabalho com retalhistas, marketplaces e empresas do setor das viagens. O seu primeiro conselho contraria a intuição: perante um agente que tem de abranger muitas categorias, não se deve criar um subagente por domínio. Uma conversa comercial é uma sessão única e fortemente interligada, e a sua divisão degrada a qualidade — as capacidades provêm das skills, não da multiplicação de agentes.

Tema abordadoValor de referência indicado pela Anthropic
Resposta comercial apresentada500 a 700 tokens de saída
Leitura de tokens em cacheUm décimo do custo dos tokens novos
Escrita em cacheAcréscimo de cerca de 1,25x, amortizado a partir da segunda utilização
Taxa de sucesso do cache a atingir90 a 99 %
Velocidade das leituras em cache1,5 a 2x mais rápidas em torno dos 100 000 tokens
Ganho proporcionado pela memóriaMais 13 % de recall factual no conjunto de avaliação interno
Casos de avaliação por fluxo50 a 100 para começar

Quanto à escolha do modelo, a recomendação é começar pelo Opus para os agentes de comerciante, nos quais predomina a análise, e pelo Sonnet para os agentes destinados aos consumidores, nos quais a latência tem maior peso — e depois executar todo o conjunto de avaliação em cada modelo e em cada nível de esforço, medindo o custo por tarefa concluída, em vez do custo por chamada ao modelo. A secção sobre segurança, por sua vez, é inequívoca.

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇵🇹 O prompt é onde começa o comportamento seguro, mas, no comércio, não pode ser onde a segurança é aplicada. As falhas são financeiras e frequentemente irreversíveis, e basta uma injeção ou uma amostra inadequada para contornar uma regra do prompt.Anthropic, Um guia sobre a anatomia de agentes de comércio eficazes

Por isso, quatro regras são aplicadas no código, definidas uma única vez para serem partilhadas pelos três runtimes: o modelo prepara, mas é uma pessoa ou uma política que aplica; as operações de escrita e as renderizações apenas aceitam identificadores emitidos pelo servidor; as transações com limites máximos devem resistir a pedidos repetidos; o conteúdo de terceiros é sanitizado.


O controlo do computador passa para segundo plano no Claude Code e no Claude Cowork

2 de setembro — O controlo do computador (computer use) pelo Claude já não monopoliza o ecrã. Até agora, iniciar uma tarefa desse tipo equivalia a ceder a máquina: as outras janelas ficavam ocultas enquanto o Claude trabalhava na aplicação aprovada. A partir de agora, tanto no Claude Cowork como no separador Code da aplicação desktop, a tarefa prossegue em segundo plano enquanto o utilizador continua a fazer outras coisas.

A alteração está em beta, reservada aos planos Pro e Max e limitada ao macOS — embora o computer use propriamente dito continue disponível em research preview no macOS e no Windows. Quem já utilizava a funcionalidade não precisa de ativar nada; os restantes encontrá-la-ão em Settings > General, tendo em conta que o macOS também exige as permissões de sistema Acessibilidade e Gravação do ecrã.

O enquadramento de segurança permanece inalterado. Ao contrário da ferramenta Bash, que é executada numa sandbox, o computer use é executado no ambiente de trabalho real. Os níveis de acesso continuam definidos por categoria de aplicação e não podem ser alterados: apenas visualização para browsers e plataformas de trading, apenas cliques para terminais e IDE — levando o Claude a usar a ferramenta dedicada em vez do controlo do ecrã — e controlo total para as restantes aplicações. Uma aprovação é válida durante a sessão em curso ou durante trinta minutos numa sessão iniciada através do Dispatch.

🔗 Anúncio do computer use em segundo plano


O Cursor executa os seus agentes cloud em máquinas geridas pelo cliente

2 de setembro — O Cursor publicou um artigo de produto assinado por Jack Pertschuk que abre os seus agentes cloud a infraestruturas pertencentes ao cliente. Até agora, um agente cloud do Cursor era executado numa máquina virtual dedicada na cloud da empresa. Com as Self-Hosted Machines, a execução das ferramentas passa para máquinas situadas na rede da empresa, enquanto o loop do agente, a inferência e o planeamento permanecem no Cursor.

O número que justifica a iniciativa é apresentado logo de início: os agentes cloud produzem agora mais de 60 % dos pull requests que o Cursor integra internamente. Quando uma parte crescente do trabalho passa por estes agentes, a máquina em que são executados deixa de ser um pormenor. A empresa identifica três situações que levam uma equipa a optar pelas suas próprias máquinas: executar as ferramentas em contacto direto com o gestor de código-fonte e os serviços internos, dispor de hardware específico, como GPUs ou Macs para desenvolvimento iOS, ou executar um sistema operativo difícil de empacotar numa imagem de agente cloud.

Aspeto do sistemaPormenor técnico
Comando de registoagent worker start, ligação HTTPS de saída de longa duração
Sentido da ligaçãoO Cursor nunca inicia uma ligação de entrada à rede do cliente
Configurações disponíveisMy Machines (posto ou VM individual) e Pools (fila partilhada da equipa)
Retoma após inatividadeHibernação através de snapshot, restauro com o mesmo identificador de worker
Fornecedores de sandboxesAWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel
Controlo do computadorLinux agora suportado, além dos Macs, através do Chrome ou Chromium

Os pools aumentam a capacidade através de um controlador que monitoriza a fila de pedidos e inicia máquinas com um script fornecido pela equipa; se não houver nenhum worker disponível, o pedido aguarda. Para o caso intermédio entre reinicializar uma máquina e mantê-la ligada, opções dispendiosas de ambas as formas, o Cursor introduz a hibernação: é criado um snapshot da máquina inativa, que depois é desligada, e, se ocorrer um novo arranque dentro da janela de reconexão, o snapshot é restaurado. Como um pool não está associado a um repositório, uma mesma fila pode servir vários repositórios.

Uma ressalva, colocada pela própria publicação: apenas o ambiente de execução é transferido. Os resultados das ferramentas são enviados para o Cursor para a inferência e podem conter código, e as transcrições dos agentes podem ser aí processadas e armazenadas. Portanto, não se trata de um isolamento completo, mas de uma alteração do local de execução.

🔗 Self-Hosted Machines


Claude Fable 5.1 entra em disponibilidade geral nos integradores

1 e 2 de setembro — No próprio dia do lançamento, Claude Fable 5.1 entrou em disponibilidade geral no GitHub Copilot; no dia seguinte, a Genspark integrou-o ao seu Code Agent e ao Claw. Dois integradores em dois dias, para o mesmo modelo: é uma onda de adoção, não duas notícias isoladas.

No GitHub, a cobertura é ampla — Visual Studio Code, Visual Studio, Copilot CLI, o coding agent, a aplicação GitHub Copilot, github.com, GitHub Mobile no iOS e Android, os IDEs JetBrains, Xcode e Eclipse — para os planos Pro+, Max, Business e Enterprise, com uma implementação progressiva e faturação à tarifa pública do fornecedor. Mas o aspeto mais notável desta disponibilização não é técnico, mas contratual.

Condição de acessoO que se aplica ao Fable 5.1
Política de administradorDesativada por predefinição, deve ser ativada explicitamente
Retenção de dadosObrigatória por predefinição, para os classificadores de segurança da Anthropic
Utilização dos dados retidosSem treino dos modelos da Anthropic
Outros modelos ClaudeRetenção zero mantida, exceto Fable 5 e Fable 5.1
Isenção de retenção zeroEmpresas elegíveis, até ao fim do ano civil
Após a isençãoEnterprise Frontier Safeguards obrigatórios

Ao contrário dos outros modelos Claude do Copilot, o Fable 5.1 exige a retenção de dados por predefinição: a Anthropic conserva prompts e saídas para operar os seus classificadores de segurança. Ativar a política equivale, portanto, à aceitação explícita desta restrição, e mantê-la desativada torna simplesmente o modelo indisponível. A alternativa é temporária e seletiva: as empresas elegíveis podem permanecer com retenção zero até ao fim do ano civil, enquanto a Anthropic implementa os seus Enterprise Frontier Safeguards, que deverão proporcionar monitorização automatizada de segurança e chaves de armazenamento e encriptação controladas pelo cliente. A elegibilidade não pode ser obtida por autosserviço: passa pela equipa comercial do GitHub, que o suporte não pode contornar, e, mesmo quando aprovada, não ativa nada automaticamente.

Por sua vez, a Genspark reivindica uma integração desde o primeiro dia no Genspark Code Agent e no Claw, sem benchmark nem detalhes de preços. A empresa junta-se à lista de plataformas agênticas que fizeram a transição poucas horas após o lançamento do modelo, ao lado de Cursor, Devin, Warp, v0, Amp e Perplexity Computer.

🔗 Fable 5.1 no GitHub Copilot · 🔗 Anúncio da Genspark


GitHub explica como tornou o Copilot mais barato sem degradar a qualidade

2 de setembro — O GitHub publicou um artigo de engenharia assinado por Erik Kristensen, com Napalys Klicius, sobre a redução do custo do Copilot. O texto é invulgar neste domínio: apresenta números, descreve as experiências que falharam e explica por que motivo uma otimização óbvia pode ter o efeito contrário.

A tese inicial é contraintuitiva. Contar os tokens de uma interação isolada não mede a eficiência: uma resposta concisa de uma ferramenta que omite uma informação necessária ao agente obriga-o a repetir o comando, tornando a tarefa mais lenta e mais cara no total. O GitHub ilustra a armadilha com o RTK (Rust Token Killer), um utilitário que encurta a saída do shell antes da leitura. De facto, encurtava algumas respostas, mas as etapas de recuperação subsequentes acrescentavam turnos: tokens poupados localmente, gastos globalmente. Não foi implementado.

Alteração avaliadaGanho medido
Remoção dos números de linha, em testes offlineCerca de 5 % menos custos de inferência
Remoção dos números de linha, em produção no CLICerca de 3 % menos custos médios diários por utilizador
Compressão do prompt da ferramenta task1 300 tokens removidos por turno, 2,9 % menos custos normalizados por hora ativa
Entrega direta do trabalho em segundo plano concluídoCerca de 2,3 % menos utilização associada a tokens, medida em AI Credits
Números de linha e compressão no Copilot code reviewCerca de 5 % de tokens de prompt por revisão, para cada uma das duas medidas
Migração anterior para ferramentas de ficheiros partilhadosCerca de 20 % menos custos de revisão
RTK (Rust Token Killer)Rejeitado, custos globais superiores na configuração testada

A política de compressão adotada é deliberadamente conservadora e assenta em três vertentes: preservar intactas as saídas que se assemelham a código-fonte, reorganizar os resultados de pesquisa sem eliminar nada e comprimir apenas o ruído repetitivo de instalação, build e teste. A compressão de git diff fazia parte das primeiras versões; foi removida depois de tarefas de benchmark terem mostrado agentes a reabrir a saída original.

O episódio mais instrutivo diz respeito à compressão de prompts. Um ciclo de meta-prompting, no qual o Copilot reescreve iterativamente a sua própria instrução, reduziu para metade o prompt da ferramenta task — mas a primeira experiência online revelou uma regressão que as avaliações offline não tinham detetado: o ciclo tinha convertido uma instrução prudente sobre paralelismo numa regra estrita de ordenação, serializando agentes independentes. A correção substituiu listas de permissões e de bloqueios por uma única frase que deixava a decisão ao modelo. O último ensinamento, e o mais útil: os ganhos não se transferem de um produto para outro. Um conjunto de instruções mais conciso, inspirado nos bons resultados obtidos no Copilot code review, fez aumentar os custos no Copilot CLI.

None of these changes made the model smarter. They removed work the model never needed to do.

🇵🇹 Nenhuma destas alterações tornou o modelo mais inteligente. Eliminaram trabalho que o modelo nunca precisou de fazer.GitHub Blog, Como tornamos a programação com IA mais eficiente em termos de custos


O catálogo de modelos do Copilot está a ser reorganizado

1 e 2 de setembro — Dois changelogs do mesmo período descrevem as duas faces da mesma reorganização: o que sai do catálogo do Copilot e quem passa a decidir qual é o modelo predefinido.

Seis modelos foram descontinuados em 1 de setembro na maioria das experiências do Copilot — Copilot Chat, edições online, modos ask e agent e conclusões de código.

Modelo removidoAlternativa sugerida pelo GitHub
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7, Claude Opus 4.8 ou Claude Opus 5
Claude Opus 4.6Claude Opus 4.7, Claude Opus 4.8 ou Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

Mantém-se uma exceção: Claude Sonnet 4.6 continua acessível aos subscritores individuais com um plano anual. Não é necessária qualquer ação por parte do utilizador, mas os administradores do Copilot Enterprise poderão ter de ativar explicitamente os modelos de substituição nas respetivas políticas; caso contrário, estes não aparecerão nem no VS Code nem em github.com.

Ao mesmo tempo, as definições geridas nas empresas passam a aceitar qualquer modelo como predefinição para novas conversas. A granularidade vai além da empresa: ao declarar a chave model como overridable e editar os ficheiros de configuração das equipas em team-mappings.json, um administrador pode permitir que cada equipa escolha a sua própria predefinição, enquanto os utilizadores não abrangidos herdam a definição global. A funcionalidade está em disponibilidade geral no Copilot Business e no Copilot Enterprise, na aplicação GitHub Copilot, no Copilot CLI e no Visual Studio Code.

🔗 Modelos descontinuados · 🔗 Modelo predefinido nas empresas


O Ship Log de agosto: Copilot no Slack e no Teams, e conteúdos multimédia no CLI

1 e 2 de setembro — O resumo mensal publicado pelo GitHub sob a forma de Artigo no X é um exercício promocional, mas revela uma entrega de agosto que não tinha sido divulgada: o GitHub Copilot está agora acessível através do Slack e do Microsoft Teams. A integração leva as capacidades agênticas do Copilot CLI e da aplicação GitHub Copilot às conversas de equipa — mencionar o GitHub permite planear alterações, investigar um problema ou encaminhar uma tarefa de programação sem sair da conversa.

Elemento do Ship Log de agostoO que foi disponibilizado
Copilot no Slack e no Microsoft TeamsCapacidades agênticas do Copilot CLI e da aplicação Copilot
Copilot code review, profundidade BalancedDisponibilidade geral, ao lado de Lite, com predefinição configurável por organização ou repositório
Novos modelos recordadosGemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 alojado pela Fireworks AI
Promoção do GPT-5.6 SolMetade do preço até 3 de setembro
Promoção da seleção automática30 % de desconto para utilizadores do Copilot Max
GitHub Copilot Day10 de setembro de 2026

O resumo também documenta a profundidade Balanced do Copilot code review, que entrou em disponibilidade geral ao lado de Lite: Balanced visa uma análise mais aprofundada das pull requests, Lite destina-se a alterações diretas, e a profundidade predefinida pode ser configurada ao nível da organização ou do repositório.

Outra entrega do mês completa o panorama na linha de comandos: a flag repetível --attach do GitHub CLI, disponível desde a versão gh v2.99.0, carrega uma imagem ou um vídeo local e referencia-o online numa issue, numa pull request ou num comentário. Funciona nos seis comandos que escrevem Markdown, e o pormenor que a torna prática é o tratamento do Markdown existente: um caminho local já referenciado no corpo é reescrito no próprio local, de modo que ![alt](./login.png) mantém o seu texto alternativo e passa a apontar para o asset carregado. O texto alternativo é fornecido depois de um # no caminho. Formatos aceites: PNG, JPEG, GIF, WebP, SVG, MP4, MOV e WebM, com 10 MB para imagens e 100 MB para vídeo nos planos pagos. O GitHub Enterprise Server não é suportado nesta versão. O GitHub salienta explicitamente que os agentes de programação herdam esta capacidade e agora podem mostrar um resultado em vez de o descrever.

🔗 Ship Log de agosto de 2026 · 🔗 Conteúdos multimédia no GitHub CLI


Fairwind Program, a ciberdefesa da Google reservada a defensores de confiança

2 de setembro — No mesmo dia que o Gemini 3.8 Flash Cyber, a Google lançou o Fairwind Program, o canal através do qual este modelo é distribuído. O raciocínio apresentado por Four Flynn, vice-presidente de segurança e privacidade, parte de um dilema concreto para as equipas de defesa: adotar modelos de fronteira enormes, dispendiosos e difíceis de controlar em bases de código empresariais, ou recorrer a modelos menores de pesos abertos que têm dificuldades na correção de vulnerabilidades complexas.

A resposta associa o Gemini 3.8 Flash Cyber ao CodeMender, o sistema de correção automática da Google. O argumento central não é a deteção, mas a remediação: identificar fragilidades cria consciencialização e receio, enquanto encontrá-las e corrigi-las automaticamente proporciona segurança. A promessa é gerar correções verificadas e implementáveis em poucos minutos, em vez de semanas, dentro do ambiente cloud seguro da organização cliente.

O acesso é deliberadamente faseado, com três círculos prioritários: governos e autoridades cibernéticas nacionais, operadores de infraestruturas críticas nos setores da saúde, telecomunicações, energia e redes financeiras, e plataformas tecnológicas centrais. As organizações participantes aceitam restrições rigorosas — limitar o acesso às equipas internas de cibersegurança, resposta a incidentes ou testes de intrusão e implementar proteções como a autenticação multifator. A Google anuncia mais de 650 parceiros participantes em todo o mundo. Fora do programa, qualquer cliente do Google Cloud pode utilizar o CodeMender com modelos publicamente disponíveis na Gemini Enterprise Agent Platform, em complemento do AI Threat Defense. A empresa indica ainda ter ultrapassado 100 milhões de dólares em financiamento acumulado para cibersegurança através da Google.org, incluindo 36 milhões para 35 clínicas de cibersegurança que apoiaram mais de 1 250 hospitais, distritos escolares e serviços municipais norte-americanos.

🔗 Fairwind Program


O ferramental de linha de comando do Google: três versões em dois dias

1 e 2 de setembro — O Google lançou três versões no mesmo âmbito em dois dias, e o conjunto revela uma prioridade clara: menos funcionalidades, mais confinamento e estabilidade.

Versão publicadaDataConteúdo predominante
Gemini CLI v0.58.01 de setembroSete alterações focadas em segurança, promoção ao canal estável
Antigravity CLI 1.1.231 de setembroDuas melhorias, onze correções
Antigravity 2.12.02 de setembroSete melhorias, nove correções

O canal estável do Gemini CLI passou para a v0.58.0, uma promoção que passou despercebida porque ocorreu trinta e dois minutos após a publicação da preview v0.59.0. O conteúdo é quase inteiramente defensivo. A correção mais substancial afeta o sandbox do macOS: o perfil Seatbelt agora isola os sockets e binários do Docker e dos runtimes de contêineres, fechando uma via clássica de escape — um processo confinado que alcança o socket Docker do host pode, na prática, escapar dele. Outras duas alterações reforçam o núcleo: a avaliação de links simbólicos torna-se consistente no gerenciamento de caminhos ignorados, e os verificadores de segurança de primeiro nível são explicitamente declarados na configuração da política de escrita.

O Antigravity 2.12.0 traz duas novidades funcionais. A citação de respostas permite destacar uma parte de uma resposta para reinseri-la como contexto no prompt seguinte — uma resposta direta a um problema cotidiano das sessões agênticas longas. E o comando /boost, reservado aos usuários pagantes, reforça o esforço de reflexão por meio de um pipeline de raciocínio multiagente. Ele chega no mesmo dia que o Gemini 3.8 Flash, sobre o qual o Google admite que trabalha mais intensamente ao custo de mais tokens: ambos os movimentos seguem na mesma direção, a de um controle explícito do nível de esforço pelo usuário. O restante trata de incômodos reais: as configurações gerais indicam quais projetos substituem uma configuração, os layouts de terminal em tela dividida sobrevivem aos recarregamentos da janela, e uma mensagem pode ser enviada enquanto o ditado está em andamento.

Por fim, o Antigravity CLI 1.1.23 torna mais leve o streaming dos subagents, enviando os metadados de trajetória uma vez por subtrajetória em vez de a cada etapa, e aceita por Tab o nome de modelo sugerido em texto fantasma em /model. Suas onze correções revelam defeitos penosos no dia a dia: falhas causadas pelos hooks de prompt, identificadores de chamada de ferramenta omitidos durante a reconstrução do histórico para os modelos Gemini, solicitações de permissão exibindo títulos genéricos em vez de descrições de ação legíveis — um problema real, pois se pede autorização para uma ação que não é descrita — e subagents declarados com enable_mcp_tools=true que falhavam por falta de um dispatcher MCP.

🔗 Notas de versão do Gemini CLI v0.58.0 · 🔗 Changelog do Antigravity


Os Short Video Overviews do Gemini Notebook chegam a mais de 70 idiomas

1 de setembro — O Gemini Notebook expandiu seus Short Video Overviews para mais de 70 idiomas, adicionando três novas variantes do inglês. A funcionalidade transforma as fontes de um notebook em vídeos verticais de cerca de 60 segundos, que agora podem ser gerados no idioma do usuário.

A implementação abrange a web e os dispositivos móveis, permanecendo restrita aos assinantes Ultra e Pro — a equipe esclareceu na mesma thread que a disponibilização para usuários Pro ainda não está completa. Dois detalhes complementam o anúncio: o número de fontes presentes em um notebook não entra no cálculo do consumo de tokens, e os usuários Pro mantêm a geração de Cinematic Video Overviews em inglês. A passagem do inglês para 70 idiomas faz a funcionalidade deixar de ser uma demonstração para se tornar uma ferramenta realmente utilizável fora do mundo anglófono.

🔗 Anúncio do Gemini Notebook


Os editores tornam-se multiplexadores de modelos

1 e 2 de setembro — Dois anúncios sem relação aparente descrevem o mesmo movimento: o ambiente de desenvolvimento torna-se um ponto de acesso a modelos de terceiros, e o diferencial desloca-se da qualidade do modelo para as condições em que ele opera.

O Zed publicou sua versão estável 1.18.0, cujo conteúdo mais significativo está na seção de IA das notas de versão. De uma só vez, o editor alcança vários lançamentos recentes: a janela de contexto de 1 milhão de tokens do GPT-5.6 passa a ser compatível com o Amazon Bedrock, o Gemini 3.5 Flash-Lite entra para os modelos Google AI, o Grok 4.5 e o Grok 4.6 entram para os modelos xAI, e o suporte ao Claude Fable 5.1, lançado no dia anterior, é aprimorado. Duas dessas quatro adições são contribuições externas creditadas nas notas. Somam-se a isso elementos de ergonomia próprios do trabalho com agentes — recarregamento de uma conexão quebrada com um agente externo sem reiniciar, menor consumo de memória em sessões longas, erros de conexão que identificam o host inacessível — e uma correção importante para quem conecta servidores MCP: a autenticação OAuth falhava com servidores que exigiam escopos não padrão.

A Mistral, por sua vez, disponibilizou o GLM 5.2 no Vibe Code, seu agente de codificação, para os planos Pro e Team. O ponto relevante não é o modelo, mas a forma como ele é fornecido: a Mistral o hospeda na Europa em sua própria infraestrutura. Portanto, um desenvolvedor europeu que utiliza o GLM 5.2 no Vibe Code envia uma inferência operada pela Mistral, sem que suas solicitações passem pelos servidores da Z.ai. Essa é a tradução concreta do posicionamento de inferência regional que a empresa defende desde agosto — e a situação é duplamente reveladora, pois a Mistral possui sua própria família Devstral e, ainda assim, opta por oferecer em sua ferramenta um modelo de pesos abertos desenvolvido por um laboratório concorrente.

🔗 Notas de versão do Zed 1.18.0 · 🔗 GLM 5.2 no Vibe Code


NVIDIA: duas publicações de engenharia e uma aliança que muda de tutela

2 de setembro — Três publicações da NVIDIA no mesmo dia, duas técnicas e uma sobre governança.

A primeira publicação, terceira parte da série sobre co-design de modelos, apresenta cinco regras para ajustar o speculative decoding. A técnica é conhecida: um pequeno modelo de draft propõe vários tokens que o modelo-alvo verifica em uma passagem paralela. A questão prática continua em aberto — quantos tokens devem ser especulados e com qual mecanismo. Durante a verificação, o cálculo cresce com (1 + D), mas os acessos à memória permanecem inalterados: portanto, é preciso aumentar o comprimento do draft D até o ponto em que a verificação passe de memory-bound para compute-bound. Em um GEMM de especialista representativo, D = 7 permite alcançar esse regime com um oitavo do tamanho de batch necessário para D = 0. Quando a atenção domina o tempo de decodificação, o comprimento ideal torna-se D = 128/G − 1, em que G é o número de cabeças de consulta que compartilham uma cabeça KV; além disso, é preferível escolher valores nos quais G × (1 + D) seja um múltiplo de 128, o tamanho do tile do kernel de atenção. As medições baseiam-se no SPEED-Bench, o benchmark de speculative decoding da NVIDIA: tendo o Qwen 3.5 122B A10B como alvo, o draft externo 35B A3B alcança um comprimento de aceitação de 6 com D = 9. A publicação enfatiza um ponto frequentemente negligenciado — uma aceitação maior não significa uma aceleração maior — e termina com um alerta: um fine-tuning do alvo altera sua distribuição de saída, de modo que um drafter treinado para um determinado checkpoint pode perder aceitação mesmo quando o alvo melhora.

A segunda publicação é um percurso de otimização CUDA em seis etapas, construído em torno de um único exemplo: converter três imagens RGB em tons de cinza e, em seguida, calcular a mediana de cada tile de 32 × 32 pixels. O ponto de partida é um código intencionalmente defeituoso, que o Compute Sanitizer diagnostica imediatamente — uma escrita fora dos limites na memória compartilhada, causada pelo uso de um índice global onde se esperava um índice de bloco.

Etapa de otimizaçãoTempo totalGanho da etapa
Código inicial6,8 s
CUB (DeviceTransform e BlockRadixSort)635 msaproximadamente 10x
Contêineres de memória em poolaproximadamente 244 msaproximadamente 2,6x
Memória fixada25 msaproximadamente 10x
Um stream CUDA por imagem23 msaproximadamente 300x acumulado

A substituição do algoritmo caseiro de bubble sort por cub::BlockRadixSort reduz, por si só, o cálculo das medianas de 2,142 s para 773 µs, um fator de 2717. Nenhuma dessas etapas envolve otimização de baixo nível: são substituições de API.

Por fim, a Open Secure AI Alliance, que a NVIDIA ajudou a fundar, passa a integrar a Linux Foundation. A tese defendida pela aliança desloca o foco do debate habitual: um agente não é apenas um modelo de linguagem, mas um sistema de software composto por modelos, harnesses que lhe fornecem contexto e guardrails que limitam o que ele pode fazer. No entanto, a discussão sobre segurança concentrou-se amplamente apenas no modelo, embora a segurança dependa do conjunto — harnesses, mecanismos de alinhamento, ambientes de execução, identidade, políticas, observabilidade e recuperação. Está aberta uma chamada para comentários sobre o SAFE (Shared AI Findings Exchange), um mecanismo de coleta confidencial de incidentes e quase incidentes relacionados à IA, em colaboração com a OpenSSF.

🔗 Speculative decoding · 🔗 Otimização CUDA passo a passo · 🔗 Open Secure AI Alliance


Equinix Inference Exchange, modelos abertos em 280 data centers

2 de setembro — A Equinix anunciou o Equinix Inference Exchange, um programa de inferência de IA distribuída que amplia sua colaboração com a NVIDIA e acrescenta a Together AI. A estrutura baseia-se em três camadas: a Equinix fornece a infraestrutura física conectada às clouds por meio do Equinix Fabric, a NVIDIA oferece suas arquiteturas de referência empresariais validadas, e a Together AI opera a plataforma sobre essa base com suporte a mais de 200 modelos open source, em implantação compartilhada ou em ambiente dedicado de locatário único.

O argumento centra-se na localização da inferência, e não na escolha do modelo, com três casos em vista: inferência na borda metropolitana para reduzir a latência, migração de cargas de modelos proprietários fechados para alternativas abertas e IA soberana para empresas regulamentadas. Os números da presença física mostram a dimensão da rede mobilizada: mais de 280 data centers em 77 áreas metropolitanas, 230 pontos de acesso à cloud e mais de 10.500 empresas interconectadas.

Há, contudo, um ponto de atenção quanto ao cronograma: o comunicado da Equinix afirma claramente que a solução estará disponível a partir do primeiro trimestre de 2027, enquanto a mensagem da Together AI descreve sua plataforma como já ativa nos data centers globais da Equinix. Trata-se de um anúncio de parceria e roadmap, não de uma entrada em operação.

🔗 Comunicado da Equinix


BenchMIRT, o método da Ai2 para auditar o que os benchmarks realmente medem

1 de setembro — A Ai2 publicou o BenchMIRT, um método que faz uma pergunta raramente abordada de frente: um benchmark mede realmente a capacidade que afirma medir? Em vez de raciocinar com base na pontuação final, ele desce ao nível de cada pergunta e estima quais capacidades realmente determinam o sucesso, apoiando-se na teoria de resposta ao item (Item Response Theory), oriunda da psicometria, em sua variante multidimensional. O treinamento utilizou os resultados de 100 modelos de pesos abertos, 16 benchmarks e mais de 34.000 perguntas.

O resultado mais sólido é metodológico: sem que lhe fosse indicado qual benchmark deveria medir o quê, o BenchMIRT identificou por conta própria duas dimensões dominantes, segurança e raciocínio geral, encontradas de forma idêntica ao repetir a análise do zero.

Benchmark auditadoCorrelação com o raciocínioCorrelação com a segurançaVeredito da auditoria
MMLU-Pro0,97-0,21Condiz com seu objetivo declarado
BBQ0,85-0,06Acompanha o raciocínio apesar de ser um teste de segurança
WMDP-0,890,21Mede a ausência de conhecimentos perigosos
ToxiGen0,40-0,32Fraco em ambos, benchmark saturado em 92 %

O BBQ, criado para testar se um modelo se apoia em estereótipos sociais, apresenta, portanto, uma correlação de 0,85 com o raciocínio geral e nenhuma correlação com a segurança: uma pontuação ruim talvez diga mais sobre o raciocínio do modelo do que sobre seu comportamento. A segunda contribuição é prática: ao classificar as perguntas por poder discriminante, a Ai2 mostra que, mantendo apenas 10 %, preserva-se aproximadamente a mesma classificação dos modelos e que o método prevê corretamente a resposta a uma pergunta não observada em 79 % dos casos, contra 70 % para uma abordagem ingênua. Duas limitações são reconhecidas: todos os modelos de treinamento são anteriores a março de 2025, e as dimensões descobertas dependem do conjunto de benchmarks fornecido.

🔗 BenchMIRT


Runway Dev MCP, o agente de codificação assume o controle da integração de mídia

2 de setembro — A Runway lançou o Runway Dev MCP, um servidor MCP hospedado que conecta sua plataforma para desenvolvedores diretamente à ferramenta de codificação usada no dia a dia — Claude, ChatGPT, Codex ou Cursor. O argumento resume-se a uma frase: o agente que escreveu a integração agora pode escolher o modelo adequado para ela, configurar as ferramentas nas quais ela se apoia e depurá-la.

O serviço abrange os três momentos de uma integração. Antes da primeira chamada de API, o agente consulta o catálogo para saber quais modelos um projeto pode utilizar, a que preço e com quais entradas, e então obtém o esquema exato de solicitação do modelo escolhido — o objetivo é fazer a chamada corretamente já na primeira tentativa, em vez de adivinhar. Em produção, ele cria e configura um Model Router que arbitra entre vários modelos de acordo com custo, latência ou qualidade, com um limite de custo por geração, e pode identificar qual modelo o router escolheu para uma determinada chamada. A mesma lógica aplica-se aos Characters. O terceiro momento é a depuração: quando uma geração falha, o agente consulta a tarefa por meio de uma ferramenta definida e lê o motivo exato da recusa — rejeição por moderação, limite de tamanho do asset, corpo da solicitação malformado — antes de corrigir e executar novamente. Um menu Quickstart cria a chave de API e, em seguida, abre Claude Code, Codex ou Cursor com uma mensagem já redigida.

🔗 Runway Dev MCP


DreamX-Creator 1.0, geração nativa de áudio e vídeo em 2K a partir de uma única imagem

2 de setembro — A equipa AMAP da Alibaba apresentou o DreamX-Creator 1.0, um modelo de 7 mil milhões de parâmetros sob licença Apache 2.0 que parte de uma única imagem e de um prompt de texto para produzir fluxos de vídeo e áudio sincronizados nativamente em 2K, sem encadear em cascata um modelo de vídeo e um modelo de áudio.

O sistema estrutura-se em três componentes: uma atenção cruzada intermodal com portas (Gated Cross-Modal Attention), associada a um treino conjunto progressivo, que permite uma interação bidirecional entre os dois fluxos; aprendizagem por reforço audiovisual alimentada por feedback multimodal sensível à modalidade; e um refinamento autorregressivo numa única etapa que eleva o vídeo a 2K, preservando simultaneamente o movimento e a sincronização temporal do áudio.

A publicação continua parcial nesta fase. O repositório GitHub, inicializado no dia anterior, contém a apresentação do projeto e o seu roteiro, e o relatório técnico foi publicado no arXiv. Os pesos validados, o código de inferência, as configurações e as ferramentas de avaliação continuam assinalados como marcos ainda não alcançados. O trabalho baseia-se no Wan2.2 e no MOVA da OpenMOSS, ambos explicitamente reconhecidos.

🔗 Anúncio do DreamX-Creator 1.0


A API da OpenAI distingue um aumento de carga demasiado rápido de uma sobrecarga do modelo

2 de setembro — A OpenAI alterou a forma como a sua API assinala duas situações que as aplicações cliente até agora não conseguiam distinguir.

Estado HTTPCódigo de erroSignificadoProcedimento a seguir
429slow_downO débito de pedidos aumentou demasiado depressaRespeitar Retry-After, reduzir o débito e depois aumentá-lo progressivamente
503server_is_overloadedO modelo solicitado está temporariamente sobrecarregadoRespeitar Retry-After e tentar novamente; aumentar o intervalo se o erro persistir

A distinção tem uma consequência prática imediata para qualquer código de retry. A documentação esclarece que um erro slow_down pode ocorrer mesmo quando o tráfego permanece dentro dos limites de pedidos e tokens por minuto da organização: não indica uma quota esgotada, mas uma aceleração considerada demasiado brusca — por outras palavras, uma aplicação pode ser limitada sem ter ultrapassado qualquer limite apresentado. O guia de limites de débito propõe uma regra empírica: quando o tráfego atingir um milhão de tokens de entrada por minuto, não o aumentar mais de 50% a cada quinze minutos. Quando o cabeçalho Retry-After está ausente, a OpenAI recomenda um backoff exponencial acompanhado de um pequeno atraso aleatório, para evitar que todas as instâncias do mesmo serviço tentem novamente em simultâneo. As organizações cujo tráfego baseado na utilização esbarra regularmente nestes limites são encaminhadas para o Scale Tier e, no caso do GPT-5.6 e dos modelos posteriores, para o Reserved Tier.

🔗 Changelog da API da OpenAI


Notícias breves

  • Claude Code 2.1.258 — versão exclusivamente corretiva: o arranque no macOS 12 Monterey, que estava avariado desde a versão 2.1.255, foi restaurado, e as sessões remotas e agendadas deixaram de falhar após uma nova aprovação de permissão. 🔗 CHANGELOG
  • Claude Campus Ambassadors — as candidaturas estão abertas com três percursos distintos este ano: licenciatura, pós-graduação, doutoramento e pós-doutoramento. 🔗 Anúncio
  • Nokia analisa 50 milhões de linhas de código com o Cursor — dois engenheiros da divisão Core Networks em duas semanas, quando a equipa estimava que teria de mobilizar cerca de doze especialistas durante vários meses. Estudo de caso do fornecedor, sem protocolo de medição independente. 🔗 Estudo de caso
  • TranslatePsy-Nano — a Tether AI Research publica duas famílias de modelos de tradução compactos, EuroNano para nove línguas europeias e AfriNano para oito línguas africanas, em variantes de 42, 31 e 17 MB, com um único checkpoint por grupo linguístico. 🔗 Anúncio
  • Puffin-World — um modelo multimodal unificado que representa o mundo através de três estados nativos — física, geometria e aparência —, publicado juntamente com o conjunto de dados Puffin-16M. 🔗 Apresentação
  • Especialistas de um MoE residentes em NVMe — a i64 Systems mantém os pesos dos especialistas em NVMe, com verificação através de um manifesto SHA-256, e mede resultados idênticos byte a byte entre o caminho alugado e o caminho residente. 🔗 Artigo técnico
  • Sakana AI na CiNet International Conference — Llion Jones, diretor técnico, e o investigador Kai Arulkumaran darão uma conferência sobre as pontes entre neurociências e machine learning, de 5 a 7 de outubro de 2026, em Osaka. 🔗 Anúncio
  • Gemini CLI, nightly de 2 de setembro — uma única alteração: a melhoria da validação do destino e do encaminhamento de ligações nos utilitários de recuperação web, dando continuidade ao reforço da segurança da rede iniciado no final de agosto. 🔗 Notas de versão
  • MrBeast estabelece uma parceria plurianual com a Google — o acordo estende para além do YouTube a relação com a Beast Industries, abrangendo o Gemini e a Google Health, com um primeiro vídeo a 5 de setembro no qual o Gemini é utilizado para sobreviver na selva, no deserto e no Ártico. 🔗 Anúncio
  • Resumo dos anúncios de IA da Google em agosto — artigo mensal que agrega elementos já abordados ao longo do mês, sem novidades próprias. 🔗 Resumo
  • Enterprise Live Migrations em disponibilidade geral — migração de repositórios do GitHub Enterprise Server para a cloud com residência de dados e uma interrupção quase nula, controlada pela extensão gh elm. Sem relação com IA, assinalado por uma questão de exaustividade. 🔗 Changelog
  • ElevenLabs nomeia Ashley Kramer diretora de receitas — única publicação da empresa durante o período, uma vez que o changelog do produto não é atualizado desde 24 de agosto. 🔗 Anúncio
  • NVIDIA transmite um direto sobre o DGX Spark no Portable Computer da Perplexity — vinte e seis minutos dedicados à sua execução local, sem texto descritivo nem transcrição. É a segunda demonstração do dia a tornar o DGX Spark um alvo de portabilidade local. 🔗 Transmissão
  • Kling AI documenta os Elements do seu servidor MCP — tutorial sobre a preservação da identidade de uma personagem entre planos; conteúdo pedagógico sobre o produto, e não um lançamento. 🔗 Tutorial
  • Codex CLI 0.152.1 — versão corretiva publicada cerca de vinte horas após a 0.152.0: a revisão de aprovação do Guardian respeita agora as políticas do REPL Node transmitidas pelos metadados do modelo. 🔗 Notas de versão
  • Cohere defende a aposta em modelos pequenos nas empresas — o fornecedor reúne Command R7B, Tiny Aya com 3,35 mil milhões de parâmetros e North Mini Code, ao qual são atribuídos 33,4 pontos no Coding Index da Artificial Analysis, para defender o dimensionamento adequado. Nenhum lançamento. 🔗 Artigo
  • Perplexity publica dois guias pedagógicos — sobre assistentes pessoais e sobre a deteção de alucinações. O segundo descreve um pós-treino em duas etapas: a primeira desenvolve os comportamentos do produto e a segunda apoia-se em tarefas de pesquisa mais difíceis. 🔗 Guia

O que isto significa

O preço tornou-se o principal argumento, incluindo entre os modelos de fronteira. Três lançamentos no mesmo dia, e nenhum destaca uma pontuação recorde. A Google mantém o preço da geração anterior para o Gemini 3.8 Flash e admite que o seu modelo consome mais tokens — uma confissão rara, que transfere a questão do preço anunciado para o custo real de uma tarefa. O Qwen reivindica explicitamente o topo da fronteira de Pareto da Arena, em vez do primeiro lugar absoluto. A Meta quantifica o seu ganho não em pontos de benchmark, mas numa redução de 20% das chamadas de ferramentas e de 25% dos tokens. E a tabela do CursorBench fornece a medida mais reveladora do dia: com 69,2%, o Gemini 3.8 Flash custa 2,38 dólares por tarefa, enquanto uma pontuação equivalente exigia 4,80 no Fable 5.1 e 7,35 no Opus 5. Contudo, a coluna das etapas recorda que este preço tem um custo noutro lado — 161 etapas contra 44.

A engenharia do harness torna-se uma alavanca económica mensurável. O artigo do GitHub é o documento mais útil do dia para quem desenvolve com base nestes modelos: quatro otimizações que não alteram o modelo e que poupam entre 2% e 5% cada uma, com as experiências falhadas documentadas. O guia de engenharia da Anthropic afirma o mesmo a partir da outra extremidade — visar entre 90% e 99% de sucesso de cache desde a conceção, custo por tarefa concluída em vez de por chamada. Ambos convergem num ponto que a corrida aos modelos oculta: mantendo o modelo constante, o harness determina uma parte significativa da fatura, e os ganhos não se transferem de um produto para outro. O GitHub demonstra-o ao verificar que uma otimização eficaz em code review aumentou o custo no CLI.

A inferência está a chegar ao posto de trabalho, e o local da computação torna-se um parâmetro de conceção. O FastH3 permite executar a geração de vídeo num Mac ou computador de secretária, a Perplexity abre o código de um motor que executa apenas um modelo num único tipo de hardware, a Tether publica tradutores de 17 MB, a i64 Systems coloca especialistas de MoE em NVMe e a Cohere defende o dimensionamento adequado. Este movimento converge, a partir do topo, com o da Equinix, NVIDIA e Together AI, que distribuem a inferência por 280 centros de dados por motivos de latência e soberania. O fio condutor não é a miniaturização, mas a especialização: o Lily vence porque rejeita tudo o que não seja Qwen3.6-35B-A3B em Apple Silicon, e a aposta da Perplexity é que esta estreiteza constitui uma vantagem, não uma limitação.

O controlo e a governação estão a tornar-se mais rigorosos e passam agora tanto pelo contrato como pela técnica. O GitHub impõe a retenção de dados para o Fable 5.1 — com uma isenção que expira no final do ano civil —, ao mesmo tempo que permite que cada equipa empresarial escolha o modelo predefinido, e remove seis modelos do catálogo no mesmo dia. O Cursor transfere a execução dos agentes para a rede do cliente, esclarecendo simultaneamente que as transcrições continuam a ser processadas nas suas instalações. A Google reserva o seu modelo de ciberdefesa a 650 parceiros selecionados, sob condições operacionais escritas. A Mistral disponibiliza um modelo chinês a partir da Europa e transforma esse facto num argumento. Por fim, o BenchMIRT recorda que as ferramentas de avaliação nas quais assenta uma parte destas decisões também merecem uma auditoria: um benchmark de viés social que apresenta uma correlação de 0,85 com o raciocínio geral e de -0,06 com a segurança não mede aquilo que o seu rótulo anuncia.


Fontes