Pesquisar

Mistral Large 4 em versão preliminar, Claude chega ao Google Docs, Sheets e Slides, Anthropic alarga o seu programa de cibersegurança

ai-powered-markdown-translator

Artigo traduzido do fr para o pt com gpt-6.1-sol.

Ver projeto no GitHub ↗

A Mistral disponibiliza uma versão preliminar do Mistral Large 4, um modelo multimodal de 1 000 mil milhões de parâmetros cuja API está acessível a todos a partir de hoje e cujos pesos estão prometidos para o final de outubro. A Anthropic instala Claude no Google Docs, Sheets e Slides e reformula o seu programa de verificação de cibersegurança em três níveis de acesso, enquanto a Google DeepMind publica EmbeddingGemma 2, um modelo de embeddings aberto e multimodal que cabe num telemóvel. Os modelos de decisão também têm o seu dia: a OpenAI abre a sua API Decisions em beta pública, a Perplexity reduz o seu preço para metade e uma classificação da comunidade compara-os.


Mistral Large 4: 1 000 mil milhões de parâmetros em versão preliminar, pesos prometidos para o final de outubro

6 de outubro — A Mistral AI lança uma versão preliminar pública do Mistral Large 4, apelidado de ML4 e, «muito oficialmente», de Chonk. É o maior modelo da empresa até à data: uma mistura de especialistas (Mixture-of-Experts) nativamente multimodal de 1 000 mil milhões de parâmetros (1T), dos quais 49 mil milhões ativos segundo o artigo de anúncio, que reúne instruções, raciocínio e capacidades agênticas num contexto de um milhão de tokens. A ficha da documentação apresenta outros números, sem explicar a diferença: 1 050 mil milhões de parâmetros, dos quais 52 mil milhões ativos, mais um codificador de visão de 1,6 mil milhões.

A API está aberta a todos a partir de hoje no Mistral Studio, mas os pesos ainda não foram publicados: a Mistral promete disponibilizá-los até ao final de outubro, com detalhes sobre a arquitetura e o pós-treino. Entretanto, o modelo é testado em condições reais por responsáveis de cibersegurança, parceiros verificados e autoridades estatais, que lhe acedem com uma moderação reduzida. O ML4 foi treinado de raiz em 3 800 GPU NVIDIA Grace Blackwell nos centros de dados europeus da Mistral, que também servem a versão preliminar. A empresa prevê uma implementação europeia que opera de ponta a ponta, ao abrigo do direito europeu, e apresenta o modelo como o primeiro marco do roteiro financiado pela sua Série D de 3 mil milhões de euros.

A cibersegurança é o argumento principal. Segundo a Mistral, o ML4 está entre os cinco primeiros modelos do Artificial Analysis Cyber Index e obtém 82 % num dos seus testes, que consiste em reproduzir uma vulnerabilidade real de um software open source e depois corrigi-la, a melhor pontuação de todos os modelos. A empresa afirma que Claude Opus 5.5 e GPT-6 Astra obtêm perto de zero nesse mesmo teste, porque recusam a tarefa.

Benchmark avaliadoPontuação anunciada pela MistralComparação citada pela Mistral
DeepSWE v1.161,7 %—
Coding Agent Index (combinado)49,8 %à frente de DeepSeek V4 Pro 0813 e Qwen3.8 Max
Avaliação humana às cegas da Surge AI (código, em 5)3,74, 2.º entre 5atrás de Claude Opus 5 (4,22)
Cybench (40 desafios)93 %—
AA Cyber Index, reproduzir e depois corrigir uma vulnerabilidade82 %melhor pontuação de todos os modelos
AutomationBench (657 processos de negócio)59,9 %à frente de Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro

O artigo e a ficha também divergem quanto ao preço: o cartão do artigo apresenta 1,36 dólar por milhão de tokens de entrada e 4,18 dólares de saída, enquanto a ficha risca essas tarifas e apresenta ao lado um preço reduzido para metade, sem indicar a duração nem dar explicações.

Característica do ML4Segundo o artigo de anúncioSegundo a ficha da documentação
Parâmetros totais1 000 mil milhões1 050 mil milhões
Parâmetros ativos49 mil milhões52 mil milhões
Entrada, por milhão de tokens1,36 dólar0,68 dólar (1,36 riscado)
Saída, por milhão de tokens4,18 dólares2,09 dólares (4,18 riscado)

Todas estas pontuações são da Mistral, que esclarece que a aprendizagem por reforço da versão preliminar continua sem sinais de saturação e espera progressos rápidos nas próximas semanas.

🔗 Artigo da Mistral sobre o Mistral Large 4 🔗 Ficha do Mistral Large 4 na documentação


Claude for Google Workspace: Claude instala-se no Docs, Sheets e Slides

6 de outubro — A Anthropic lança Claude for Google Workspace, um complemento (add-on) que abre Claude num painel lateral do Google Docs, Sheets e Slides, em beta pública em todos os planos pagos. Claude lê o ficheiro aberto, vê a seleção atual (texto, células ou diapositivos) e modifica o ficheiro no próprio local.

Aplicação GoogleO que Claude faz nela
DocsCorreções e alterações de estilo no próprio local, cartões de sugestão para aplicar ou ignorar em reformulações mais profundas
SheetsFórmulas, tabelas dinâmicas, gráficos nativos, novos separadores, processamento de um intervalo em Python para uma junção ou limpeza
SlidesDiapositivos criados a partir dos layouts e do tema da apresentação, verificação dos elementos que se sobrepõem ou ultrapassam os limites

O utilizador escolhe o grau de autonomia: no modo «pedir antes de editar» (Ask before edits), ativo por predefinição, cada alteração passa por um cartão de aprovação; no modo «aceitar tudo» (Accept all edits), Claude prossegue sem parar. Ligado à conta Claude, o painel disponibiliza os mesmos modelos, conectores e competências (skills). Nos planos Enterprise, a Compliance API, as chaves de encriptação geridas pelo cliente (CMEK) e a exportação de auditoria OpenTelemetry também se aplicam ao complemento.

Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.

🇵🇹 Claude funciona agora no Google Docs, Sheets e Slides, e estes ficheiros também se abrem no Claude. No Google Workspace, Claude aparece num painel lateral ao lado do seu ficheiro, lê o que tem aberto e modifica-o no próprio local. Pode aprovar cada alteração antes de esta ser aplicada. — @claudeai no X

A integração no sentido inverso chega ao mesmo tempo: novos conectores Google Docs, Sheets e Slides, também em beta, permitem criar e modificar ficheiros Google a partir de Claude, colando uma ligação ou pedindo um novo documento. Nas configurações suportadas, o ficheiro abre-se num painel ao lado da conversa, e o acesso de Claude segue as permissões de partilha da Google. O complemento instala-se a partir do Google Workspace Marketplace (Extensions > Claude > Open Claude) e os administradores podem implementá-lo a partir da consola Google Admin; nos planos Team e Enterprise, um proprietário tem primeiro de ativar os conectores. O Google Workspace junta-se assim ao Microsoft 365, onde Claude para Excel, PowerPoint e Word está em disponibilidade geral desde 7 de maio.

🔗 Artigo da Anthropic sobre Claude for Google Workspace


Cyber Verification Program: Anthropic abre o acesso a Opus 5.5, Sonnet 5.5 e Mythos 5.1 em três níveis

6 de outubro — A Anthropic reformula o seu programa de verificação de cibersegurança (Cyber Verification Program, CVP), que dá aos profissionais de segurança verificados acesso a capacidades que os seus modelos destinados ao público em geral bloqueiam. Há seis meses que coexistiam dois mecanismos: Project Glasswing, que dava acesso a Claude Mythos às organizações responsáveis pelos softwares mais críticos, e um CVP com um único nível que aligeirava as salvaguardas dos modelos Opus e Sonnet. Fundem-se agora em três níveis, todos com acesso a Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 e aos modelos futuros. Os modelos em disponibilidade geral (Opus 5.5, Fable 5.1, Sonnet 5.5) mantêm salvaguardas prudentes que bloqueiam a maior parte do trabalho de cibersegurança.

Nível de acessoUtilizações abrangidasPúblico-alvo e prazo
Defense AccessCentro de operações de segurança, resposta a incidentes, engenharia inversa de malware, análise de vulnerabilidadesEquipas de segurança, infraestruturas críticas de qualquer dimensão, responsáveis pela manutenção de projetos open source, investigadores; alguns dias
Red Team AccessUtilizações defensivas, mais testes de intrusão e exercícios de ataque simulado (red teaming) autorizadosApenas organizações, nos sistemas que estão autorizadas a testar; algumas semanas
Specialized AccessTestes de sistemas de segurança: aviação, redes elétricas, telecomunicações, transferências interbancárias, redes administrativasAlgumas organizações avaliadas individualmente em conjunto com o governo dos Estados Unidos; membros de Glasswing transferidos

No Red Team Access, as ações que podem causar danos físicos ou uma perturbação em grande escala, como implementar ransomware, continuam bloqueadas em tempo real. Para verificar as suas configurações, a Anthropic submeteu Opus 5.5 ao CyScenarioBench, uma avaliação de operações de cibersegurança em várias etapas, com as salvaguardas de cada nível (10 desafios, 5 tentativas cada).

Configuração testada pela Anthropic (Opus 5.5)Resultado no CyScenarioBench (50 tentativas)
Sem CVPTodas as tarefas bloqueadas logo no primeiro prompt
Defense Access46 tentativas bloqueadas a certa altura, 4 bem-sucedidas
Red Team AccessNenhum bloqueio, 34 tarefas concluídas com sucesso, o equivalente aos 67,6 % do modelo sem salvaguardas

O artigo também apresenta um primeiro balanço de Glasswing, com números parciais segundo a Anthropic: pelo menos 129 000 vulnerabilidades verificadas encontradas pelos parceiros entre abril e julho, mais 5 500 pelas análises open source da Anthropic, das quais mais de 33 000 classificadas como críticas ou de gravidade elevada. Estes números baseiam-se em 33 relatórios de parceiros, e a Anthropic estima que o impacto real seja «pelo menos cinco vezes superior». Num testemunho publicado no mesmo dia, a Comcast afirma ter encontrado com Claude Mythos Preview uma vulnerabilidade crítica de autenticação ao avaliar 258 sistemas e cerca de 170 milhões de linhas de código, e um analista da Booz Allen analisou 138 repositórios em doze dias.

Na prática, o programa exige a retenção de dados para monitorizar abusos, enquanto se aguarda o Enterprise Frontier Safeguards (EFS), que permitirá, mais tarde neste outono, manter esses dados num cloud controlado pelo cliente; as organizações que já utilizam Fable 5.1 ou Mythos 5.1 com retenção zero podem fazer o mesmo com o CVP. O programa está disponível no Claude Platform, Vertex AI e Microsoft Foundry, e no Amazon Bedrock apenas para os clientes elegíveis para EFS. Uma candidatura individual só é possível para Defense Access, num plano pago, e este nível terá de adotar até 15 de dezembro uma autenticação multifator resistente ao phishing e deixar de utilizar chaves API. Está previsto um webinar para 14 de outubro às 9 h PT.

🔗 Artigo da Anthropic sobre o Cyber Verification Program 🔗 Página de ajuda do Cyber Verification Program 🔗 Comcast e Booz Allen com Claude Mythos


EmbeddingGemma 2 : o modelo de embeddings aberto da Google torna-se multimodal

6 de outubro — A Google DeepMind lança EmbeddingGemma 2, a segunda geração do seu modelo de embeddings aberto concebido para funcionar no dispositivo. O primeiro EmbeddingGemma, descarregado mais de 20 milhões de vezes segundo a Google, processava apenas texto; o novo projeta texto (incluindo código), imagens, vídeo e áudio, isolados ou combinados, num mesmo espaço de 768 dimensões. Baseado na arquitetura de Gemma 4, é lançado sob a licença Apache 2.0.

Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.

🇵🇹 Apresentamos EmbeddingGemma 2, o nosso primeiro modelo aberto nativamente multimodal para embeddings no dispositivo. Vai além do texto para unificar código, imagens, áudio e vídeo num espaço partilhado. — @GoogleDeepMind no X

O modelo tem 740 milhões de parâmetros, mas é modular: um núcleo de texto de 270M ao qual se acrescentam, conforme necessário, um codificador de visão (170M) e um codificador de áudio (300M). Uma aplicação exclusivamente de texto carrega, assim, apenas 270M parâmetros. Com quantização, a Google mede num Pixel 11 Pro cerca de 191 Mo de RAM ativa para os pesos de texto e 567 Mo para o modelo multimodal completo.

Característica de EmbeddingGemma 2Valor anunciado pela Google
Parâmetros no total740M (texto 270M, visão 170M, áudio 300M)
Dimensões dos vetores768, truncáveis para 512, 256 ou 128
Janela de contexto8K tokens, quatro vezes a da primeira versão
RAM ativa no Pixel 11 Pro (quantizado)cerca de 191 Mo só com texto, 567 Mo em multimodal
MTEB Code78,68, face a 68,76 na primeira versão
MTEB multilingue v261,36, face a 61,15 na primeira versão

A aprendizagem de representações «em bonecas russas» (Matryoshka Representation Learning) permite encurtar os vetores, reduzindo até seis vezes o espaço de armazenamento; segundo a ficha do modelo, a qualidade é pouco afetada até 256 dimensões, e 128 dimensões são sobretudo adequadas a utilizações exclusivamente de texto. A melhoria mais acentuada diz respeito ao código, com quase dez pontos adicionais no MTEB Code segundo a Google, enquanto o texto multilingue se mantém ao nível anterior.

As utilizações visadas são a pesquisa e a geração aumentada por recuperação (RAG) inteiramente locais, por exemplo, encontrar um excerto de um vídeo a partir de uma nota de voz. Como o modelo partilha o segmentador de texto (tokenizer) e o codificador de áudio de Gemma 4, ambos podem funcionar em conjunto com uma utilização de memória reduzida. Os pesos estão disponíveis no Hugging Face e no Kaggle; a chegada ao Model Garden da Gemini Enterprise Agent Platform é anunciada para «breve», sem data. O modelo é suportado desde o lançamento por Transformers (versão 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama e LM Studio, bem como no navegador com transformers.js.

🔗 Anúncio no blog da Google 🔗 Ficha do modelo EmbeddingGemma 2 🔗 Pesos no Hugging Face


Modelos de decisão : a OpenAI abre a sua API Decisions, a Perplexity lança Decider v1.1 e reduz o preço para metade, o Decision Index 0.3 classifica-os

Os modelos de decisão, que escolhem uma opção ou atribuem um score a uma entrada em vez de redigirem uma resposta livre, tiveram o seu dia: dois fornecedores revêm a sua oferta e os preços, e a classificação comunitária da categoria muda de método.

A API Decisions da OpenAI em beta pública

6 de outubro — Uma semana depois da sua abertura com acesso limitado no DevDay, a API Decisions da OpenAI passa a beta pública, com disponibilidade geral prevista «nas próximas semanas». Responde a perguntas fechadas sobre um texto, uma imagem ou ambos, com GPT-6 Luna, o único modelo disponível, através de um endpoint dedicado (POST /v1/decisions); segundo a OpenAI, as suas respostas tipadas chegam cerca de 10 vezes mais depressa do que com a Responses API. A novidade do dia é o preço: 0,10 dólares por milhão de tokens de entrada, sem cobrança pela saída nem pela cache, acrescido dos custos adicionais de processamento regional e de contexto longo.

Tipo de perguntaUtilização visadaResultado devolvido
Predicado (predicate)Verificar uma condição, como um produto danificado numa fotografiaProbabilidade de 0 a 1 de a condição ser verdadeira
Escolha (choice)Selecionar uma opção numa lista fornecidaA opção, a probabilidade de cada uma e um índice de confiança
Score (score)Avaliar segundo níveis ordenados, como a gravidade de um incidenteMédia dos níveis ponderada pelas probabilidades

Várias perguntas podem incidir sobre a mesma entrada num único pedido, e as imagens devem ser enviadas em base64, sem URL alojado nem identificador de ficheiro. A API suporta a não retenção de dados (Zero Data Retention) e utilizações HIPAA para clientes elegíveis, com residência dos dados nos Estados Unidos e na Europa.

🔗 Guia da API Decisions 🔗 Changelog da API da OpenAI

pplx-decider-v1.1-27b da Perplexity e o preço reduzido para metade

6 de outubro — Cinco dias depois de lançar a sua própria Decisions API, a Perplexity atualiza o modelo que a faz funcionar, numa sequência de publicações da sua conta para programadores, @perplexitydevs. Publicado com pesos abertos sob a licença Apache 2.0 no Hugging Face, pplx-decider-v1.1-27b mantém a base Qwen3.8-27B da v1, lê texto e imagens num contexto de 250k tokens e remove a máscara causal (causal mask) das suas camadas de atenção completa. A Decisions API, que passa a disponibilizar este modelo, custa 0,02 dólares por milhão de tokens de entrada, metade dos 0,04 dólares da v1, e a saída continua gratuita.

Categoria do Decision Index (ficha do Hugging Face)Score de JevScore da v1Score da v1.1
Conhecimentos (Knowledge)51,440,948,18
Linguagem (Language)62,063,569,45
Recuperação de informação (Retrieval)55,454,961,26
Ferramentas (Tools)75,179,378,88
Artes (Arts)37,739,444,66
Score global ponderado57,956,461,56

Segundo a ficha do modelo, o score global passa de 56,4 para 61,56, à frente dos 57,9 de Jev, o modelo de decisão da TypeSafe AI, que continua, contudo, à frente em conhecimentos. A Perplexity afirma também obter o melhor score do novo Decision Index 0.3. Para o alojar por conta própria, é necessário um GPU capaz de acomodar cerca de 49 Gio de pesos e a implementação fornecida, pois uma inferência causal padrão não reproduz o comportamento medido.

🔗 A sequência de publicações de @perplexitydevs no X 🔗 pplx-decider-v1.1-27b no Hugging Face

O Decision Index 0.3

6 de outubro — apolinario, engenheiro no Hugging Face, publica a versão 0.3 do Decision Index, a classificação comunitária dos modelos de decisão abertos que reproduzem o Decision Model de Jev. Conta agora com 112 modelos, incluindo 111 reproduções abertas, que funcionam numa NVIDIA RTX PRO 6000. O método muda: o score completo (Full score) combina 37 bancos de testes públicos, testes privados que medem as mesmas competências e tarefas privadas provenientes de novos domínios, para que a posição reflita competências e não apenas o sucesso em bancos de testes conhecidos. Surge também um separador de visão.

Posição apresentadaModelo classificadoScore completo
1Perplexity Decider v1.1 (27B)62,8
2Fastino GLiDE sem reflexão (28B)60,2
ReferênciaJev60,1
3Torchcast Decision 27B59,9
4deck31b (Gemma 4 31B)59,0

Os dois scores de Decider v1.1 são distintos: 61,56 é o publicado na ficha da Perplexity, 62,8 é o calculado por esta classificação com o seu novo método. Os testes privados, pela sua natureza, não são publicados.

🔗 O anúncio de apolinario no X 🔗 O Decision Index 0.3


Controlo do computador : a OpenAI treina GPT-6 Astra com os contratos da Ironclad

6 de outubro — A OpenAI lança colaborações de investigação com fornecedores de software para tornar os seus agentes mais eficazes no software empresarial, uma iniciativa de controlo do computador (computer use), e começa pela Ironclad, especialista em contratos assistidos por IA. As equipas definiram 11 tarefas nas áreas jurídica, comercial e de compras, de 30 a 40 minutos cada para um utilizador experiente segundo a OpenAI, avaliadas segundo 8 a 50 critérios. A Ironclad forneceu ambientes alojados do seu software, onde os modelos foram treinados por aprendizagem por reforço em tarefas sintéticas extraídas de contratos públicos da base EDGAR da SEC.

Medição da OpenAI nas 11 tarefasGPT-5.6 Sol (raciocínio High)GPT-6 Astra (raciocínio Max)
Score médio41,6 %55,0 % (+32 %)
Tempo médio estimado por tentativa (simulado)37,0 minutos19,2 minutos (-48 %)

GPT-6 Astra é o primeiro modelo de fronteira da OpenAI treinado nestas tarefas, e um modelo interno utilizado durante o seu desenvolvimento atinge 63,7 %. Estes números são da OpenAI, e os tempos são simulados a partir de velocidades de processamento assumidas, sem medições junto de clientes. A OpenAI convida outros fornecedores a proporem tarefas que os agentes atuais ainda não conseguem realizar de forma fiável.

🔗 Publicação da OpenAI sobre a sua colaboração com a Ironclad


API e plataformas : níveis e BAA da API da OpenAI, documentos e imagens na Agent API da Perplexity, GLM-5.3 no Bedrock

Quatro alterações dizem respeito aos programadores que compram inferência: as condições de acesso à API da OpenAI, as ferramentas da Agent API da Perplexity e um novo modelo aberto no catálogo da AWS.

Os níveis de utilização da API da OpenAI passam de cinco para três

6 de outubro — A OpenAI simplifica o acesso aos limites de taxa (rate limits) mais elevados da sua API: os cinco níveis de utilização pagos passam a três, Build, Launch e Grow. O mais elevado, Grow, obtém-se com 500 dólares de pagamentos acumulados pela API, face aos 1 000 dólares do antigo nível mais elevado. As organizações que já estão num nível pago transitam automaticamente, sem qualquer ação da sua parte, e depois sobem de nível quando as suas compras acumuladas de créditos atingem os limiares; o nível gratuito continua limitado a 100 dólares por mês.

Nível de utilizaçãoLimiar de compras acumuladasLimite de utilização mensalAstra, Sol e Terra (pedidos e tokens por minuto)Luna (pedidos e tokens por minuto)
Build5 dólares500 dólares5 000 e 1 000 0005 000 e 2 000 000
Launch100 dólares5 000 dólares10 000 e 4 000 00010 000 e 10 000 000
Grow500 dólares200 000 dólares15 000 e 40 000 00030 000 e 180 000 000

🔗 A sequência de publicações de @OpenAIDevs no X 🔗 Documentação dos limites de taxa

O BAA e a conformidade HIPAA em autosserviço na API da OpenAI

5 de outubro — As organizações que tratam dados de saúde protegidos com a API da OpenAI podem agora assinar por si próprias o acordo de parceiro comercial (Business Associate Agreement, BAA) exigido pela lei norte-americana HIPAA. Em Settings > Organization > General, um administrador aceita o BAA padrão e ativa o suporte de conformidade HIPAA, sem contrato empresarial. Este autosserviço está reservado às organizações elegíveis com um histórico estabelecido de utilização da API, e a ativação não pode ser anulada nestas definições. As cláusulas personalizadas continuam a exigir um pedido por e-mail, com resposta num prazo de um a dois dias úteis. A OpenAI recorda que assinar o BAA não torna, por si só, uma aplicação conforme, e que não é disponibilizado qualquer BAA para ChatGPT Business.

🔗 Artigo de ajuda da OpenAI sobre o BAA da API

A Agent API da Perplexity lê documentos e procura imagens

5 de outubro — O changelog da API da Perplexity recebe três entradas ao final da noite. A Agent API passa a aceitar como entrada documentos PDF, DOC, DOCX, TXT e RTF, integrados no pedido ou indicados por um URL HTTPS público, dependendo o suporte do modelo e do fornecedor escolhidos. Uma nova ferramenta, image_search, procura imagens na web e devolve resultados estruturados, com o endereço da imagem e o da sua página de origem: de 1 a 30 imagens por chamada, 5 por predefinição, filtros de domínios e de formatos, e pesquisa segura ativada por predefinição. Custa 2,50 dólares por 1 000 invocações bem-sucedidas, e as chamadas falhadas não são cobradas. A terceira entrada corrige a contabilização dos custos: as respostas passam a detalhar o custo das extrações realizadas no sandbox, mantendo o preço de GPT-6 Luna.

🔗 Changelog da API da Perplexity 🔗 Documentação da ferramenta image_search

GLM-5.3 da Z.ai no Amazon Bedrock

6 de outubro — A Z.ai anuncia a chegada de GLM-5.3, o seu principal modelo com pesos abertos, ao Amazon Bedrock; a ficha da AWS indica 5 de outubro como data de lançamento. É uma mistura de especialistas com 744 mil milhões de parâmetros, dos quais cerca de 40 mil milhões ativos por token, com um contexto de um milhão de tokens e até 128 000 tokens de saída. O acesso está reservado aos clientes elegíveis, através da sua equipa de gestão de conta AWS, e o modelo só é disponibilizado em inferência entre regiões (perfil US ou global), com cache de prompts a partir de 1 024 tokens e os níveis de serviço Standard, Priority, Flex e Reserved. A ficha não indica preços e remete para a página de preços do Bedrock. GLM-5.3 segue-se a Kimi K3 (22 de setembro) e Grok 4.7 (28 de setembro), que chegaram ao Bedrock nas últimas duas semanas.

🔗 Ficha de GLM 5.3 no Amazon Bedrock 🔗 O anúncio da Z.ai no X


Agentes de código : Claude Code 2.1.290 a 2.1.292, sessões cloud, Vibe CLI 2.26.0, Antigravity e Replit

Os agentes de código recebem cinco atualizações, do terminal ao editor: três versões de Claude Code em menos de vinte horas, um guia das sessões cloud, uma Vibe CLI cuja nova interface em Rust ganha funcionalidades, a extensão Antigravity para VS Code e um Replit que vê todos os projetos do utilizador.

Claude Code 2.1.290 a 2.1.292

5 e 6 de outubro — Publicada a 5 de outubro às 23 h 33 UTC, Claude Code 2.1.290 é uma versão extensa: 190 entradas, das quais 131 são correções. claude attach e claude logs aceitam parte do nome de uma sessão em vez do seu identificador, e /claude-api managed-agents-onboard transforma o modelo Managed Agents descrito numa página web em ficheiros ant apply. O orçamento de pesquisa web da sessão interativa deixa de se esgotar após 200 chamadas: recarrega ao ritmo de 100 chamadas por hora. No nível de esforço médio (medium), /code-review também assinala os desvios às convenções de CLAUDE.md no Opus 5.5 e no Sonnet 5.5. No Slack, Claude Tag ganha um modo rápido (!fast), uma chamada browser_batch de Claude in Chrome dispõe de 90 segundos em vez de 60, e WebFetch deixa de cortar silenciosamente o texto para além de 100 000 caracteres. pyright e mais formas de ps exigem permissão, e várias falhas de permissões são corrigidas: caracteres universais de rg e git grep expandidos pelo shell, ficheiros CLAUDE.md ligados fora das pastas de trabalho, mod da organização contornado por um mod do utilizador. Quatro horas depois, a 2.1.291 corrige duas regressões, uma surgida com a 2.1.290 (respostas aos pedidos de permissão perdidas nas sessões cloud), outra com a 2.1.288 (as últimas mensagens de uma sessão perdidas ao sair).

A 6 de outubro às 18 h 59 UTC, a 2.1.292 (92 entradas, das quais 64 são correções) acrescenta um parâmetro effort à ferramenta Agent, para lançar um subagente no nível de esforço pedido, e claude plugin install --marketplace, que acrescenta a loja (marketplace) se necessário e depois instala o plugin. Os servidores MCP locais (stdio) passam a negociar por predefinição o protocolo 2026-07-28 (MCP_PROTOCOL_NEGOTIATION=legacy para reverter), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS prolonga as novas tentativas em caso de erros 529, e os mods ganham um evento de preenchimento automático do prompt e o cache de prompt. Em matéria de segurança, as aprovações de um hook PreToolUse e o modo auto deixam de contornar o pedido de permissão para leituras de caminhos de rede (UNC), e as etiquetas <system-reminder> escritas por um hook são escapadas antes de chegarem ao Claude. A ferramenta Artifact passa finalmente a listar 200 artefactos em vez de 50, e Code Review discrimina as suas estatísticas por repositório. Nem a 2.1.290 nem a 2.1.292 foram anunciadas no X.

Versão de Claude CodeData de publicação (UTC)Número de entradasPrincipal novidade
2.1.2905 de outubro, 23 h 33190, das quais 131 correçõesSessões identificadas pelo nome, managed-agents-onboard, orçamento WebSearch recarregado
2.1.2916 de outubro, 3 h 552 correçõesDuas regressões corrigidas
2.1.2926 de outubro, 18 h 5992, das quais 64 correçõesEsforço dos subagentes, plugin e loja num só comando, MCP 2026-07-28

🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292

O guia das sessões cloud de Claude Code

6 de outubro — Duas semanas após o lançamento da prévia das sessões cloud de Claude Code, a Anthropic publica em claude.dev um guia prático assinado por Addy Osmani. Cada tarefa corre numa máquina virtual nova com cerca de 4 vCPU, 16 Go de RAM e 30 Go de disco, com o repositório clonado num novo ramo, sem custos adicionais de computação nos planos Pro, Max, Team e Enterprise. O guia descreve sete utilizações: esvaziar em paralelo uma lista de tarefas pendentes (backlog), comprovar uma correção através de execuções repetidas, planear localmente e depois retomar a sessão com claude --teleport, acompanhar pelo telemóvel, confiar as falhas de CI e os comentários de revisão ao Auto-fix, desencadear rotinas e executar código pouco seguro numa VM descartável. Na demonstração, as três sessões terminaram todas 87 segundos após o primeiro lançamento, e um projeto pode iniciar até 200 novas conversas (threads) por dia. O guia também detalha a ligação ao GitHub: autenticar-se com o GitHub e instalar a aplicação Claude GitHub são duas permissões distintas, e só a segunda dá acesso aos repositórios privados. O crédito de bónus de 100 dólares (Pro) ou 250 dólares (Max) deve ser solicitado antes de 7 de outubro às 23 h 59 PT e expira a 4 de novembro.

🔗 Guia prático das sessões cloud em claude.dev 🔗 O lembrete de @ClaudeDevs sobre o crédito de bónus

Vibe CLI 2.26.0

6 de outubro — A Mistral publica Vibe CLI 2.26.0, o seu agente de programação na linha de comandos, treze dias após a 2.25.8 e sem anúncio no X. Com 33 adições, 23 alterações e 91 correções, a atualização é substancial: 72 das suas 147 entradas dizem respeito à nova interface escrita em Rust: assistente de primeiro arranque, modo de voz (/voice), prompts recorrentes descritos em linguagem natural com /loop, envio da sessão para Vibe Code Web com /teleport e comando vibe update. Vibe passa a correr sempre sobre o Unified Harness, o seu novo motor de execução, e para com um erro explícito se este estiver em falta, em vez de recorrer silenciosamente ao motor antigo. Os plugins podem incluir o seu próprio servidor MCP, a chave API de recurso guardada em ~/.vibe/.env só pode ser lida pelo seu proprietário, e a Rust CLI passa a transmitir a sua telemetria de utilização (tempo de arranque, comandos utilizados, terminal detetado) à Mistral.

🔗 Notas de versão de Mistral Vibe v2.26.0

A extensão Antigravity para VS Code 1.7.0

5 de outubro — A Google publica a versão 1.7.0 da extensão Antigravity para Visual Studio Code, que traz os agentes de Google Antigravity para o editor da Microsoft (conversa num painel lateral, revisão dos diffs em linha, planos interativos), a partir do VS Code 1.90. Atualizada aproximadamente todas as semanas desde o início de setembro, segundo o seu changelog, nunca tinha sido abordada aqui. Esta 1.7.0 (6 melhorias, 9 correções) aperfeiçoa a revisão de código: as decisões Accept e Reject podem ser anuladas e refeitas pelo teclado, o editor de diff lado a lado ganha botões Accept All e Reject All, e a gravação automática (Auto Save) do VS Code deixa de poder sobrescrever ou encerrar uma revisão em curso. No Windows, notificações nativas assinalam o fim de uma tarefa quando a janela não está em primeiro plano, e tanto Google Cloud Workstations como Cloud Shell recebem autenticação interativa. No mesmo dia, a extensão para Visual Studio passa para a 1.0.261005.0 e anexa registos de diagnóstico ao feedback enviado.

🔗 Changelog de Google Antigravity

Replit e o contexto de todos os projetos

6 de outubro — Replit anuncia que passa a dispor do contexto de todos os projetos de um utilizador. A partir de uma nova conversa, pode pedir-se-lhe que encontre um projeto existente, que lhe acrescente uma funcionalidade ou que use um projeto como referência para outro; Replit lê então os ficheiros relevantes e inicia as alterações em tarefas em segundo plano (background tasks), com ligações para rever as alterações. O exemplo escolhido vai além do código puro: aplicar a paleta de cores de um «Partner Marketing Hub» a dois outros projetos de uma marca de café. O anúncio resume-se a um tweet acompanhado de um vídeo, sem artigo, documentação ou preço.

🔗 O anúncio de Replit no X


As pull requests empilhadas do GitHub passam a disponibilidade geral

6 de outubro — O GitHub disponibiliza em todos os planos de github.com as pull requests empilhadas (stacked pull requests), em prévia pública desde 30 de julho: uma grande alteração é dividida em pull requests mais pequenas, revistas separadamente e depois integradas em conjunto. O GitHub Enterprise Server irá recebê-las numa próxima versão. Segundo o GitHub, os repositórios que usam pilhas integram 9 % mais código do que repositórios comparáveis, e mais de dois terços do top 1 % dos repositórios usam-nas, com uma melhoria de 5 % no tempo até à integração.

A versão final reduz os obstáculos à integração. Quando o ramo principal avança, «Rebase stack» mantém as aprovações do código inalterado e produz commits de substituição assinados; uma pilha atravessa a fila de integração (merge queue) como um único grupo, e uma pilha cujo ramo de base é eliminado passa a apontar para outro ramo em vez de ser fechada. A integração automática de uma pilha inteira chega «nas próximas semanas». Para utilização na linha de comandos e por agentes, a extensão gh stack de GitHub CLI suporta worktrees Git.

🔗 Changelog do GitHub sobre as pull requests empilhadas


Modelos multilingues: Tiny Aya L2-Thinker da Cohere e Falcon-OCR-Arabic do TII

Dois pequenos modelos visam línguas que os grandes modelos servem menos bem: um raciocina na língua do utilizador, o outro lê documentos em árabe.

Tiny Aya L2-Thinker da Cohere

6 de outubro — A Cohere aborda a língua em que os modelos raciocinam: quando questionados em espanhol, árabe ou suaíli, a maioria pensa em inglês antes de responder. O seu modelo de investigação Tiny Aya L2-Thinker (3,35 mil milhões de parâmetros) raciocina na língua do prompt mais de 93 % do tempo, em 60 línguas. A receita assenta na mistura de dados: cerca de 1,7 milhões de exemplos de raciocínio em inglês, gerados por gpt-oss-120b, só o fazem raciocinar na língua do utilizador 12,8 % do tempo; cerca de 5 000 exemplos traduzidos por língua, em 44 línguas, elevam essa taxa para 86,1 %, e dados multilingues sem raciocínio estendem este comportamento a outras línguas. Face ao seu gémeo que raciocina em inglês, a precisão recua no máximo dois a três pontos em cinco dos seis benchmarks; apenas PolyMath, de matemática de competição, recua mais acentuadamente, por falta de uma etapa de aprendizagem por reforço. O modelo consome em média menos de 5 000 tokens de reflexão. Os modelos e os dados são publicados no Hugging Face sob a licença não comercial CC-BY-NC 4.0; o artigo do blog apresenta um artigo arXiv de 9 de setembro.

🔗 Artigo de investigação da Cohere sobre Tiny Aya L2-Thinker

Falcon-OCR-Arabic do TII

6 de outubro — O TII, o instituto dos Emirados Árabes Unidos que desenvolve os modelos Falcon, apresenta no blog do Hugging Face Falcon-OCR-Arabic, uma versão árabe do seu modelo de reconhecimento de texto Falcon OCR. Mantém os seus 270 milhões de parâmetros e a sua arquitetura de fusão precoce, e foi adaptado por afinação supervisionada com documentos árabes reais e sintéticos, seguida de aprendizagem por reforço. Num conjunto de avaliação criado pelo próprio TII (11 974 documentos reais, 15 categorias), fica em segundo lugar entre os 17 modelos comparados, e em primeiro nos documentos oficiais, formulários administrativos, recibos e faturas.

Modelo avaliado pelo TIIPrecisão do textoPontuação Table TEDS
Gemini 3.5 Flash84,34 %51,30 %
Falcon-OCR-Arabic (270M)81,87 %59,95 %
Claude Opus 5.579,22 %43,98 %
GPT Astra75,02 %51,23 %
Chandra OCR 2 (melhor OCR dedicado)61,67 %32,63 %

O artigo apenas disponibiliza um espaço de teste (playground): não havia pesos de Falcon-OCR-Arabic no Hub no momento da nossa verificação, e não é mencionada qualquer licença.

🔗 O artigo do TII sobre Falcon-OCR-Arabic


Bibliotecas Hugging Face: Diffusers 0.41.0 integra Qwen-Image 2.1, Transformers v5.19.0 recebe EmbeddingGemma 2

As duas grandes bibliotecas de modelos do Hugging Face publicam uma versão no mesmo dia.

Diffusers 0.41.0 e Qwen-Image 2.1

6 de outubro — Diffusers 0.41.0, a biblioteca do Hugging Face para modelos de difusão, integra Qwen-Image 2.1, o modelo da Alibaba que reúne geração e edição de imagens: passa a poder ser usado diretamente para gerar, editar, produzir imagens com fundo transparente (saída RGBA nativa) e treinar LoRA, com um componente de geração visual de 7 mil milhões de parâmetros. A equipa também muda de ritmo: tal como Transformers, Diffusers passa a alinhar as suas versões menores com a chegada de novos modelos, mantendo as versões de correção reservadas a correções. O carregamento com paralelismo tensorial permite que cada GPU leia apenas a sua parte dos pesos, e a versão acrescenta os pipelines LTX-2.5 DFR e otimizações para Cosmos 3. Em contrapartida, o suporte ONNX é descontinuado em favor de Optimum.

🔗 Notas de versão de Diffusers 0.41.0

Transformers v5.19.0

6 de outubro — Seis dias após a v5.18.0, Transformers v5.19.0 recebe EmbeddingGemma 2, apresentado acima, com os seus vetores que podem ser encurtados e os seus codificadores de visão e áudio que podem ser desativados no carregamento. No treino distribuído, o paralelismo de especialistas ganha uma distribuição de tokens (token dispatch), ativada por predefinição para Qwen3 MoE e Mellum: a sua dimensão deixa de ter de ser igual à do paralelismo tensorial, e o Trainer funciona com este modo. O cache passa a ser configurado camada a camada, o que é útil para modelos heterogéneos, e o processamento contínuo em lotes (continuous batching) suporta XPU. A versão inclui seis alterações que quebram a compatibilidade, entre elas a devolução dos logits do encaminhador para todos os MoE e o abandono progressivo do prefixo paged|.

🔗 Notas de versão de Transformers v5.19.0


Agentes de voz: ElevenLabs lança ElevenAgents Architect em Alpha

6 de outubro — A ElevenLabs integra em ElevenAgents, a sua plataforma de agentes conversacionais, um especialista chamado Architect, que ajuda as equipas a construir e melhorar os seus agentes de voz ou texto, falando ou escrevendo com ele. Conhece todas as definições de ElevenAgents (base de conhecimento, prompts, encadeamentos, vozes, salvaguardas, ferramentas, simulações) e a forma como interagem. Pode apresentar-se-lhe uma pergunta, um teste que falhou, um aumento das transferências para um humano ou uma constatação de ElevenAgents Spotlight: analisa as transcrições, identifica a causa, propõe uma alteração e escreve as simulações que a validam. Também constrói um agente a partir de uma simples descrição. Cada alteração chega como um rascunho com versões e reversível, e nada passa para produção sem aprovação. Architect está acessível a partir do produto, mas também a partir de Claude, Claude Code, ChatGPT, Cursor e Grok Bot. Está disponível desde já em Alpha, sem preço nem números de resultados.

🔗 Artigo da ElevenLabs sobre ElevenAgents Architect


Vídeo generativo: FLUX 3 na liderança do Physics-IQ Verified segundo a Black Forest Labs

6 de outubro — A Black Forest Labs reivindica o primeiro lugar no Physics-IQ, o benchmark da Google DeepMind que mede a compreensão do mundo físico pelos modelos de vídeo: mostra-se ao modelo o início de uma experiência real filmada, e este tem de prever a continuação (fluidos, ótica, mecânica dos sólidos). A classificação de referência, Physics-IQ Verified, é mantida pela Anates Labs. Na categoria de vídeo para vídeo, o FLUX 3 [large] supera claramente o Cosmos3 da NVIDIA, com um custo por vídeo mais elevado.

Modelo e método (vídeo para vídeo)Pontuação Physics-IQ VerifiedCusto por vídeo normalizado
FLUX 3 [large], melhor de 8 gerações64,35 %16,43 dólares
FLUX 3 [large]61,11 %2,08 dólares
Cosmos3 Super (NVIDIA)50,80 %0,82 dólar
Cosmos3 Nano (NVIDIA)43,00 %0,82 dólar

Na categoria de imagem para vídeo, o FLUX 3 [large] também ultrapassa o Physis-Lang, o método que a NVIDIA colocava na liderança a 29 de setembro. O FLUX 3 [large] é um modelo proprietário, e a sequência de publicações não indica uma data de disponibilidade nem um preço para esta variante.

🔗 A sequência de publicações de @bfl_ai no X 🔗 Classificação Physics-IQ Verified


Avaliações públicas: GeoGuess Bench e RSI Arena

Duas avaliações abertas ao público saem dos benchmarks habituais: uma põe os modelos a jogar GeoGuessr, a outra permite que o público vote em modelos treinados por agentes.

GeoGuess Bench

6 de outubro — Hassan, responsável pela experiência dos programadores na Together AI, publica o GeoGuess Bench, um benchmark pessoal que põe os modelos a jogar GeoGuessr: cada um vê as mesmas 210 fotografias de ruas e coloca um marcador cuja pontuação é calculada segundo a fórmula do jogo, até 25 000 pontos por partida de cinco rondas. O Claude Opus 5.5 assume a liderança, pouco à frente do Claude Fable 5.1; a surpresa vem do Muse Glimmer 30B, o modelo de pesos abertos da Meta, em terceiro lugar e à frente do GPT-6 Astra, com um custo por partida cerca de 45 vezes inferior.

Posição no GeoGuess BenchModelo avaliadoPontuação em 25 000Custo por partida
1Claude Opus 5.523 4120,064 dólar
2Claude Fable 5.123 3070,115 dólar
3Muse Glimmer 30B (aberto)22 4070,0049 dólar
4GPT-6 Astra21 5620,223 dólar
5GPT-6.1 Sol21 1940,042 dólar
6GLM-5.3 Flash (aberto)21 1830,0087 dólar

O GLM-5.3 Flash fica assim ao nível do GPT-6.1 Sol, com um custo cerca de cinco vezes inferior. Trata-se do projeto pessoal de um funcionário da Together AI, fornecedora de inferência de modelos abertos, e não de uma avaliação da empresa; não inclui nenhum modelo Gemini, e o código está publicado no GitHub.

🔗 O anúncio de Hassan no X 🔗 GeoGuess Bench

RSI Arena

6 de outubro — Zichen Chen anuncia uma nova ronda da RSI Arena (de autoaperfeiçoamento recursivo, recursive self-improvement), desta vez com a Hugging Face. Agentes de IA receberam GPU e uma única missão: treinar modelos melhores. Escolheram os dados, escreveram o código e realizaram as experiências por conta própria. Terminada a primeira ronda de treino, o público entra no ciclo: os modelos enfrentam-se em duelos, cada pessoa vota, e os agentes usam esse feedback em novas experiências. Os Inference Endpoints da Hugging Face disponibilizam cada modelo em direto, e o site lista dez agentes, incluindo GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 e Muse Spark 1.3; o seu painel mostrava 286,60 dólares de despesas de API em 300 e 755,17 horas GPU em 1 000. A equipa promete publicar no Hub cada modelo treinado pelos agentes e, no final da experiência, todos os artefactos: dados, código e o percurso de investigação completo de cada agente.

🔗 O anúncio de Zichen Chen no X 🔗 RSI Arena


Infraestrutura GPU: NVIDIA publica AICR v1.0

6 de outubro — A NVIDIA publica a versão 1.0 do AI Cluster Runtime (AICR), um projeto aberto que pretende pôr fim aos clusters Kubernetes com GPU configurados por tentativa e erro. Um cluster acelerado depende de dezenas de componentes com versões independentes (núcleo, drivers, ambientes de contentores, rede, armazenamento, operadores, bibliotecas), e uma combinação que funciona num local pode falhar silenciosamente noutro. O AICR responde com receitas de versões fixadas e validadas, geradas para Helm, Argo CD, Flux ou Helmfile e acompanhadas de provas de validação assinadas para o hardware testado. A v1.0 estabelece um contrato de compatibilidade: a CLI, a API REST, o SDK Go, a estrutura dos pacotes de implementação e os esquemas de artefactos tornam-se interfaces estáveis, e qualquer quebra exigirá uma nova versão principal. A NVIDIA afirma ter mais de 100 colaboradores, dos quais quase metade são externos à empresa, e cita integrações na Pulumi Labs e no gestor de múltiplos clusters k0rdent da Mirantis.

🔗 Publicação no blog técnico da NVIDIA


Claude Startups: até 7 000 dólares em produtos e créditos, e uma Startup Stack de 45 000 dólares

6 de outubro — A Anthropic alarga o acesso ao Claude Startups, o seu programa para fundadores que desenvolvem com o Claude, a startups fundadas há menos de cinco anos ou financiadas nos últimos dois anos.

Benefício do programaValor anunciado pela Anthropic
Um ano de Claude Team, até cinco licenças Premium6 000 dólares (cinco licenças a 100 dólares por mês)
Crédito API único, disponível assim que aprovado1 000 dólares
Total de produtos e créditos Claudeaté 7 000 dólares
Claude Startup Stack (ofertas de parceiros)até 45 000 dólares

O ano de Claude Team aplica-se às empresas que aderem ao Team pela primeira vez, e o seu valor real depende do número e do tipo de licenças. A Claude Startup Stack, novidade do dia, reúne descontos e créditos de empresas que desenvolvem com o Claude, incluindo Linear, Lovable, ElevenLabs, Granola e Hex; o seu limite corresponde ao valor acumulado de todas as ofertas aos preços de catálogo de setembro de 2026, e nem todas essas ofertas podem ser acumuladas. O programa acrescenta horários para conversar com a equipa Applied AI da Anthropic, apoio para publicar uma ficha no Claude Marketplace e acesso a eventos.

🔗 Publicação da Anthropic sobre o Claude Startups 🔗 A sequência de publicações de @claudeai sobre a Claude Startup Stack


Breves

  • Claude Projects e pasta local — Dan Fein, da Anthropic, anuncia que as sessões cloud do Claude Projects podem ligar-se a uma pasta aprovada do computador, à qual só acedem quando uma tarefa o exige; a disponibilização é progressiva desde 5 de outubro, e a equipa está quase lá (Quase lá), segundo Boris Cherny. 🔗 fonte · 🔗 Boris Cherny
  • Claude nas mensagens de grupo do Slack — O Claude pode agora ser adicionado às mensagens de grupo (group DMs) do Slack como qualquer participante; responde numa conversa que continua a acompanhar e pode usar os conectores pessoais de quem o solicita, sem detalhes sobre os planos ou o calendário. 🔗 fonte
  • Boris Cherny e a sua forma de criar prompts — Boris Cherny pede ao Opus 5.5 que construa um site complementar interativo para um episódio do podcast Acquired dedicado à Home Depot, incluindo aguarelas; segundo ele, não há segredo para criar prompts: dizer ao modelo o que se quer, quanto esforço deve dedicar e como verificar o resultado. 🔗 site complementar · 🔗 a sua forma de criar prompts
  • Atlassian e OpenAI — Ao abrigo de um novo acordo, os modelos de fronteira da família GPT-6, incluindo o GPT-6 Astra, alimentarão os agentes da plataforma Atlassian e do Rovo; mais de 3 000 programadores da Atlassian já utilizam o Codex, e estão em estudo integrações mais aprofundadas com o Jira, sem divulgação de valores. 🔗 fonte
  • Widgets do Codex no ChatGPT para iOS — A versão 1.2026.267 do ChatGPT para iOS, de 2 de outubro, acrescenta widgets do ecrã inicial para as tarefas Codex recentes dos computadores selecionados, outros para a utilização restante e a sua reposição, também no ecrã bloqueado, e uma definição que mantém o teclado aberto. 🔗 fonte
  • Gemini CLI v0.63.0 e v0.64.0-preview.0 — A versão estável v0.63.0 reproduz sem alterações as 15 entradas da versão preliminar de 29 de setembro, e a versão preliminar v0.64.0-preview.0 reúne as 16 entradas das versões noturnas de 30 de setembro a 3 de outubro: nenhum conteúdo inédito, e a versão noturna de 6 de outubro está vazia. 🔗 fonte
  • SDK Python da Mistral 3.1.0 — Gerada automaticamente a partir da API, esta versão acrescenta em beta catorze operações de avaliação no módulo de observabilidade; os métodos Runs passam para Workflows.runs, o que pode quebrar código existente apesar de uma simples mudança de versão secundária. 🔗 fonte
  • Qwen Code v0.25.1-preview.0 — No dia seguinte à v0.25.0, esta versão preliminar traz 13 funcionalidades e 27 correções, incluindo um ambiente de execução Kubernetes experimental, comandos Shell e monitorização em segundo plano para o Managed Agent, e regras MCP que deixam de autorizar um servidor com o mesmo nome. 🔗 fonte
  • SDK TypeScript da SpaceXAI 0.2.2 — Publicada a 5 de outubro sem anúncio, esta versão contém apenas uma alteração: a opção retryBeforeOutput também se aplica a uma chamada create() sem fluxo contínuo (streaming) que espera JSON. 🔗 fonte
  • Falcon-Emirati-7B, o dialeto dos Emirados — O TII especializa o Falcon-H1-Arabic 7B no árabe dos Emirados: 84,83 % no Alyah, um benchmark de 1 173 perguntas, e uma fidelidade ao dialeto de 0,52 contra, no máximo, 0,05 para ALLaM, Gemma 3 27B, Jais-2 e Fanar-2, segundo um avaliador Gemini 3.7 Flash; o modelo só está disponível na plataforma de chat do TII. 🔗 fonte
  • Datasets 5.1.0 — Publicada a 5 de outubro, a biblioteca de conjuntos de dados passa a ler os ambientes de aprendizagem por reforço Harbor, o formato colunar Vortex e cinco formatos biológicos (FASTA, FASTQ, GenBank, PDB, mmCIF), e corrige uma vulnerabilidade que permitia a um arquivo escrever num diretório vizinho. 🔗 fonte
  • TRL v1.14.2 — Esta correção resolve um treino silenciosamente distorcido: sem vLLM, GRPO, RLOO e Distillation não paravam no final do turno em modelos como Gemma ou Phi-3.5 e aprendiam todo o texto seguinte até ao comprimento máximo; também são corrigidas três falhas que provocavam encerramentos. 🔗 fonte
  • Jev contra os emails de campanha — Numa publicação da comunidade, Stephen Solka classifica os seus emails políticos com o Jev (99 respostas certas em 100 emails reais, um falso positivo), depois com um classificador SetFit de 22,6 milhões de parâmetros que funciona no processador: 98 % na avaliação piloto, mas 18 em 23 nos casos difíceis. 🔗 fonte
  • Open Together a 16 de outubro — O vLLM e a Hugging Face organizam o Open Together, um encontro de programadores open source que abrirá a Open Source AI Week na sexta-feira, 16 de outubro, em São Francisco; segundo Jeff Boudier, 150 pessoas estão na lista de espera e a capacidade foi duplicada. 🔗 fonte · 🔗 Jeff Boudier
  • Copilot CLI 1.0.93-2 — Esta versão preliminar acrescenta uma definição empresarial, permissions.limitTo, que restringe os pedidos de rede a domínios geridos, destaca GPT-6.1 Sol, GPT-6 Astra e Luna e os modelos Claude 5.5 no seletor, e passa a ler as definições do utilizador apenas em ~/.copilot/settings.json. 🔗 fonte
  • AI Scan na visão geral da segurança — Os administradores de organizações e empresas passam a ver, na visão geral da segurança (security overview) do GitHub, quais os repositórios que ativaram a análise por IA de pull requests (AI Scan for pull requests), com dois filtros e uma coluna na exportação CSV. 🔗 fonte
  • Deteção de segredos: Lovable, Pydantic e Supabase — A deteção de segredos (secret scanning) do GitHub reconhece cinco novos tipos de segredos, incluindo a chave API da Lovable, o token Logfire e a chave da Pydantic AI Gateway, bem como dois tokens Supabase; a Lovable Labs também adere ao seu programa de parcerias. 🔗 fonte
  • Notas de versão do Devin de 5 de outubro — Sobretudo aperfeiçoamentos: um separador Terminal no espaço de trabalho da sessão (abrir Files ou Terminal desperta o Devin), níveis de esforço para o Devin Review ajustáveis pelas ações de acionamento, e análises de código (code scans) recuperáveis por identificador através da API v3 ou do MCP do Devin. 🔗 fonte
  • Delta e os seus próprios worktrees — No blog da Delta, Conrad Irwin explica por que motivo a ferramenta substitui os worktrees Git: cada conversa tem o seu worktree registado no DeltaDB e replicado entre pessoas, agentes e máquinas, vários agentes trabalham na mesma branch, e um script .agents/prepare sob controlo de versões prepara cada checkout; publicação sem nova versão. 🔗 fonte
  • v0: contas pessoais em espaços de equipa — As contas pessoais do v0 tornam-se espaços de trabalho de equipa, com conversas, projetos e definições migrados automaticamente; a documentação reserva, contudo, certas funções, como os modelos de equipa, aos planos Plus, Business e Enterprise. 🔗 fonte
  • v0 e a subscrição ChatGPT no iOS — A subscrição ChatGPT, aceite pelo v0 desde 29 de setembro, pode agora ser utilizada na sua aplicação iOS, sem preço ou detalhes adicionais. 🔗 fonte
  • Eleven v4 e Eleven v4 Turbo na liderança — A ElevenLabs anuncia que os seus dois modelos de síntese de voz lançados a 28 de setembro ocupam os dois primeiros lugares da classificação de síntese de voz (text to speech) da Artificial Analysis; o v4 já estava em primeiro lugar no lançamento. 🔗 fonte
  • HeyGen Video em 2K — Uma semana após o seu lançamento, o HeyGen Video passa para a resolução 2K; a HeyGen afirma que lidera a classificação de vídeo do OpenRouter em utilização, sem preço específico para 2K, enquanto a página do catálogo continua a indicar 0,01 dólar por segundo até ao final de outubro. 🔗 fonte
  • Nano Banana 2.1 no Pika — O Pika acrescenta à sua plataforma e ao seu Pika API Club o Nano Banana 2.1, a nova versão do modelo Nano Banana da Google, com melhor qualidade visual e maior velocidade, segundo o Pika; não é indicado nenhum preço nem custo em créditos. 🔗 fonte
  • DOCA GPUNetIO — A NVIDIA torna o DOCA GPUNetIO a implementação comum da rede controlada pela GPU (GDA-KI) para NCCL, NVSHMEM e NIXL/UCX, numa versão completa no SDK DOCA e num projeto open source mais leve, centrado em RDMA Verbs. 🔗 fonte
  • Green contexts do CUDA — Uma publicação técnica da NVIDIA mostra como reservar SM para uma tarefa crítica: numa GPU Blackwell de 148 SM, um kernel com 8 SM reservados responde em 0,007 ms, contra 0,140 ms com um fluxo (stream) prioritário e 3,727 ms sem prioridade. 🔗 fonte
  • Modelos abertos nas operadoras de telecomunicações — Num artigo de posicionamento, a NVIDIA cita o seu inquérito sobre telecomunicações de 2026, no qual 89 % dos participantes consideram o open source importante, e os testemunhos da SoftBank, AT&T e Indosat; nenhum produto novo. 🔗 fonte
  • Guia da Perplexity sobre ferramentas de colaboração — A Perplexity compara dez ferramentas de colaboração com IA (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), as suas funções de IA e os planos que as incluem; nenhuma novidade de produto. 🔗 fonte

O que isto significa

Os modelos de decisão tornam-se uma categoria por direito próprio, com a sua guerra de preços e a sua classificação. No mesmo dia, a OpenAI fixa o preço da sua API Decisions em 0,10 dólar por milhão de tokens de entrada, e a Perplexity reduz o seu para 0,02 dólar, metade do valor de há cinco dias; nenhuma das duas cobra pela saída. Estes modelos não redigem, escolhem ou atribuem pontuações: paga-se pela leitura e pretende-se que sejam rápidos, com a OpenAI a prometer respostas cerca de dez vezes mais rápidas do que com a sua Responses API. O Decision Index 0.3 serve de árbitro da comunidade, e a sua nova metade privada procura medir competências em vez do sucesso em benchmarks conhecidos. O seu veredicto já pesa na comunicação dos fornecedores: a Perplexity invoca-o no seu anúncio, embora a ficha do seu modelo apresente uma pontuação diferente da classificação.

A IA instala-se nas ferramentas de escritório, em vez do inverso. O Claude entra no Google Docs, Sheets e Slides depois do Excel, PowerPoint e Word, junta-se às mensagens de grupo do Slack, e os modelos GPT-6 vão alimentar os agentes do Rovo na Atlassian. Nestas integrações, a questão já não é apenas a qualidade do modelo, mas também o controlo: um modo que exige a aprovação de cada alteração, conectores que respeitam as permissões de partilha do Google, controlos Enterprise aplicados ao módulo. A mesma lógica atravessa as ferramentas de agentes do dia, desde as decisões de revisão reversíveis no Antigravity até aos rascunhos com controlo de versões do ElevenAgents Architect.

Na cibersegurança, o acesso é concedido por níveis em função da verificação. O CVP da Anthropic não altera o modelo, mas as suas salvaguardas: no CyScenarioBench, o mesmo Opus 5.5 passa de tarefas bloqueadas logo no primeiro prompt sem verificação para 34 tarefas concluídas com sucesso em 50 no Red Team Access. A Mistral apresenta outro argumento, o de um modelo que não recusa: afirma alcançar 82 % num teste de cibersegurança que, segundo ela, o Claude Opus 5.5 e o GPT-6 Astra se recusam a realizar. As duas abordagens convergem num ponto: o acesso mais amplo às capacidades de cibersegurança passa primeiro por profissionais verificados, parceiros da Mistral antes da publicação dos pesos ou membros do programa da Anthropic.

Os modelos expandem-se também nos dois extremos da dimensão. No topo, o Mistral Large 4 e os seus 1 000 mil milhões de parâmetros, cujos pesos estão prometidos para o final de outubro; na base, o EmbeddingGemma 2, que cabe em cerca de 567 Mo de RAM num telemóvel, o Tiny Aya L2-Thinker e os seus 3,35 mil milhões de parâmetros, ou o Falcon-OCR-Arabic e os seus 270 milhões, por enquanto apenas em demonstração. Muitos dos números do dia são, contudo, medidos pelo próprio fornecedor: as pontuações da Mistral, o primeiro lugar reivindicado pela Black Forest Labs, o benchmark próprio do TII, a ficha da Perplexity, as tarefas da Ironclad avaliadas pela OpenAI ou os ganhos de merge anunciados pelo GitHub. É muitas vezes a única medição disponível no dia de um anúncio; beneficiará de ser confrontada com avaliações independentes, algo que os pesos do Mistral Large 4 permitirão precisamente quando forem publicados.


Fontes