Pesquisar

Claude Dashboards e Claude Motion, Cyber Mission e OSS Scanner, GPT-6.1 Sol em Ultrafast

ai-powered-markdown-translator

Artigo traduzido do francês para o português com gpt-6.1-sol.

Ver projeto no GitHub ↗

A Anthropic acrescenta duas funcionalidades ao Claude, Claude Dashboards para painéis mantidos atualizados e Claude Motion para animações escritas em código, e retira Docs, Slides e Design da fase beta em todos os planos, incluindo Free. No mesmo dia, a empresa lança a sua Cyber Mission, com um programa de defesa das infraestruturas críticas e OSS Scanner, que oferece aos projetos open source scans gratuitos com os seus modelos mais potentes. A OpenAI, por sua vez, disponibiliza o nível Ultrafast para GPT-6.1 Sol, até 8 vezes mais rápido do que o modo Standard, enquanto a Anthropic e a NVIDIA se comprometem com a Genesis Mission, com contribuições de 150 milhões e de 1 mil milhão de dólares.


Claude Dashboards e Claude Motion em beta, Docs, Slides e Design em todos os planos

8 de outubro — A Anthropic acrescenta duas funcionalidades ao Claude. Com Claude Dashboards, em beta nos planos pagos, liga-se uma plataforma de dados da empresa (Amazon Redshift, BigQuery, ClickHouse, Databricks ou Snowflake) ou outro conector, como as oportunidades do Salesforce, e depois faz-se uma pergunta em linguagem corrente: o Claude escreve a query, constrói o painel e mantém-no atualizado quando os dados mudam. Um clique num número mostra a query que o produz, e cada gráfico indica quando os seus dados foram atualizados. A Anthropic destina-o a perguntas rápidas e exploratórias; para ir mais longe, o painel pode ser enviado para Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog ou Sigma, enquanto se aguarda a chegada de Looker, monday.com e Tableau.

Claude Motion, em beta nos planos Team e Enterprise, destina-se a animações curtas: um vídeo explicativo de 30 segundos a partir de um relatório trimestral, um gráfico animado numa apresentação ou uma demonstração de produto. Como não intervém nenhum modelo de geração de vídeo, a animação não contém sequências nem pessoas geradas por IA.

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇵🇹 Claude Motion transforma relatórios, gráficos ou demonstrações de produto em animações curtas. O Claude escreve cada uma delas em código, sem qualquer modelo de vídeo, pelo que pode alterar qualquer palavra, número ou temporização e depois exportar um MP4. Em beta nos planos Team e Enterprise. — @claudeai no X

No mesmo dia, Claude Docs, Slides e Design deixam de ter a etiqueta beta e passam a estar disponíveis em todos os planos, incluindo Free. Segundo a Anthropic, foram criados mais de 45 milhões de documentos, apresentações e designs desde a sua chegada às conversas, a 16 de setembro. A saída da fase beta traz suporte para CMEK nos artefactos, a escolha dos modelos de artefactos pelos administradores, a edição colaborativa com o Claude, a partilha fora da organização se o administrador a autorizar, exportações para PowerPoint e PDF fiéis ao editor, o envio direto para Google Slides e a edição a partir da aplicação móvel.

Funcionalidade em causaEstado a 8 de outubroPlanos abrangidos
Claude DashboardsBetaPlanos pagos
Claude MotionBetaTeam e Enterprise
Claude Docs, Slides e DesignSaída da fase betaTodos, incluindo Free
claude.ai/design (site autónomo)Aberto até 14 de dezembro—

Consequência prática: o site autónomo claude.ai/design, agora integrado no Claude, permanece aberto até 14 de dezembro. Os sistemas de design (design systems) de uma organização podem ser migrados de uma só vez a partir da página Artifacts, mas as conversas e os comentários do site autónomo, bem como os seus links públicos, desaparecerão quando este encerrar. No plano Enterprise, Dashboards e Motion estão desativados por predefinição, enquanto Docs, Slides e Design serão ativados por predefinição a 15 de outubro.

🔗 Publicação do Claude: Dashboards e Motion · Thread de @claudeai

Runway e Luma, parceiros de lançamento de Claude Motion

8 de outubro — Duas empresas de vídeo generativo apresentam-se como parceiros de lançamento de Claude Motion. No Runway, qualquer animação pode ser exportada para acrescentar sequências geradas, retocar planos descrevendo a alteração pretendida e fazer com que Runway Agent monte uma edição mais longa em torno da animação; um mesmo 16:9 também pode ser adaptado a formatos vertical e quadrado. No Luma, as animações abrem diretamente através do conector Luma (MCP) adicionado ao Claude: os modelos de vídeo Ray e Uni alteram o seu estilo preservando o movimento, reenquadram-nas em 9:16, 1:1, 4:3 ou 21:9, e o agente Luma produz outras versões. Nem o Runway nem o Luma especificam preços ou custos em créditos. A Anthropic também cita Adobe, Descript, HeyGen, Higgsfield e invideo entre as ferramentas em que se pode dar continuidade a uma animação, estando Canva e Captions anunciados para breve.

🔗 Publicação do Runway · Publicação do Luma


Anthropic Cyber Mission: um programa para as infraestruturas críticas e OSS Scanner para o open source

8 de outubro — Dois dias depois de alargar o seu Cyber Verification Program, a Anthropic lança a Anthropic Cyber Mission, apresentada como um compromisso de longo prazo para proteger os sistemas de que todos dependem. A constatação inicial vem de Project Glasswing: encontrar vulnerabilidades nunca foi tão fácil, mas verificá-las, ordená-las por prioridade e corrigi-las continua a ser difícil. A missão começa em duas áreas, as infraestruturas críticas e o software open source; outras áreas foram anunciadas, sem data.

Para as infraestruturas críticas, o Critical Infrastructure Defense Program (CIDP) disponibiliza modelos Claude de ponta, engenheiros no local e a investigação da Anthropic sobre ameaças aos prestadores de serviços dos operadores de tecnologias operacionais: autómatos, software de controlo e redes industriais de eletricidade, água ou transportes, que muitas vezes não podem ser interrompidos para aplicar uma correção. Participam onze parceiros fundadores: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC e Rockwell Automation. O programa começa com um pequeno grupo e deverá alargar-se a outros parceiros e setores nos próximos meses.

Para o open source, OSS Scanner, inspirado no OSS-Fuzz da Google, oferece gratuitamente aos projetos inscritos scans periódicos com os modelos mais potentes da Anthropic, incluindo Claude Mythos. Cada relatório inclui um caso de reprodução, uma explicação e, quando existe, uma possível correção, mas é enviado sem revisão humana: a Anthropic espera uma taxa de verdadeiros positivos superior a 90 % e avisa que alguns relatórios conterão erros, como uma gravidade mal avaliada. O serviço responde ao estrangulamento descrito pela equipa Frontier Red Team: as vulnerabilidades encontradas ultrapassam largamente aquilo que os humanos conseguem analisar e classificar.

Indicador publicado pela AnthropicValor publicado
Possíveis vulnerabilidades encontradas em seis mesesMais de 29 000
Vulnerabilidades revistas e classificadas manualmenteCerca de 6 000
Vulnerabilidades críticas ou de gravidade elevada verificadas (48 projetos)97
Selecionadas segundo o nível exigido para a divulgação coordenada (CVD)85, ou seja, 88 %
Reais mas duplicadas, ou inválidas11 e 1
Percentagem de vulnerabilidades encontradas pelos LLM no banco de testes CyberGymMenos de 20 % no início do ano passado, mais de 85 % este ano

A wolfSSL indica que, dos 74 relatórios recebidos, todos exceto dois eram válidos e cinco deram origem a CVE. A inscrição faz-se através de uma pull request no repositório GitHub anthropics/oss-scanner, reservada aos principais responsáveis pela manutenção de projetos considerados críticos, caso a caso, e o Defender Advantage Fund, lançado em agosto, mantém o serviço gratuito. A previsão da Anthropic é prudente: dentro de dois anos, a IA favorecerá a defesa, mas não necessariamente a curto prazo, uma vez que explorar vulnerabilidades custa menos, enquanto a verificação, a divulgação e a correção continuam a ser lentas.

🔗 Publicação da Anthropic: Anthropic Cyber Mission · Publicação da Frontier Red Team sobre OSS Scanner · Repositório anthropics/oss-scanner


Ultrafast para GPT-6.1 Sol: até 8 vezes mais rápido, a 12 e 60 dólares por milhão de tokens

8 de outubro — Anunciado «para breve» a 29 de setembro, o nível Ultrafast chega ao GPT-6.1 Sol. A OpenAI Developers indica que começa a ser disponibilizado nesse mesmo dia na API, no Codex e no ChatGPT Work, com uma inteligência apresentada como próxima da do GPT-6 Astra. A OpenAI destina-o a tarefas em que cada segundo conta: fazer debug de uma falha, pôr agentes a navegar em aplicações ou oferecer experiências em direto.

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇵🇹 Ultrafast começa hoje a ser disponibilizado para GPT-6.1 Sol na API, no Codex e no ChatGPT Work. Uma inteligência próxima da do Astra, até 8 vezes mais rápido do que Sol no modo Standard, para criar tão depressa quanto surgem as ideias. — @OpenAIDevs no X

Na API, basta chamar gpt-6.1-sol com service_tier: "ultrafast" na Responses API. O modo está disponível para todos os utilizadores da API, sujeito aos limites de débito, em processamento global e com residência dos dados nos Estados Unidos e na União Europeia, enquanto GPT-6 Astra em Ultrafast continua limitado à residência nos Estados Unidos. O preço segue a regra já aplicada ao Astra: seis vezes o preço Standard, ou seja, 12 dólares por milhão de tokens de entrada e 60 dólares de saída, cinco vezes menos do que GPT-6 Astra em Ultrafast (60 e 300 dólares).

Modo de processamento de gpt-6.1-solPreço de entradaEntrada em cacheEscrita em cachePreço de saída
Standard, contexto curto2,00 dólares0,10 dólar2,50 dólares10,00 dólares
Fast, contexto curto4,00 dólares0,20 dólar5,00 dólares20,00 dólares
Ultrafast, contexto curto12,00 dólares0,60 dólar15,00 dólares60,00 dólares
Ultrafast, contexto longo24,00 dólares1,20 dólar30,00 dólares90,00 dólares

Preços por milhão de tokens, página Pricing da API a 8 de outubro.

No Codex e no ChatGPT Work, o acesso está reservado ao plano Pro 500, aos espaços Enterprise elegíveis com faturação por utilização e às ofertas Edu com créditos. No plano Enterprise, Ultrafast está desativado por predefinição e os proprietários do espaço de trabalho têm de o ativar, para alguns utilizadores ou para todos. A documentação do Codex detalha o custo: os limites incluídos na subscrição são consumidos 8 vezes mais depressa do que no modo Standard, e os créditos comprados, tal como a utilização Enterprise a pedido, são faturados a um preço seis vezes superior. Os restantes planos de autosserviço não têm acesso no lançamento, mesmo com créditos comprados.

🔗 Changelog da API OpenAI · Preços da API OpenAI · Ultrafast no Codex (documentação)


Ciência: 150 milhões de dólares da Anthropic e 1 mil milhão da NVIDIA para a Genesis Mission, um mapa do céu em ultravioleta

Dois compromissos com a Genesis Mission, o programa federal norte-americano que pretende acelerar a descoberta científica através da IA, foram anunciados a 8 de outubro na mesma cimeira, «Science: A New Golden Age», organizada em Washington pelo Office of Science and Technology Policy (OSTP) da Casa Branca. No mesmo dia, a Anthropic mostra o que Claude Science pode produzir para um astrofísico.

Anthropic: 150 milhões de dólares ao longo de três anos e Claude para mais de 15 agências federais

8 de outubro — A Anthropic compromete-se a investir 150 milhões de dólares ao longo de três anos na Genesis Mission. O financiamento deverá tornar o Claude acessível a mais de 15 agências membros da missão, incluindo a NASA, os National Institutes of Health e a National Science Foundation. Concretamente, a Anthropic fornecerá Claude, Claude Code e créditos API a várias centenas de projetos de investigação, trabalhará com as agências e os laboratórios nacionais nas prioridades da administração, incluindo a energia de fusão e a computação quântica, e assegurará formação e suporte técnico. O compromisso dá continuidade à parceria estabelecida em dezembro de 2025 com o Departamento de Energia; em julho, Google DeepMind (40 milhões de dólares) e OpenAI (17 milhões de dólares) tinham anunciado os seus próprios compromissos com a missão.

🔗 Publicação da Anthropic: compromisso com a Genesis Mission · Tweet de @AnthropicAI

NVIDIA: 1 mil milhão de dólares ao longo de cinco anos para a ciência norte-americana

8 de outubro — No mesmo evento, a NVIDIA anuncia compromissos no valor de 1 mil milhão de dólares ao longo de cinco anos, para desenvolver a capacidade dos Estados Unidos em investigação e desenvolvimento sobre superinteligência em áreas como a computação quântica, a saúde e a segurança energética. O comunicado cita três vertentes, sem repartir o montante: o apoio a instituições de investigação universitária, investimentos para acelerar a liderança norte-americana em computação quântica e o apoio a fornecedores cloud que servem as missões do governo. A NVIDIA também afirma colaborar em vários projetos financiados na fase 2 da Genesis Mission, anunciados no mesmo dia, nas áreas da computação quântica, fusão, conceção de aceleradores e microeletrónica, e recorda a sua parceria com o DOE, que inclui o maior supercomputador científico do departamento, no Argonne National Laboratory.

🔗 Comunicado da NVIDIA

O primeiro mapa completo do céu em ultravioleta, produzido com Claude Science

8 de outubro — O blog Anthropic Science conta como Brice Ménard, astrofísico na universidade Johns Hopkins e investigador na Anthropic, produziu com Claude Science aquilo que a Anthropic apresenta como o primeiro mapa completo do céu em ultravioleta. O levantamento espacial GALEX (NASA, 2003-2013) cobria apenas cerca de dois terços, em aproximadamente 38 000 observações. Claude orquestrou agentes que reuniram e calibraram entre si os levantamentos públicos, preenchendo depois o terço em falta por reconstrução (inpainting), a partir da relação entre o ultravioleta e os outros comprimentos de onda. Em zonas deliberadamente ocultadas, as estimativas apresentam um desvio de cerca de 10 % face às medições reais.

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇵🇹 Este trabalho teria exigido semanas a humanos, mas, com Claude, demorou apenas alguns dias enquanto Ménard trabalhava noutros projetos. — @AnthropicAI no X

🔗 Artigo da Anthropic Science


Utilizações proibidas e abusos: a política de utilização de 2026 da Anthropic e duas operações de influência desmanteladas pela OpenAI

Duas publicações de 8 de outubro mostram o que os laboratórios proíbem e como detetam os abusos: a Anthropic reformula a sua política de utilização, e a OpenAI detalha duas operações de influência que baniu.

A Anthropic publica a versão de 2026 da sua política de utilização, em vigor a 12 de novembro

8 de outubro — A Anthropic publica a atualização anual da sua política de utilização (Usage Policy), que entrará em vigor a 12 de novembro. Trata-se sobretudo de esclarecimentos, baseados nos abusos observados. Uma nova secção reúne as regras sobre campanhas enganosas e atividade artificial, até então dispersas, e abrange toda a atividade enganosa, política ou comercial, incluindo a criação de ferramentas para operações de influência. A secção eleitoral, renomeada « não prejudicar os processos democráticos » (Do Not Undermine Democratic Processes), abandona a proibição geral da segmentação personalizada dos eleitores, que bloqueava utilizações cívicas como informar os eleitores noutras línguas. O texto esclarece também que a proibição de armas abrange o respetivo software e componentes, bem como o armamento de drones, proíbe seguir pessoas sem o seu consentimento e veda, apenas em casos extremos, comportamentos abusivos persistentes e injustificados dirigidos aos modelos.

🔗 Artigo da Anthropic: atualização de 2026 da política de utilização

A OpenAI desmantela Dark Clark e Bogus Bylines, incluindo a sua primeira operação de categoria 5

8 de outubro — A OpenAI publica um relatório sobre duas operações de influência clandestinas que baniu, as quais mantinham entidades fictícias (false front) com a ajuda dos seus modelos. « Dark Clark », de origem russa, visava a América Latina: os seus operadores redigiam sobretudo os relatórios internos com ChatGPT e dirigiam um suposto centro de investigação, o Social Research Center, liderado por uma personagem fictícia, « Mia Clark ». « Bogus Bylines », de origem iraniana, colocou cerca de 100 artigos sob sete assinaturas falsas de jornalistas ocidentais numa dúzia de meios de comunicação online, um dos quais tinha perto de 2 milhões de seguidores no Facebook. A OpenAI afirma ter exposto 30 operações deste tipo em dois anos e meio.

Operação desmanteladaOrigem das contasAlvo principalCategoria na IO Breakout Scale (1 a 6)
Dark ClarkRússiaAmérica Latina5, a primeira segundo a OpenAI
Bogus Bylines, artigosIrãoMeios de comunicação online internacionais4
Bogus Bylines, comentáriosIrãoRedes sociais2

🔗 Relatório da OpenAI sobre as operações com entidades de fachada


Claude Haiku 5.5 em ferramentas de terceiros: o GitHub Copilot disponibiliza-o a partir do plano Pro, o Devin avalia-o em 58,4 %

Lançado a 7 de outubro, Claude Haiku 5.5 chegou no mesmo dia a duas ferramentas de código, que o comparam, cada uma, com Claude Sonnet 5.

GitHub Copilot: Haiku 5.5 em todos os planos pagos, incluindo o Pro

7 de outubro — Pouco mais de duas horas após o seu lançamento pela Anthropic, Claude Haiku 5.5 chega à disponibilidade geral no GitHub Copilot para os planos Pro, Pro+, Max, Business e Enterprise: incluindo o Pro, tal como Claude Sonnet 5.5 e ao contrário de GPT-6.1 Sol no final de setembro. Pode ser escolhido em dez interfaces, do VS Code ao Xcode. O GitHub destina-o a subagentes, alterações rápidas e tarefas no terminal; segundo os seus primeiros testes, igualou Claude Sonnet 5 em muitas tarefas de código com significativamente menos tokens e passos, sem números publicados. É faturado ao preço público: 0,10 dólar por milhão de tokens de entrada e 0,50 dólar de saída até 100 000 tokens de entrada, passando depois para 0,50 e 2,50 dólares, ou seja, dez vezes menos do que Claude Haiku 4.5 no primeiro escalão.

🔗 Claude Haiku 5.5 no GitHub Copilot · Modelos e preços do GitHub Copilot

Devin: 58,4 % no FrontierCode 1.1, à frente de Claude Sonnet 5

7 de outubro — A Cognition disponibiliza Claude Haiku 5.5 no Devin. No FrontierCode 1.1, o seu benchmark proprietário que avalia os modelos em tarefas reais de engenharia segundo a qualidade do código e a possibilidade de o integrar, Haiku 5.5 obtém 58,4 %, à frente de Claude Sonnet 5, por cerca de um oitavo do custo por tarefa deste, segundo a Cognition, que não indica um valor exato. Junta-se também aos auxiliares (sidekicks) do Devin Fusion, que associa um modelo principal a um modelo de apoio: com Claude Opus 5.5 como modelo principal e Haiku 5.5 como apoio, Fusion mantém uma pontuação de 66,2, reduzindo simultaneamente o custo e a latência.

Modelo avaliado pela CognitionPontuação FrontierCode 1.1 Extended
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Claude Haiku 5.5 no Devin


Agentes de código: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 e Delta 0.19

Cinco ferramentas de agentes de código evoluem: Claude Code reforça os seus hooks, Codex CLI gere worktrees, Antigravity CLI reformula a revisão das alterações, VS Code organiza as sessões de agentes numa grelha e Delta abre-se ao trabalho em equipa.

Claude Code 2.1.295: hooks que bloqueiam quando falham

8 de outubro — Claude Code teve duas versões no mesmo dia. A 2.1.294 corrige os hooks prompt e agent escritos como instruções em linguagem natural, que podiam deixar passar aquilo que deveriam bloquear. A 2.1.295 tem 143 entradas, incluindo 97 correções. Com a nova opção onFailure: "block" dos hooks command e HTTP, um hook que não arranca, excede o tempo limite ou devolve um código inesperado bloqueia a ação em vez de a deixar passar; várias correções seguem o mesmo sentido, para os mecanismos de proteção dos mods e as opções --tools e --restricted. Claude Code suporta também o Program Status Protocol (OSC 7501), que permite aos terminais compatíveis mostrar se o agente está a trabalhar, à espera ou terminou, e as descrições de ferramentas MCP carregadas pela pesquisa de ferramentas passam de 2 048 para 16 384 caracteres.

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0: worktrees geridos e tarefas fixadas

8 de outubro — Codex CLI 0.162.0, a primeira versão estável desde a 0.161.0 do dia anterior, lista 225 PR. Quando a funcionalidade de worktrees está ativada, Codex dispõe de ferramentas para criar e listar worktrees Git geridos a partir de projetos locais de confiança, e o centro de comando dos agentes permite fixar uma tarefa com a tecla p, num grupo « Pinned » partilhado quando o servidor o permite. O terminal ganha /copy para percorrer e copiar blocos da transcrição, Ctrl+Insert para copiar uma seleção e uma definição da velocidade de deslocamento, e os URL tornam-se clicáveis até nas aprovações e nos prompts MCP. Os fornecedores de modelos personalizados compatíveis com a Responses API podem declarar o acesso à Web em direto e a compactação remota. Quanto às correções, apply_patch preserva os finais de linha CRLF, o sandbox Linux é reforçado e as versões Windows recebem um instalador PowerShell assinado.

🔗 Notas de versão do Codex CLI 0.162.0

Antigravity CLI 1.3.1: revisão reformulada em /diff, verbosidade média por predefinição

7 de outubro — A CLI do Antigravity publicou cinco versões entre 2 e 7 de outubro. A 1.3.1 melhora a revisão de código no terminal: na vista de ficheiro de /diff, as setas esquerda e direita abrem o ficheiro adjacente na sua primeira alteração, cada ficheiro conserva a sua posição, n e N passam para o ficheiro seguinte ou anterior, e o cabeçalho indica onde nos encontramos. As suas dez correções abrangem, nomeadamente, /rewind em conversas muito longas, os plugins no Windows e as sessões com chave GEMINI_API_KEY, que voltam a tentar quando a ligação à API Gemini cai. A 1.3.0 de 6 de outubro altera a verbosidade predefinida de « high » para « medium », que agrupa chamadas de ferramentas e reflexões em resumos concisos; /config permite voltar à configuração anterior. Antes disso, a 1.2.16 confiava a geração de imagens a um subagente integrado e a 1.2.15 trazia binários Android para Termux.

🔗 Changelog do Antigravity, separador CLI

VS Code 1.141: sessões de agentes em grelha e limpeza dos worktrees

7 de outubro — VS Code 1.141 concentra-se nas sessões de agentes do Copilot. A janela Agents pode dispor várias sessões numa grelha, e o comando Chat: Open Worktree Cleanup mostra o espaço em disco ocupado pelos worktrees das sessões inativas para os eliminar, a pedido ou automaticamente após a integração da pull request. As conversas iniciadas no Copilot CLI ou na aplicação GitHub Copilot aparecem logo no primeiro pedido, sem recarregar o editor, e uma conversa Codex aberta na aplicação ChatGPT ou no Codex CLI pode continuar aí com o seu histórico: ao escolher um modelo Copilot, continua-se com a subscrição do GitHub Copilot, por exemplo depois de atingir o limite de utilização do ChatGPT. No âmbito empresarial, o sandbox do harness Copilot pode ser imposto pelas definições geridas, em pré-visualização, e este harness torna-se progressivamente a escolha predefinida dos utilizadores cujas funcionalidades experimentais estão ativadas.

🔗 Notas de versão do VS Code 1.141

Delta 0.19: menções entre colegas de equipa e caixa de entrada

7 de outubro — A Zed Industries publica Delta 0.19.0, o seu ambiente para programar em conjunto com agentes, seguido a 8 de outubro por uma 0.19.1 de correção. Agora é possível mencionar um colega de equipa numa mensagem ou num comentário escrevendo @ seguido do seu nome de utilizador, e a notificação chega a uma nova caixa de entrada (Inbox). O agente @delta lê e altera grande parte das definições a partir da conversa. Uma definição, Agent Thread Creation, impede os agentes de criar conversas de nível superior sem desativar os subagentes, o agente pode integrar os worktrees de várias threads, e os comandos da CLI executam-se sem abrir uma janela. No total, as notas listam 11 novidades, 22 melhorias e 45 correções. A 8 de outubro, um artigo partilhado pela Zed conta como a equipa substituiu o Google Docs pelo Delta para os seus documentos internos.

🔗 Notas de versão do Delta · Artigo do Delta sobre o abandono do Google Docs


Meios generativos: Nano Banana 2.1, Brand Kit e ElevenReader no Brasil na ElevenLabs, SemanTok da Stability AI

Quatro anúncios sobre imagem, vídeo e voz: um modelo de imagens a metade do preço na Google, um manual de identidade visual reutilizável e uma aplicação de leitura áudio na ElevenLabs, e investigação sobre geração de vídeo na Stability AI.

Nano Banana 2.1 em disponibilidade geral na API Gemini, a metade do preço

6 de outubro — A Google passou Nano Banana 2.1 (gemini-nano-banana-2.1) para disponibilidade geral na API Gemini e no Google AI Studio, sem artigo no blog. Este modelo de geração e edição de imagens atualiza Nano Banana 2, com melhor qualidade visual, melhor representação do texto, personagens mais consistentes de uma interação para outra e formatos panorâmicos, de 1:4 a 8:1, sem artefactos de tiling em 2K e 4K. Aceita até 14 imagens de referência e apoia-se na pesquisa Google. O preço por imagem é reduzido para metade em 1K e 2K, e a Google assinala Nano Banana 2 (gemini-3.1-flash-image) como obsoleto, sem data para a sua desativação.

Preço de saídaNano Banana 2.1Nano Banana 2
Imagem 1K0,0336 dollar0,067 dollar
Imagem 2K0,0504 dollar0,101 dollar
Imagem 4K0,113 dollar0,151 dollar
Milhão de tokens de imagem30 dollars60 dollars

🔗 Notas de versão da API Gemini · Ficha do Nano Banana 2.1

Brand Kit da ElevenLabs: o manual de identidade visual guardado no espaço de trabalho

8 de outubro — A ElevenLabs acrescenta Brand Kit ao ElevenCreative, a sua suite de criação. Cores, tipos de letra, logótipos com as respetivas regras de utilização, imagens de referência e regras da marca, incluindo aquilo que a marca nunca faz, formam um único objeto do espaço de trabalho, que se invoca com @ em Image & Video, em Flows ou junto do agente ElevenCreative. Segundo a sequência de publicações da ElevenLabs, um kit cria-se em poucos minutos colando o endereço de um site ou carregando os recursos da organização; toda a equipa passa então a gerar a partir das mesmas instruções, e uma agência pode criar um kit por cliente. A ElevenLabs quer alargar os kits à voz e ao som da marca, sem data definida. Brand Kit está disponível desde já, sem preço indicado; HeyGen (agosto) e Runway (setembro) já oferecem ferramentas comparáveis.

🔗 Artigo da ElevenLabs: Brand Kit · Sequência de publicações de @ElevenLabs

SemanTok da Stability AI: um modelo de 201M que iguala um modelo 3,4 vezes maior

7 de outubro — A equipa Interactive Research da Stability AI apresenta SemanTok, um tokenizer de vídeo para os modelos de mundo (world models) que geram vídeo token a token, anunciado no X a 8 de outubro. Nos tokenizers « do geral ao pormenor » (coarse-to-fine), os primeiros tokens descrevem a cena no seu conjunto e os seguintes acrescentam os detalhes; SemanTok torna estes primeiros tokens mais ricos em significado e, por isso, mais fáceis de prever. Para isso, injeta no seu codificador características DINO congeladas e acrescenta cabeças leves que as reconstroem a partir de cada prefixo de tokens. Segundo a Stability AI, um modelo autorregressivo com 201M de parâmetros construído sobre SemanTok iguala ou supera um modelo VideoFlexTok 3,4 vezes maior, e os prefixos curtos são mais baratos de prever. O artigo está no arXiv; não são mencionados nem código nem pesos.

🔗 Artigo de investigação da Stability AI · Artigo no arXiv

ElevenReader chega ao Brasil com a voz de Fábio Porchat e 70 000 livros

8 de outubro — A ElevenLabs lança no Brasil o ElevenReader, a sua aplicação que transforma livros, documentos e artigos em áudio, gratuita para iOS e Android, com a voz do ator e humorista Fábio Porchat. O catálogo assenta numa parceria com a Bookwire Brasil: 70 000 títulos em português do Brasil, licenciados pelas principais editoras do país, a maioria dos quais não tinha edição em áudio. A ElevenLabs também produziu Dom Casmurro, de Machado de Assis, lido por Fábio Porchat com música original e design de som. Segundo o diretor-geral da Bookwire Brasil, é a maior seleção de livros brasileiros alguma vez disponibilizada em áudio.

Oferta no BrasilCondições de acesso
Aplicação ElevenReader (iOS, Android)Gratuita
Dom Casmurro lido por Fábio PorchatGratuito para todos
70 000 títulos licenciados pela BookwireCom ElevenReader Ultra, preço não indicado

🔗 Publicação da ElevenLabs: ElevenReader no Brasil


Modelos especializados: LightOnOCR-3 para documentos, Falcon-ASR para árabe, Carbon-A para genomas

Três modelos especializados, dois deles com pesos abertos, para ler documentos, transcrever árabe e anotar genomas.

LightOnOCR-3: três modelos OCR abertos que também identificam a disposição da página

8 de outubro — A LightOn publica o LightOnOCR-3 sob licença Apache 2.0, em três tamanhos (0.8B, 1B e 4B). Além de transcrever uma página, os modelos conseguem identificar cada uma das suas regiões: com o prompt de ancoragem visual (grounding), cada bloco é precedido de uma caixa delimitadora etiquetada, as imagens recebem uma descrição breve e os gráficos tornam-se tabelas HTML de dados. Numa H100, o 4B processa mais 21 % de páginas por segundo do que o Chandra-OCR-2, que, tal como ele, se baseia no Qwen3.5. A LightOn esclarece que as suas pontuações são calculadas após uma normalização dos resultados, publicada com o repositório, que altera significativamente as pontuações de todos os modelos líderes.

BenchmarkLightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1BReferência citada
olmOCR-Bench, pontuação global86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench, cinco categorias75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md, documentos franceses74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 Publicação sobre o LightOnOCR-3

Falcon-ASR: 1,6 mil milhões de parâmetros para o árabe dos Emirados, sem pesos publicados

7 de outubro — O Technology Innovation Institute (TII) de Abu Dhabi apresenta o Falcon-ASR, um modelo de reconhecimento de voz com 1,6 mil milhões de parâmetros centrado no árabe, em particular no dialeto dos Emirados. O mesmo conjunto de pesos também transcreve inglês, francês, espanhol e português, sem ser necessário indicar a língua, com uma marca temporal para cada palavra. Tal como o Falcon-OCR-Arabic e o Falcon-Emirati apresentados na véspera, está disponível apenas como demonstração: o TII anuncia acesso por API e aplicações nativas, sem publicar os pesos.

Avaliação da taxa de erro de palavras (WER)Pontuação do Falcon-ASRReferência citada
Média de seis conjuntos de dados em árabe (Open Universal Arabic ASR)20,92 %23,17 %, melhor resultado publicado até 30 de setembro
Árabe dos Emirados, avaliação interna do TII22,73 %Qwen3-Omni, em segundo lugar, 4,07 pontos acima
Média de sete conjuntos de dados em inglês (Open ASR Leaderboard)5,74 %Nenhuma referência citada

🔗 Publicação sobre o Falcon-ASR

Carbon-A: 566 milhões de genes candidatos em 22 617 espécies

8 de outubro — A equipa de biologia da Hugging Face (HuggingFaceBio) publica o Carbon-A, um modelo com 1,2 mil milhões de parâmetros sob licença MIT que identifica as regiões que codificam proteínas diretamente no ADN, com um único modelo para mamíferos, plantas, fungos e protistas. Em 42 genomas de referência, atinge um F1 nucleotídico médio de 0,944 e supera, segundo os autores, as sete ferramentas comparadas, incluindo AUGUSTUS, Helixer e Tiberius. A equipa executou-o nos genomas eucarióticos do GenBank para construir a Carbon Annotation Database: 48 167 montagens de 22 617 táxones e 566 milhões de loci codificantes previstos, ou seja, 11 vezes mais táxones do que no corpus de treino. Uma validação em laboratório com a ActiveSite e a UCSD, por sequenciação de ARN completo, confirma parte dos genes; os autores esclarecem que isto comprova a transcrição, mas ainda não a produção das proteínas. Está previsto um novo lote dentro de três semanas.

🔗 Publicação sobre o Carbon-A


Treino por reforço: os 1 004 ambientes do TermGrade e o TRL v1.15.0

Duas publicações para a aprendizagem por reforço: ambientes de terminal com pontuação e uma biblioteca que permite treinar sequências mais longas.

TermGrade: 1 004 ambientes de terminal avaliados por seis modelos

8 de outubro — A empresa ai& publica o TermGrade, 1 004 ambientes de terminal para treinar e avaliar agentes por aprendizagem por reforço. Cada tarefa é executada num contentor Linux com uma instrução e testes, e só foi selecionada se a sua própria solução de referência passasse nos testes: das 66 165 tarefas candidatas escritas pelo DeepSeek-V4-Pro, 1,5 % passaram este filtro. Seis configurações de modelos abertos, do Kimi-K3 ao gemma-4-31B-it, realizaram cada tarefa, e as 36 144 tentativas são publicadas, incluindo os fracassos. Um modelo aprende mais com as tarefas que consegue resolver cerca de uma em cada duas vezes: treinado em 151 tarefas desta faixa, o gemma-4-31B-it atinge 46,1 no Terminal-Bench 2.1, ou seja, mais 3,1 pontos do que o modelo de base, e um ganho médio de 2,1 pontos em cinco treinos. Tudo é publicado sob Apache-2.0.

🔗 Publicação sobre o TermGrade · Coleção TermGrade na Hugging Face

TRL v1.15.0: uma cabeça LM fundida para sequências até 6,9 vezes mais longas

8 de outubro — O TRL v1.15.0, a biblioteca de treino da Hugging Face, introduz uma cabeça LM fundida (fused LM head) que calcula diretamente as log-probabilidades e a entropia de cada token com um kernel Triton, sem nunca construir o tensor completo dos logits; está ativada por predefinição para SFT, DPO, KTO, GRPO, RLOO e destilação. Com 8 192 tokens, o pico de memória diminui entre 52 e 82 %, consoante o método. Estas medições foram realizadas numa B300 limitada a 79 Gio com os pesos aleatórios do gemma-3-1b, cujo vocabulário tem 262 000 tokens; o ganho é maior nos modelos pequenos com um vocabulário grande. A versão também quebra a compatibilidade: fim do suporte para Python 3.10, use_liger_kernel descontinuado e remoção do treinador experimental MiniLLM.

Método de treinoComprimento máximo na v1.14.2 (tokens)Comprimento máximo na v1.15.0 (tokens)Fator de ganho
DPO10 24059 392×5,80
KTO (lote de 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (perda nll)20 480107 520×5,25

🔗 Notas do TRL v1.15.0


Inferência: llama.cpp no Windows ML, ML Drift em open source, Together AI em B300 da IBM Cloud

Três anúncios para executar modelos, do PC Windows ao cluster de GPU.

llama.cpp chega ao Windows ML, em fase experimental

7 de outubro — Durante o seu evento Windows, a Microsoft acrescenta ao Windows ML, o seu framework de inferência local, suporte experimental para llama.cpp: obtém-se um modelo GGUF na Hugging Face e executa-se localmente através da mesma stack Windows ML, com novas API dedicadas a tarefas específicas. Uma API de execução nativa do Windows, de mais baixo nível, também entra em pré-visualização experimental. A Microsoft afirma contribuir diretamente para o projeto llama.cpp com a NVIDIA e a comunidade: kernels CUDA otimizados, melhor escalonamento entre processador e GPU, CUDA graphs, descodificação especulativa (Eagle-3, MTP, D-Flash2), execução em várias GPU e formato NVFP4. A publicação situa estas novidades nos PC equipados com chips NVIDIA RTX Spark, como o Surface Laptop Ultra. No X, Georgi Gerganov, do llama.cpp, saúda a presença do projeto no evento Windows e vê nisso um sinal de que as stacks de software e hardware finalmente convergem.

🔗 Publicação Microsoft Foundry on Windows · Tweet de @ggerganov

ML Drift: o motor GPU do LiteRT publicado em open source

8 de outubro — A equipa Google AI Edge publica em open source, sob licença Apache 2.0, o ML Drift, o seu motor de computação GPU para inferência no dispositivo. Abstrai as diferenças entre OpenGL ES, OpenCL, Metal e WebGPU, serve de motor de aceleração GPU do LiteRT, está disponível como biblioteca autónoma e sucede ao delegado GPU do TensorFlow Lite, que deixará de receber novas funcionalidades. O motor muda de kernels consoante o LLM lê o prompt ou gera os seus tokens, e fornece um guia SKILL.md para que agentes de código escrevam e verifiquem shaders. Já está em produção: até 40 % menos latência por imagem nos efeitos do YouTube Shorts e até 30 % de ganho no Lightroom e no Photoshop em dispositivos móveis, segundo a publicação; no Gemma, a Google mede até 12 % menos memória do que com outros frameworks de software (frameworks).

🔗 Anúncio do ML Drift no Google Developers Blog · Repositório google-ai-edge/ml-drift

Together AI, primeiro cliente de um cluster de inferência com GPU B300 na IBM Cloud

6 de outubro — A Together AI anuncia que está a trabalhar com a IBM e a NVIDIA para expandir a sua capacidade de inferência destinada às empresas, começando por um grande cluster de GPU NVIDIA B300 alojado na IBM Cloud e interligado pela rede Ethernet Spectrum-X da NVIDIA. Segundo a Together AI, é o primeiro cluster dedicado à inferência desta dimensão na IBM Cloud, e a empresa é o seu primeiro cliente: opera a camada de inferência, a IBM fornece a cloud e a NVIDIA os chips e a rede. A Together AI justifica esta expansão com a procura de modelos abertos: afirma servir mensalmente centenas de biliões de tokens a mais de um milhão de programadores. A publicação não indica a dimensão do cluster nem um calendário.

🔗 Publicação da Together AI · Tweet de @togethercompute


Breves

  • Controlo mais rápido do Codex — Na aplicação de desktop do ChatGPT, o Codex passa a ter em conta mais cedo uma mensagem de seguimento enviada durante uma tarefa, para corrigir uma abordagem ou mudar de direção; a definição Follow-up behavior determina se estas mensagens orientam a execução em curso ou aguardam a seguinte. 🔗 fonte
  • ChatGPT Go no Warp — Os subscritores do plano ChatGPT Go podem agora utilizá-lo no Warp para qualquer questão de terminal ou tarefa de código; segundo um membro da equipa Sign in with ChatGPT da OpenAI, citado pelo Warp, a utilização incluída está disponível para os clientes Go, além de Plus e Pro, em todas as aplicações parceiras. 🔗 fonte
  • Oracle — Segundo um estudo de caso da OpenAI, a Oracle conta com 130 000 utilizadores ativos do ChatGPT e mais de 95 000 do Codex; uma pesquisa sobre o mercado de talentos que exigia 2 a 4 dias prepara-se em 15 a 20 minutos, e o Codex traduz questões de negócio em consultas SQL. 🔗 fonte
  • Pollo AI — Esta plataforma de criação de vídeo, que afirma ter mais de 26 milhões de utilizadores, encaminha os pedidos do seu agente com GPT-5.6, confia as tarefas difíceis ao GPT-6 Astra e todas as suas imagens ao GPT-Image-2.5, e diz reduzir em mais de 50 % o tempo gasto a escolher um modelo. 🔗 fonte
  • Notas de versão do Devin de 7 de outubro — Uma caixa de notificações reúne os alertas das sessões, com envio configurável para o telemóvel, o estado da fila de fusão aparece em toda a aplicação, e as chaves privadas guardadas como segredos são ocultadas linha a linha na saída dos comandos. 🔗 fonte
  • Copilot CLI 1.0.94 — Tornada estável após seis pré-versões, adiciona Claude Haiku 5.5 ao seletor de modelos, transmite o código shell apresentado ao avaliador das Assisted Permissions para evitar aprovações desnecessárias e permite ativar um servidor MCP antes da sua descoberta. 🔗 fonte
  • Gemini CLI v0.65.0-nightly.20261008 — A telemetria aceita cabeçalhos OTLP personalizados (telemetry.otlpHeaders), um pedido aberto desde outubro de 2025; a CLI já não entra num ciclo entre verificação e OAuth, e o histórico termina sempre com uma mensagem do utilizador, o que evita um erro 400 após /rewind. 🔗 fonte
  • O SDK Antigravity 0.1.21 isola as API experimentais e configura as skills dos subagentes — Primeira versão registada no changelog desde a 0.1.18 de 21 de setembro: um decorador @beta e um módulo google.antigravity.beta separam as pré-versões da API estável, e skills_config permite a um subagente herdar as skills do agente principal, substituí-las ou prescindir delas. 🔗 fonte
  • Developer Knowledge API — A Google apresenta o ecossistema desta API que fornece a sua documentação para programadores (Google Cloud, Firebase, Android) em Markdown atualizado: um comando gcloud developer-knowledge pré-instalado no Cloud Shell, uma skill para agentes de código ligada a um servidor MCP, com Antigravity, Claude Code, Cursor e GitHub Copilot mencionados, e bibliotecas em sete linguagens. 🔗 fonte
  • AQuA — A Google Cloud publica, como implementação de referência, este agente de qualidade (Ambient Quality Agent) que recolhe até 1 000 sessões de um agente ADK em produção, agrupa as falhas, acompanha-as no BigQuery e inicia um diagnóstico das causas com Gemini 3.8 Flash. 🔗 fonte
  • Os rascunhos contam para os limites de pull requests — Perante as contribuições de baixa qualidade, o GitHub permite incluir as pull requests em rascunho nos limites por utilizador, quando até agora um colaborador podia abri-las sem limite. 🔗 fonte
  • Arquivamento de pull requests — Já não está reservado aos administradores: as funções triage, write, maintain e admin podem arquivar uma pull request, o que a fecha, a oculta do público e bloqueia qualquer nova atividade, incluindo comentários dos administradores. 🔗 fonte
  • Cronologias do GitHub e leitores de ecrã — Os leitores de ecrã percorrem as cronologias das issues e das pull requests como listas, com o número de elementos e a posição atual, e anunciam os eventos carregados, em github.com e no GitHub Enterprise Server 3.23. 🔗 fonte
  • Paper Reproductions with ML Intern — Abubakar Abid anuncia na Hugging Face uma função que confia a agentes a reprodução independente das experiências de um artigo publicado, a partir das Paper Pages, para produzir artefactos abertos que ajudam a identificar trabalhos sólidos; sem números nem documentação. 🔗 fonte
  • O chat da Hugging Face por SSH — Adrien Carreira, responsável pela infraestrutura da Hugging Face, apresenta um chat com modelos abertos acessível pelo comando ssh chat.hf.co, sem configuração nem chave; não é acompanhado de documentação nem de uma lista de modelos. 🔗 fonte
  • huggingface_hub 2.2.0 — Pequena versão de correção: hf jobs stats devolve agora um instantâneo e depois devolve o controlo (-f para acompanhar em direto), os downloads paralelos passam todos pelo hf_xet, e duas alterações quebram a compatibilidade. 🔗 fonte
  • swarmlab — A Hugging Face disponibilizou, sem anúncio, este banco de testes que estuda como enxames de agentes LLM de diferentes fornecedores encontram a verdade ou se dividem, consoante a topologia das trocas, os atrasos e os papéis; basta uma linha de YAML para testar uma hipótese. 🔗 fonte
  • Darwin-27B-ZTC — A VIDRAFT publica sob Apache-2.0 um avaliador que devolve numa única passagem uma distribuição de probabilidades sobre as respostas possíveis, sem gerar um token: 0,743 de exatidão em zero-shot sobre 2 000 avaliações de typed-decisions e uma pontuação de Brier de 0,097, segundo os seus autores. 🔗 fonte
  • Superfluid — A basecompute publica sob Apache-2.0 este servidor LLM local, compatível com as API da OpenAI, da Anthropic e do Ollama, que dá prioridade às perguntas interativas sobre o trabalho dos agentes: 0,36 segundo de resposta com oito agentes ativos, contra mais de 10 segundos para o llama-server, segundo os seus autores. 🔗 fonte
  • funes 1.8.0 — A ferramenta que indexa as sessões dos agentes de código adiciona um modelo de embeddings multilingue: em 30 perguntas sobre 2 000 conversas em chinês, a conversa certa aparece nos oito primeiros resultados 30 vezes em 30, contra 23, e a posição recíproca média passa de 0,601 para 0,983. 🔗 fonte
  • GLiNER e as línguas indianas — Uma publicação da comunidade mostra que, ao manter os sinais combinantes nas palavras, sem novo treino, o F1 médio em zero-shot do GLiNER2 passa de 13,2 para 68,0 em nove línguas indianas, e o de um ajuste fino em hindi de 59,9 para 82,6. 🔗 fonte
  • Multilingual Terminal-Bench — A LILT detalha o seu banco de 324 tarefas de código em dez línguas: Claude Opus 5.5 supera Opus 5 em cerca de 3 pontos com 30 % menos tokens, o que representa um custo por tarefa cerca de 45 % inferior; Gemini 3.8 Flash leva uma mediana de 41 turnos por tarefa, contra 5 para GPT-6 Sol. 🔗 fonte
  • Primitivas coletivas GPU — Milos Kotlar prevê o tempo de comunicação de cinco primitivas em quatro RTX 4090 com 10,9 % de erro médio, contra 22,9 % para um modelo comum, mas com um pior caso de 61,6 %. 🔗 fonte
  • Best-of-N em raciocínio sobre vídeo — A facebookresearch disponibiliza, sem anúncio e sob a licença não comercial CC BY-NC 4.0, o código do estudo Selecting or Solving? sobre a seleção best-of-N e os júris de verificadores em raciocínio sobre vídeo. 🔗 fonte
  • KDD Cup 2026 Data Agents — A NVIDIA detalha o harness que colocou a sua equipa KGMON em segundo lugar com um pequeno LLM imposto: dados convertidos em tabelas SQLite, esquema fornecido desde o início, pequeno conjunto de ferramentas, leitura direcionada dos documentos; a publicação não indica pontuação nem nome do modelo. 🔗 fonte
  • Microduck — Matthieu Lapeyre, da Pollen Robotics, anuncia mais de três horas de autonomia com uma bateria de 2 600 mAh para este pequeno robô bípede equipado com a nova placa eletrónica própria, com um processador que atinge no máximo 60 °C em vez de 114 °C. 🔗 fonte
  • Álbuns no Suno — Apresentada a 5 de outubro, a função está disponível: reúne-se as faixas num lançamento completo, escolhe-se a capa, ordena-se as faixas e publica-se no momento desejado; não são especificados planos nem limites de faixas. 🔗 fonte
  • HeyGen e Ryan Serhant — A HeyGen lança uma série de vídeos diários apresentada pelo avatar oficial do agente imobiliário Ryan Serhant, conhecido pela série Netflix Owning Manhattan, no Instagram, TikTok e X; sem detalhes financeiros. 🔗 fonte
  • Runway e a Tech Coalition — A Runway junta-se a esta aliança contra a exploração sexual de crianças online e ao seu programa Lantern de partilha de sinais entre plataformas, e recorda as suas salvaguardas: filtragem de dados, testes adversariais, hashing, comunicação ao NCMEC e proveniência C2PA. 🔗 fonte
  • SpaceXAI e Omarchy — A SpaceXAI torna-se mecenas fundador da Omacom Foundation com 1,5 milhão de dólares em tokens Grok; Grok 4.7 e os seus sucessores alimentarão os agentes do projeto, incluindo o Omabot, que revê as pull requests. 🔗 fonte
  • Guia de salvaguardas da Perplexity — A Perplexity publica um guia que situa as salvaguardas da IA em três momentos (entrada, ação dos agentes, saída), compara cinco tipos de proteção e ilustra sete casos, da injeção de prompt à alucinação; sem novas funcionalidades. 🔗 fonte
  • pplx-decider-v1.1-27b no OpenRouter — O modelo de decisão com pesos abertos da Perplexity chega ao OpenRouter com o preço da Decisions API: 0,02 dólar por milhão de tokens de entrada, saída gratuita, contexto de 262 000 tokens. 🔗 fonte
  • Cohere em Ottawa — A Cohere abre o seu primeiro escritório em Ottawa, perto do parque Lansdowne, onde já trabalham cerca de 30 funcionários (comercialização, engenharia, infraestrutura, segurança, IA soberana); sem indicação da área nem de uma meta para o número de funcionários. 🔗 fonte

O que isto significa

O assistente produz agora objetos de trabalho, já não apenas respostas. Um painel Claude Dashboards atualiza-se quando os dados mudam, uma animação Claude Motion continua a poder ser alterada palavra a palavra porque está escrita em código, e Docs, Slides e Design, que saíram da versão beta para todos os planos, já afirmam contar com mais de 45 milhões de criações. Estes objetos circulam depois nas ferramentas existentes: o painel segue para Grafana ou PostHog, a animação para Runway ou Luma, que lhe acrescentam planos gerados. O Brand Kit da ElevenLabs segue a mesma lógica: a identidade visual torna-se um objeto do espaço de trabalho, invocado por @, em vez de uma instrução a repetir em cada prompt.

A segurança muda de escala, tanto na defesa como na aplicação das regras. A Anthropic constata que encontrar vulnerabilidades nunca foi tão fácil: mais de 29 000 candidatas em seis meses, das quais cerca de 6 000 analisadas manualmente. O OSS Scanner assume o envio de relatórios sem revisão humana, com mais de 90 % de verdadeiros positivos esperados, para aliviar este estrangulamento. As regras de utilização tornam-se mais precisas em paralelo: a política de 2026 da Anthropic reúne as campanhas enganosas numa secção dedicada, e a OpenAI apresenta Dark Clark como a primeira operação de categoria 5 que desmantelou desde o início dos seus relatórios. Nas ferramentas, o Claude Code 2.1.295 permite agora que um hook com falhas bloqueie a ação em vez de a deixar passar.

A velocidade e o preço tornam-se definições que se escolhem. O Ultrafast vende GPT-6.1 Sol a um preço seis vezes superior para atingir uma velocidade até 8 vezes maior; segundo o GitHub e a Cognition, Claude Haiku 5.5 iguala ou supera Sonnet 5 no código, por cerca de um oitavo do custo por tarefa segundo a Cognition; Nano Banana 2.1 reduz para metade o preço de uma imagem 1K. A inferência estende-se desde o dispositivo, com llama.cpp no Windows ML e ML Drift nas GPU dos telemóveis e dos computadores, até ao cluster de B300 do qual a Together AI é o primeiro cliente no IBM Cloud, e o TRL reduz em 52 a 82 % o pico de memória de um treino com 8 192 tokens.

Por fim, muitos dos números do dia são medidos por quem os publica. FrontierCode é o benchmark proprietário da Cognition, o GitHub diz que Haiku 5.5 iguala Sonnet 5 sem publicar números, a LightOn calcula as suas pontuações após uma normalização que altera as de todos os modelos líderes, o TII avalia Falcon-ASR em árabe dos Emirados apenas num conjunto interno e não publica os seus pesos, e os autores de Carbon-A comparam-no eles próprios com sete ferramentas. A ciência aberta oferece um contraponto: TermGrade publica as suas 36 144 tentativas, incluindo as falhas, Carbon-A a sua base de 566 milhões de genes candidatos, e o mapa ultravioleta de Claude Science distingue, píxel a píxel, o que é medido do que é previsto. Os 150 milhões de dólares da Anthropic e os mil milhões da NVIDIA para a Genesis Mission avançam na mesma direção: colocar estas ferramentas nas mãos dos investigadores.


Fontes