Pesquisar

A OpenAI vai aplicar marcas de água ao texto do ChatGPT e do Codex na União Europeia, o Devin lembra-se entre sessões, o GitHub lança o ReviewBench

ai-powered-markdown-translator

Artigo traduzido do francês para o português com gpt-6.1-sol.

Ver projeto no GitHub ↗

A OpenAI vai acrescentar, nas próximas semanas, uma marca de água invisível ao texto do ChatGPT e do Codex para os seus utilizadores da União Europeia, em resposta ao AI Act, que exige que o texto gerado seja identificável por uma máquina, e disponibiliza a partir de hoje esta marca de água como opção aos clientes da sua API em todo o mundo. Nos agentes, a memória começa a instalar-se: a Cognition dota o Devin de memória entre sessões e publica o seu formato como norma aberta, e a Cohere lança o North 2 com uma memória que mantém o contexto de uma sessão para outra; por sua vez, o GitHub publica o ReviewBench, um benchmark aberto de revisão de código por IA. Quanto aos modelos abertos, a Reflection AI apresenta o Beam, com 501 mil milhões de parâmetros, cujos pesos estão prometidos para mais tarde em outubro.


Marca de água invisível da OpenAI: o texto do ChatGPT e do Codex marcado na União Europeia, uma opção mundial na API

5 de outubro — A OpenAI publica a sua resposta às regras europeias sobre a proveniência do texto. O AI Act exige que os fornecedores de IA generativa tornem o texto que produzem identificável de forma legível por uma máquina; a OpenAI responde por etapas, avisando desde o início que as tecnologias atuais de marcas de água para texto têm limitações significativas (limitações significativas).

Público abrangidoO que mudaCalendário anunciado
Utilizadores do ChatGPT e do Codex na União Europeia, em todos os planosMarca de água invisível acrescentada ao texto elegívelNas próximas semanas
Clientes da API, em todo o mundoMarca de água opcional (opt-in) em modelos selecionados, não identificados, desativada por predefiniçãoA partir de 5 de outubro
Investigadores e organizações especializadas aprovadosAcesso ao detetor, caso a caso, mediante candidaturaCandidaturas abertas a 5 de outubro

A OpenAI não faz desta opção uma predefinição mundial e trabalha com parceiros cloud para disponibilizar, nas próximas semanas, a mesma marca de água nos modelos OpenAI que estes oferecem. A tecnologia, textGrain, acrescenta um sinal estatístico invisível às escolhas de palavras do modelo, sem marca visível nem caráter especial; segundo a OpenAI, iguala ou supera as outras abordagens testadas, incluindo o SynthID para texto. É publicado um relatório técnico e a OpenAI prevê disponibilizar o seu código. O detetor, por sua vez, não é público no lançamento, devido ao risco de marcas de água não detetadas e de falsos positivos: o acesso segue o Código de Boas Práticas (Código de Boas Práticas) da Comissão Europeia.

Os números publicados mostram sobretudo os limites da deteção:

Condição de mediçãoTaxa de deteção publicada
Excertos de 200 tokens, conteúdo de psicologia, objetivo de 1 % de falsos positivoscerca de 80 %
Excertos de 400 tokens, conteúdo de psicologia, objetivo de 1 % de falsos positivoscerca de 95 %
Conteúdo de matemática, mesmo limiar de 1 %bastante mais baixa (valor apresentado apenas num gráfico)
Excertos de 400 tokens em inglês (conjunto ELI5), sem alteraçõescerca de 92 %
Os mesmos excertos, com 10 % das palavras substituídas por sinónimos66 %
Os mesmos excertos, com 25 % das palavras substituídas17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇵🇹 As marcas de água têm limitações. São frequentemente indetetáveis, em particular em excertos curtos. Reescrever ou traduzir um texto pode eliminar completamente a marca de água. — @OpenAI no X

Quanto à qualidade, a OpenAI não mede uma diferença significativa em oito benchmarks do GPT-6 Astra sem e com marca de água (94,44 % contra 93,94 % no GPQA Diamond, 53,90 % contra 56,06 % no Terminal-Bench 4.0). O artigo também esclarece o que uma marca de água não indica: nem a proporção de trabalho humano, nem a propriedade ou a responsabilidade pelo texto, nem a identidade do utilizador, nem a exatidão; e a sua ausência não prova que um humano tenha escrito o texto. Para as imagens e o áudio, nada muda: openai.com/verify e a Content Provenance API continuam acessíveis às organizações, e o SynthID junta-se desde 19 de maio aos metadados C2PA das imagens geradas.

🔗 Artigo da OpenAI sobre a proveniência do texto na UE


5 de outubro — A Cognition introduz no Devin duas funcionalidades relacionadas: Memory, uma memória que persiste de uma sessão para outra, e Dreaming, um «sonho» diário que a reorganiza. Memory guarda o que o agente aprende ao trabalhar com cada utilizador: preferências, correções, lições retiradas de um projeto ou de um fluxo de trabalho. Não são resumos de sessões, mas notas curtas, cada uma ligada à sessão em que a lição foi aprendida, e esta memória mantém-se pessoal: não se torna uma instrução partilhada por toda a organização.

As notas ficam no Memory Drive, um repositório Git persistente de ficheiros Markdown organizados por repositório, projeto ou tema. Um ficheiro MEMORY.md, intencionalmente curto, reúne as preferências gerais e o índice do resto: o Devin recebe-o no início de cada sessão e depois procura as notas úteis com as ferramentas que usa para explorar código, sem carregar todo o arquivo no seu prompt. Cada sessão trabalha na sua própria cópia Git: o Devin integra as atualizações das outras sessões, uma verificação de revisão rejeita as operações de escrita desatualizadas e os conflitos são assinalados em vez de serem sobrescritos silenciosamente.

Dreaming é uma sessão diária em segundo plano (à noite, esclarece o fio da Cognition): o Devin relê as conversas anteriores à luz da sua memória, funde as notas que se sobrepõem, remove os detalhes transitórios, procura as lições que não tinham sido registadas e elimina as memórias que nenhuma sessão utilizou. O acesso faz-se em devin.ai, no menu Customize → Memory; o artigo nada diz sobre o Devin Desktop nem sobre o Devin CLI e não anuncia qualquer preço.

A Cognition também publica o formato como norma aberta, Agent Memory Repo, sob licença MIT. A especificação, aberta a contribuições, descreve o ciclo de cada sessão (clonar a memória, pesquisar, atualizar sem intervenção humana no ciclo, enviar após cada alteração) e a combinação de várias memórias numa mesma sessão, cada uma no seu próprio repositório, com as suas permissões e o seu histórico. Entre as utilizações citadas estão a memória de equipa e os enxames de agentes (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇵🇹 Nas primeiras experiências, vimos um enxame de Devin usar a memória para se coordenar em grande escala sem que lho pedíssemos (prometemos que não piratearam ninguém). — @cognition no X

Um «sonho» que reorganiza a memória de um agente já existia na Anthropic (Claude Managed Agents, em maio) e na OpenAI (memória do ChatGPT, em junho); o que muda aqui é uma memória em ficheiros com controlo de versões em Git, publicada como especificação que outros agentes podem adotar.

🔗 Memória e sonhos, artigo da Cognition 🔗 Especificação Agent Memory Repo

Cursor: orientar os agentes do seu SDK durante a execução

5 de outubro — O Cursor expande o seu SDK, que permite lançar os seus agentes a partir de código TypeScript ou Python. O método run.steer() insere uma mensagem no turno em curso de um agente; se um subagente estiver a trabalhar nesse momento, passa para segundo plano e continua. Os subagentes em segundo plano também comunicam os resultados: o seu resultado regressa ao agente principal como um turno adicional da mesma execução, em vez de se perder quando o turno principal termina.

Novidade do SDKÂmbito indicado pelo changelog
run.steer(), controlo durante a execuçãoAgentes locais em TypeScript; num agente cloud, a mensagem é enviada como uma nova chamada normal
Devolução dos resultados dos subagentes em segundo planoAgentes locais, em TypeScript e em Python
Anotações MCP das ferramentas personalizadas (readOnlyHint, destructiveHint…)TypeScript; simples indicações, cujo cumprimento o SDK não impõe
Prompt de sistema substituível, regras e skills sempre carregadosAgentes locais em TypeScript; acesso ativado conta a conta

Nenhum preço acompanha estas alterações.

🔗 O fio do Cursor no X 🔗 Changelog do SDK do Cursor

Qwen Code v0.25.0: agentes de espaço de trabalho, canal de e-mail e memória Mem0

5 de outubro — A Qwen publica a v0.25.0 do Qwen Code, o seu agente de programação na linha de comandos, a primeira versão estável desde a v0.24.7 de 29 de setembro: 42 funcionalidades, das quais 23 para o Managed Agent, 79 correções e nenhuma alteração incompatível conhecida. Destacam-se três adições, todas com ativação explícita. Os agentes de espaço de trabalho passam a colaborar localmente: o daemon lança e retoma os seus turnos, e o Web Shell permite gerir agentes e tarefas e solicitar a intervenção de um deles com @agent a partir de uma conversa. Estes agentes persistentes passam a suportar o protocolo A2A 1.0, através de partilhas que expiram e podem ser revogadas. Por fim, a memória Mem0 liga-se diretamente ao CLI: basta indicar um endpoint e uma chave, e o próprio Qwen Code regista o servidor MCP correspondente. Um canal de e-mail também dá ao agente a sua própria caixa de correio, com IMAP e SMTP, e o Code Mode executa em paralelo as chamadas Bash que o modelo agrupa. O SDK TypeScript v0.1.18 e a aplicação Desktop v0.25.0 foram lançados na mesma manhã, sem tweet da Qwen.

🔗 Notas de lançamento do Qwen Code v0.25.0

5 de outubro — A Together AI lança em beta o Together Link, que executa os agentes de código já instalados nos modelos abertos alojados pela plataforma. Um comando de instalação (macOS ou Linux) liga o Claude Code, o Claude Desktop, o Codex, o OpenCode e o Pi à sua API, com a chave da conta; a documentação acrescenta o ChatGPT Desktop e avisa que os comandos, o encaminhamento e a lista de modelos ainda podem mudar. Além do modo Auto, são disponibilizados quatro modelos, todos com 1M de tokens de contexto:

Modelo disponibilizadoEquivalente no menu /model do Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

O modo Auto, selecionado por predefinição, pode entregar as tarefas difíceis ao Opus 5.5 quando o utilizador fornece uma chave Anthropic, mas o artigo e a documentação não descrevem este encaminhamento da mesma forma: uma escolha feita uma única vez por sessão para preservar a cache de prompt segundo o artigo, uma seleção pedido a pedido reservada ao Claude Code e ao Claude Desktop segundo a documentação. A Together AI anuncia uma redução da despesa de mais de 50 %, sem publicar o método, e apresenta após cada sessão o seu custo ao lado do custo que teria tido no Opus 5.5.

🔗 Artigo da Together AI 🔗 Documentação do Together Link

O IBM Bob com alojamento próprio baseia-se no Nemotron 3 Ultra da NVIDIA

5 de outubro — A IBM explica por que razão a versão com alojamento próprio (self-hosted) do Bob, o seu assistente de desenvolvimento agêntico, se baseia no Nemotron 3 Ultra da NVIDIA, a par do Poolside Laguna S 2.1. Esta opção, que entrou em disponibilidade geral na semana anterior, executa o assistente na infraestrutura do cliente, incluindo em ambientes isolados da rede (air-gapped). A equipa avaliou os modelos segundo quatro critérios (necessidades de hardware, precisão em código, latência, abertura dos pesos), testando-os com a estrutura de execução do agente Bob e usando como referência modelos fechados da Anthropic, da OpenAI e da Google. Inicialmente demasiado prolixo, o Nemotron foi ajustado em conjunto com a NVIDIA: prompts, parâmetros de amostragem, definições de raciocínio e correções da estrutura de execução. Segundo testes internos da IBM, o Nemotron 3 Ultra oferece uma latência até cerca de 4 vezes inferior em GPU Blackwell à de modelos SaaS de ponta acedidos pela rede e respeita rigorosamente os esquemas das ferramentas; o Laguna S 2.1 foi escolhido pela sua relação entre desempenho e necessidades de hardware. O artigo não publica qualquer pontuação de precisão.

🔗 Artigo da IBM sobre o Bob com alojamento próprio


ReviewBench: GitHub lança um benchmark aberto de revisão de código por IA

5 de outubro — GitHub lança em prévia de investigação (research preview) o ReviewBench, um benchmark aberto para agentes de revisão de código por IA. O site dedicado publica o conjunto de dados completo, a classificação, a metodologia, o prompt e a configuração do juiz, bem como um executor em regime de autosserviço. O artigo é assinado por Michelle Zhou e Alejandro Carderera de Diego, e os seus agradecimentos associam GitHub e Microsoft ao projeto.

O corpus reúne 219 pull requests provenientes de 187 repositórios open source públicos, em 19 linguagens. As suas distribuições de linguagens e de tamanhos dos repositórios reproduzem as do GitHub, estabelecidas com base em 103,9 milhões de pull requests, com uma ponderação assumida a favor de alterações médias e grandes. A verdade de referência (golden set) cruza revisores humanos, problemas deduzidos dos commits de acompanhamento, ferramentas de análise determinísticas e vários LLM de ponta; as constatações são validadas por um juiz LLM, Claude Sonnet 5 segundo o artigo. Engenheiros sénior que não participaram na construção do conjunto de dados voltaram a rotular cada constatação: o seu veredicto coincide com o do ReviewBench em 96,6 % dos casos. O recall «ancorado» (grounded), medido apenas sobre a verdade de referência, serve de comparação principal.

Segundo a classificação inicial do GitHub, Copilot code review ocupa o primeiro lugar:

Agente avaliado (configuração)F1 ancoradoPrecisão ancoradaRecall ancoradoData de execução
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1 de outubro de 2026
Devin AI37,0 %84,0 %23,8 %28 de setembro de 2026
Qodo35,1 %85,3 %22,1 %28 de setembro de 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 de julho de 2026
Cubic27,3 %85,5 %16,3 %29 de junho de 2026
Greptile27,2 %86,1 %16,2 %16 de junho de 2026
Cursor17,3 %87,7 %9,6 %27 de setembro de 2026

O site esclarece que estas primeiras entradas foram produzidas pela equipa ReviewBench ao executar o produto público de cada fornecedor, na data indicada, e que os fornecedores não as executaram nem verificaram. Qualquer pessoa pode agora submeter o seu agente: imagem de contentor e chave de modelo fornecidas pelo candidato, juiz fornecido pelo GitHub, testes em 25 pull requests e depois execução completa em três passagens; uma pontuação só é publicada após validação por um mantenedor, e apenas se melhorar a pontuação anterior do agente ou se for a sua primeira entrada.

GitHub também o utiliza para fazer evoluir Copilot code review. Num teste A/B, uma revisão com vários modelos do nível Lite, que combina várias execuções independentes, aumentou o recall em 13,6 % com uma redução de 8,0 % no custo por revisão, na direção prevista na avaliação offline. O artigo contradiz-se quanto ao volume de comentários: +61 % segundo o texto, +25,0 % segundo o seu gráfico.

🔗 Artigo do GitHub sobre ReviewBench 🔗 Site e classificação do ReviewBench


Cohere lança North 2 e estabelece uma aliança mundial com a PwC

5 de outubro — Cohere lança North 2, a nova versão de North, a sua plataforma de agentes IA para empresas, anunciada como «disponível em breve» a 9 de setembro e depois prometida para outubro. A thread de lançamento anuncia mais de 15 novas funcionalidades (15+ novas funcionalidades), uma contagem que o artigo não retoma. O núcleo da versão é uma nova infraestrutura de execução de agentes (agent harness), redesenhada para automações e agentes com várias etapas, numa plataforma que continua agnóstica: modelos da Cohere ou modelos do cliente.

Área funcionalNovidades citadas pela Cohere
AgentesAgentes e automações reutilizáveis, criados por prompt e partilhados na organização; orquestração de vários agentes; memória que mantém o contexto de uma sessão para outra
ProdutividadeCompetências (Skills), bibliotecas (Libraries) e aplicações que produzem apresentações, painéis de controlo e documentos; Automations, lançadas no final de julho, com modelos prontos a usar e editor visual
ConectoresSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion e GitHub; fornecedores de dados financeiros (PitchBook, FactSet e outros) apenas previstos
Implementação e segurançaAutoalojado, VPC, híbrido, nas instalações ou totalmente desconectado; SOC 2 Type 2, ISO 27001 e ISO 42001; políticas de autonomia com validação humana das decisões críticas
GovernaçãoConsola North Admin, patamares de consumo de pedidos e de tokens por utilizador ou por grupo, alertas antes de atingir os limites

Cohere cita dois clientes, LG CNS na Coreia do Sul e Bell Cyber no Canadá, e destaca um maior débito dos seus modelos em GPU NVIDIA Blackwell e Hopper, sem números, com uma citação de Kari Briski, responsável pela IA generativa na NVIDIA. Não são indicados preços nem um calendário de implementação: o artigo remete para uma demonstração a agendar com as equipas comerciais.

🔗 Artigo de lançamento do North 2 🔗 Thread de lançamento do North 2 no X

A aliança mundial com a PwC, que começa no Canadá

5 de outubro — No mesmo dia, PwC e Cohere anunciam uma aliança mundial (aliança global) que começa pelo Canadá, num comunicado da PwC Canada datado de Toronto e divulgado num breve artigo da Cohere. A divisão de funções é clara: Cohere fornece North, os seus modelos empresariais e as suas ferramentas de recuperação de informação; PwC contribui com a sua experiência setorial, regulamentar, de gestão de riscos e de transformação, desde a escolha dos casos de uso até à integração da IA nos dados e nos sistemas da empresa. Os usos anunciados abrangem a pesquisa empresarial, o acesso ao conhecimento, a investigação aprofundada, o apoio à decisão e a automação de tarefas, em cloud privada, nas instalações ou num ambiente desconectado, tendo os setores regulamentados como alvo principal. O comunicado cita Domenic Marino e Annie Veillet, da PwC Canada, e Aidan Gomez, da Cohere; não indica qualquer montante, cliente ou calendário para além do Canadá. Cohere já tinha estabelecido uma aliança com a OpenText a 16 de setembro.

🔗 Artigo da Cohere sobre a aliança com a PwC 🔗 Comunicado da PwC Canada


Modelos abertos: Beam, MetaEncoder-30B e Gemma 4 na genómica vegetal

Três modelos abertos marcam a atualidade do dia, em três fases diferentes: um está prometido, outro foi disponibilizado sem anúncio e o último é destacado um mês após a sua publicação.

Beam: o modelo aberto de 501 mil milhões de parâmetros da Reflection AI

5 de outubro — Reflection AI apresenta Beam, o seu primeiro modelo com pesos abertos: um MoE esparso de 501 mil milhões de parâmetros, dos quais 23 mil milhões ativos, concebido para código, raciocínio e tarefas agênticas, e treinado de ponta a ponta a partir do zero. O pré-treino abrangeu 23 800 mil milhões de tokens; a fase de aprendizagem por reforço mobilizou 10 500 GPU NVIDIA GB300 durante quatro semanas e produziu mais de 100 milhões de trajetórias (rollouts).

Segundo as tabelas da Reflection AI:

Benchmark avaliadoBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Um travessão assinala uma pontuação não apresentada no artigo. Reflection AI afirma obter pontuações de raciocínio comparáveis às de GLM-5.2 com 3 a 4 vezes menos computação de inferência, e reconhece que Kimi K3 continua à frente em capacidade bruta. Ainda não há nada disponível para descarregar: Beam está em avaliações finais e testes adversariais (red-teaming), o acesso antecipado exige uma inscrição, e os pesos, o relatório técnico, a ficha do modelo e as ferramentas para programadores estão prometidos para mais tarde em outubro.

🔗 Artigo da Reflection AI sobre Beam

MetaEncoder-30B, o codificador de decisão que a Meta disponibiliza sem anúncio

5 de outubro — Meta disponibilizou no Hugging Face, sob a sua organização facebook, o MetaEncoder-30B, sem que tenha sido encontrado qualquer anúncio: o repositório, criado a 30 de setembro e modificado a 5 de outubro, contava apenas com dois downloads no momento da nossa consulta. A ficha apresenta um codificador multimodal «System One», o formato dos modelos de decisão da Jev: recebe uma tarefa em linguagem natural (pergunta, instrução, descrição de estado, critérios) e uma lista de candidatos, em texto com imagens e vídeos de apoio, e atribui uma pontuação a cada candidato. Como a tarefa e os candidatos são codificados separadamente, a comparação reduz-se a um produto escalar, e um índice de vizinhos mais próximos pode abranger milhões de candidatos sem voltar a executar o modelo. MetaEncoder é um ajuste contrastivo de Muse Glimmer 30B, o modelo agêntico com pesos abertos lançado pela Meta em agosto, do qual herda a licença Apache 2.0; o download exige a aceitação de condições, e o vLLM disponibiliza-o para texto e imagem.

Conjunto de avaliaçãoPontuação segundo a ficha do modeloMétrica utilizada
JEVBench (original / fácil / difícil)0,9444 / 1,0000 / 0,7387Exatidão
ImaJEV-Bench0,8958Exatidão
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (imagem / vídeo / documentos visuais)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Ficha do MetaEncoder-30B no Hugging Face

Living Models combina Gemma 4 e BOTANIC-1 para descodificar o ADN das plantas

5 de outubro — Google destaca, num X Article de @GoogleAI e na sua montra Gemmaverse, o trabalho da Living Models, um laboratório de biologia com IA sediado em Paris. Gemma 4 E4B orquestra a análise (cadeias de processamento no terminal, filtragem de dados, chamadas de ferramentas), localmente através do Ollama num único GPU NVIDIA L4, enquanto BOTANIC-1, um modelo de base genómico pré-treinado em 320 espécies vegetais, avalia o efeito das mutações; os genomas proprietários permanecem nas instalações. O estudo de caso retoma uma descoberta realizada no INRAE por Adnane Boualem: a alteração de uma única letra no gene CmEIN3 do melão faz a flor passar de feminina a hermafrodita. Entre as 2 494 mutações pontuais candidatas, a mutação validada surge em primeiro lugar, sem empate, em menos de quatro minutos segundo o X Article.

Configuração testada (20 execuções)Recall@1
Sem orientação0,00
Orientação especializada0,15
Com a pontuação do BOTANIC-10,90

Os modelos Botanic1 (de 0,3 a 2 mil milhões de parâmetros) e a pré-publicação no bioRxiv datam do início de setembro: a novidade é este destaque dado pela Google e o detalhe dos resultados.

🔗 X Article da Google AI 🔗 Página Gemmaverse da Google DeepMind


Publicidade no ChatGPT: um formato visual em teste e uma medição alargada

5 de outubro — OpenAI prepara um formato publicitário visual para o ChatGPT: imagens mostrarão a inspiração em torno de um produto, a sua utilização ou a experiência que proporciona. O primeiro teste terá lugar durante a geração de imagens, com anúncios claramente identificados e separados da imagem em criação; começará mais tarde este mês nos Estados Unidos, com um primeiro grupo de anunciantes. OpenAI recorda que a publicidade não influencia as respostas do ChatGPT, que, segundo a empresa, chega a 1,2 mil milhões de pessoas todas as semanas.

A maior parte dos anúncios diz respeito à medição: envio de conversões através de Hightouch, Tealium e LiveRamp, dez parceiros de atribuição identificados (incluindo AppsFlyer, Adjust e Triple Whale), experiências geográficas de incrementalidade com Haus, Measured e WorkMagic, uma janela de conversão pós-impressão de um dia nos relatórios e um indicador de qualidade dos sinais (Event Quality Score). Quanto à segurança das marcas, os anunciantes elegíveis podem excluir expressões (Negative Phrases), e estão em preparação projetos-piloto de avaliação com DoubleVerify e Integral Ad Science. O pixel e a Conversions API, por sua vez, existem desde 5 de maio.

Resultado publicado pela OpenAIValor publicadoMedição realizada por
Custo por aquisição da WeightWatchers em comparação com o seu benchmark de pesquisa paga−15,3 %DV Rockerbox
Compras incrementais da marca Dose realizadas por novos clientes67 %WorkMagic
Visitantes da Portland Leather provenientes dos ChatGPT Ads e novos para a marca93 %Triple Whale

🔗 Artigo da OpenAI sobre o novo formato publicitário 🔗 Artigo do blog Ads sobre a medição


Changelog da Perplexity de 5 de outubro: extensão de navegador para Computer, Wiley e Stripe Projects

5 de outubro — A Perplexity publica um changelog de produto com 18 rubricas, sem divulgação no X no momento do nosso levantamento. Oito retomam anúncios já cobertos (Automations, Claude Opus 5.5, geração de vídeo, Skills American Express, Portable Computer em AMD, Fast Search, Profiles da Agent API, Claude Fable 5.1), uma nona acrescenta explicações 3D interativas aos gráficos de 1 de outubro, e nove novidades são inéditas:

Novidade inéditaPlataforma ou versãoPúblico abrangido
Extensão para Chrome, Edge ou Brave, que permite ao Computer utilizar o navegador (Comet continua a ser a opção predefinida)Perplexity para Mac 26.38.0 e posterioresNão especificado
Tarefas do Computer em separadores e janelas separadosPerplexity para Mac 26.37.1 e posterioresNão especificado
Modo de esforço (Light, Standard, High, Ultra) em dispositivos móveisiOS 26.38.0 e Android 2.100.0, e posterioresPro, Max, Enterprise Pro, Enterprise Max
Revistas e livros da Wiley sem subscrição separada da WileyPerplexity e ComputerTodos os planos, quotas premium variáveis
GPT-6.1 Sol, que também alimenta o esforço Light do Computer em substituição do GPT-6 SolPerplexity e ComputerSubscritores elegíveis de planos pagos
Conversa guiada para iniciar uma primeira tarefa do ComputerWebNovas contas gratuitas
Ligação de uma aplicação a partir da caixa de entrada (Ligar uma aplicação)Computer na WebNão especificado
Conector DocSend para salas de dados de investimento (deal rooms)ComputerConta DocSend elegível
Stripe Projects: chave da API Perplexity criada a partir da CLI da StripeCLI da StripeProgramadores da API Perplexity

Com Stripe Projects, um comando cria ou associa o projeto, gera a chave e escreve-a no ficheiro .env, uma configuração que a Perplexity propõe confiar ao Claude Code, Cursor ou Codex.

🔗 Changelog da Perplexity de 5 de outubro


Criação generativa: Suno Albums e HyperFrames Studio da HeyGen

Suno acrescenta álbuns

5 de outubro — A Suno acrescenta álbuns, até agora ausentes da sua plataforma. Segundo o artigo que acompanha o anúncio, a funcionalidade transforma as suas melhores faixas em projetos completos (projetos de duração completa), e uma lista de reprodução (playlist) que servia de álbum pode agora ser convertida num Álbum. A Suno apresenta os artistas de cinco primeiros álbuns: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) e VOID (ECHLO). A empresa não especifica os planos abrangidos, o número de faixas por álbum nem a data exata de disponibilização. Em junho, a Suno já questionava a sua comunidade sobre a experiência de escuta, entre listas de reprodução, álbuns e rádios.

🔗 Anúncio da Suno no X 🔗 5 álbuns que não pode perder, blog da Suno

HyperFrames Studio, o editor de vídeo da HeyGen concebido para agentes

5 de outubro — HyperFrames, o framework open source da HeyGen que transforma código HTML em vídeo, torna-se uma aplicação de computador. HyperFrames Studio apresenta-se como um editor de vídeo construído de raiz para agentes: descreve-se o vídeo pretendido, o agente (Claude Code, Codex ou um agente próprio) entrega uma primeira montagem, e depois a pessoa e o agente trabalham na mesma linha de tempo (timeline). A orientação faz-se por gestos em vez de prompts: rodear um elemento da imagem, fixar um comentário a uma palavra ou fazer um corte diretamente. A aplicação exporta em 4K e afirma oferecer centenas de inspirações e modelos; é gratuita segundo a conta HyperFrames no X, e apenas uma versão macOS está disponível para download. Dá continuidade ao Studio Preview de julho, que já permitia editar visualmente um vídeo gerado por código.

🔗 Anúncio do HyperFrames Studio 🔗 Divulgação da HeyGen


Breves

  • Warp Factories rumo à disponibilidade geral — Num artigo de 3 de outubro sobre o seu seminário de outono, a Warp indica que Warp Factories, a sua infraestrutura de agentes, está a passar do acesso antecipado à disponibilidade geral, sem data nem preço; a equipa afirma ter reduzido em 70 % o seu custo por PR no último mês com recurso a esta infraestrutura. 🔗 fonte
  • Notas de versão do Devin de 2 de outubro — As definições de acesso do Microsoft Teams são agora aplicadas, um clique seleciona todas as constatações de segurança com a mesma gravidade (incluindo na API v3) e os plugins propostos mostram as suas skills, MCP, hooks e regras antes da instalação; os builds de ambientes em grandes repositórios Perforce dispõem de 3 horas em vez de falharem após 10 minutos. 🔗 fonte
  • MCP TikTok Ads no Replit — O Replit acrescenta TikTok Ads ao seu catálogo de mais de 450 integrações: depois de ligar a conta, o seu Agent pode criar e gerir anúncios TikTok, alcançar públicos e medir o desempenho a partir do espaço de trabalho, sem consumir créditos pela ligação. 🔗 fonte
  • Cockle Finance no Replit — O Replit fixa um vídeo sobre Cockle Finance, cuja ferramenta foi construída no Replit por Dan e pelo seu pai Steve para acompanhar o afluxo de clientes; segundo o Replit, Dan fez crescer o seu negócio em 15 % em três meses, sem especificar a métrica. 🔗 fonte
  • Copilot CLI 1.0.92 em versão estável — Esta versão reúne as novidades das versões preliminares 1.0.92-0 a -5; a única novidade inédita é que, após uma ligação ao Microsoft Entra, o utilizador escolhe a conta a utilizar, /logout encerra essas sessões OAuth e os servidores MCP protegidos pelo Entra renovam as suas credenciais sem intervenção. 🔗 fonte
  • Codex CLI 0.160.1 — Esta correção da 0.160.0 contém apenas um backport: as variáveis Windows SYSTEMROOT, TEMP e TMP são preservadas ao iniciar servidores MCP stdio remotos cujo ambiente remoto está configurado explicitamente; é a versão estável mais recente, não tendo sido lançada nenhuma 0.161.0 estável. 🔗 fonte
  • Nightly do Gemini CLI de 5 de outubro — Não contém nenhuma alteração: construída a partir do mesmo commit da versão de 3 de outubro, só difere nos números de versão, e os canais estável (v0.62.0) e de versões preliminares (v0.63.0-preview.0) permanecem inalterados. 🔗 fonte
  • SDK TypeScript da SpaceXAI 0.2.1 — Publicada em 2 de outubro, esta versão acrescenta toJson(schema), que valida a saída estruturada com um validador Standard Schema (Zod, Valibot ou ArkType), e a opção retryBeforeOutput, que repete um pedido em fluxo contínuo (streaming) que tenha falhado antes de produzir qualquer saída; um 429 sem cabeçalho Retry-After passa agora a esperar a partir de um segundo, até 30 segundos, em vez de 250 milissegundos. 🔗 fonte
  • Cresta Conductor sobre o Claude Agent SDK — Na série da Anthropic dedicada às startups que desenvolvem com Claude, a Cresta apresenta Conductor, um construtor de agentes de atendimento ao cliente em linguagem natural desenvolvido sobre o Claude Agent SDK; segundo a Cresta, reduziu aproximadamente para metade o tempo de implementação inicial nos primeiros casos de uso, sem data de disponibilidade nem preço. 🔗 fonte
  • npm: expiração das configurações de publicação de confiança — Desde 2 de outubro, uma configuração de publicação de confiança (trusted publishing) que não tenha sido utilizada em nenhuma publicação expira 48 horas após a sua criação, e o npm também recusa tokens provenientes de eventos issue_comment do GitHub Actions, tal como para pull_request_target. 🔗 fonte
  • npm: a publicação pendente cria pacotes — Desde 2 de outubro, npm stage publish pode criar um pacote que ainda não existe, com uma sessão local ou um token granular, incluindo um limitado à colocação em espera (stage-only); a primeira versão aguarda a promoção por um mantenedor antes de poder ser instalada. 🔗 fonte
  • Agent API da Perplexity com Fast Search — As predefinições low, medium e high da Agent API utilizam agora Fast Search para a ferramenta web_search, passando de 2,50 para 1 dólar por 1 000 invocações e sendo cerca de 800 ms mais rápidas; a predefinição xhigh mantém a pesquisa padrão. 🔗 fonte
  • Guia RAG da Perplexity — A Perplexity publica um guia com nove exemplos de geração aumentada por recuperação (retrieval-augmented generation, RAG) e sete arquiteturas, citando-se a si própria pelo seu índice web e pela sua funcionalidade Instant Buy ao lado de exemplos de terceiros como Zendesk ou GitHub Copilot; nenhuma novidade de produto. 🔗 fonte
  • Número de trabalhadores da Cohere — Segundo a Cohere, a empresa passou de cerca de 400 trabalhadores no início de 2026 para mais de 800 atualmente, um número apresentado numa mensagem de recrutamento. 🔗 fonte
  • IsoVGRBench e Logbook na Meta — Sem anúncio, facebookresearch publica o código de IsoVGRBench, que avalia modelos de recompensa de vídeo em 16 000 pares que diferem apenas num aspeto (perante o mesmo clip com as imagens baralhadas, estes modelos respondem praticamente ao acaso), e o de Logbook, dedicado a eventos em gravações de áudio muito longas. 🔗 fonte
  • FiftyOne lê os conjuntos LeRobot v3 — Segundo um artigo da comunidade de Harpreet Sahota, o conjunto de ferramentas open source FiftyOne lê agora nativamente o formato LeRobot v3, sem conversor nem cópia dos vídeos; a demonstração abrange 497 episódios extraídos dos 50 tipos de robôs do conjunto comunitário do LeRobot. 🔗 fonte
  • FetchMan-data da Ai2 — Publicado em 1 de outubro sem anúncio, este conjunto reúne 352 696 episódios simulados (52 milhões de frames, 902 instruções) de preensão de objetos por um humanoide Unitree G1, gerados no MolmoSpaces, no formato LeRobot v3 e sob licença ODC-BY. 🔗 fonte
  • P(doom) nos perfis Hugging Face — Os utilizadores do Hub podem mostrar no seu perfil o seu P(doom), a sua estimativa da probabilidade de a IA provocar uma catástrofe existencial; as respostas alimentam um inquérito do qual apenas serão publicados resultados agregados e anonimizados, dentro de duas semanas. 🔗 fonte
  • Extensão hf-image — A Hugging Face disponibiliza, sem anúncio, uma extensão da sua CLI que constrói, envia, descarrega e executa imagens de contentores no seu registo cr.hf.co; as camadas não comprimidas são deduplicadas pelo Xet, pelo que uma camada de 2 Go com uma alteração de 100 Mo envia apenas cerca de 100 Mo, segundo o README. 🔗 fonte
  • Três experiências de Milos Kotlar — Em três artigos da comunidade, Milos Kotlar torna o cache KV de um pequeno transformer 2,71 vezes mais compacto, com 97,85 % de concordância no próximo token, e reduz a proporção de tokens sem especialista num encaminhamento MoE de 13,84 % para 8,09 %, sem qualquer ganho de velocidade. 🔗 fonte
  • Auditoria de um juiz LLM por Stephen Yu — Stephen Yu auditou, em 38 400 amostras, o juiz GLM-5.3 que pontua a fidelidade aos factos na recompensa GRPO do seu modelo de reescrita de 12B: fiável para detetar que um facto mudou, com ruído na avaliação da sua gravidade; contar as saídas incorretas revela uma redução de 39 % que a primeira contagem ocultava. 🔗 fonte
  • Simpósio da Sakana AI em Tóquio — A Sakana AI abre as inscrições para um simpósio gratuito em 26 de outubro no Hitotsubashi Hall de Tóquio, em inglês, com uma conferência de Jürgen Schmidhuber e uma entrevista com David Ha, CEO da Sakana AI. 🔗 fonte
  • Startups NVIDIA Inception e cancro da mama — A NVIDIA apresenta quatro startups do seu programa Inception que aplicam a IA ao percurso de cuidados, incluindo iSono Health e o seu ecógrafo 3D ATUSA autorizado pela FDA (cerca de dois minutos por mama, contra até 45 minutos manualmente), Whiterabbit.ai, Ataraxis AI e SimBioSys; algumas destas tecnologias não estão aprovadas pela FDA. 🔗 fonte

O que isto significa

A proveniência do texto torna-se uma obrigação regulamentar. Até agora, a rastreabilidade dos conteúdos gerados incidia sobretudo na imagem e no áudio, com marcas de água e metadados verificáveis; o AI Act alarga a exigência ao texto, e a OpenAI responde por etapas: marca de água aplicada por predefinição ao texto do ChatGPT e do Codex na União Europeia, simples opção na API, detetor reservado a organizações aprovadas. Os números publicados explicam esta prudência: cerca de 95 % dos excertos de 400 tokens são detetados em conteúdo do tipo psicológico, com uma taxa de falsos positivos visada de 1 %, mas, em excertos de 400 tokens em inglês, substituir 10 % das palavras por sinónimos reduz a deteção de cerca de 92 % para 66 %, e uma reescrita ou uma tradução pode apagar a marca de água. A marca de água dá um indício de proveniência, não uma prova, e a sua ausência nada diz sobre o autor.

A memória dos agentes consolida-se e começa a ser normalizada. O Devin guarda as suas lições num repositório Git de ficheiros Markdown que o Dreaming reorganiza todos os dias, e a Cognition publica o formato sob licença MIT para que outros agentes o adotem; o North 2 conserva o contexto de uma sessão para outra; o Qwen Code liga o Mem0 diretamente à sua CLI. As abordagens diferem, entre ficheiros versionados legíveis por uma pessoa, serviço de memória externo e funcionalidade integrada numa plataforma, mas respondem à mesma necessidade: que um agente não recomece do zero em cada sessão. A escolha da Cognition tem uma vantagem prática: cada nota remete para a sessão em que foi aprendida, pode ser consultada na interface e conserva o seu histórico Git, o que permite ler e corrigir aquilo que o agente reteve.

Os modelos abertos entram nas ferramentas de código por várias portas. O Together Link liga-os a agentes existentes, incluindo Claude Code e Codex, anunciando uma redução de despesas superior a metade; a IBM executa a versão autoalojada do Bob com Nemotron 3 Ultra para as empresas que mantêm o desenvolvimento na sua própria infraestrutura, incluindo em ambientes desligados da rede; a Reflection AI apresenta Beam como um modelo aberto concebido para código e tarefas agênticas, com 80,9 no SWE-bench Verified segundo as suas próprias tabelas. O argumento comum assenta menos na pontuação bruta, em que a Reflection AI reconhece que Kimi K3 continua à frente, do que no custo, na latência e no controlo dos dados.

Muitos dos números do dia vêm de quem os publica. O GitHub concebeu ReviewBench e produziu a classificação inicial em que Copilot code review fica em primeiro lugar, sem execução nem verificação pelos outros fornecedores; a latência do Nemotron 3 Ultra vem de testes internos da IBM; as poupanças do Together Link e os resultados publicitários do ChatGPT são os que anunciam a Together AI e a OpenAI. O GitHub publica, contudo, o seu conjunto de dados, o seu juiz e a sua metodologia, e abre as submissões: cada fornecedor pode repetir a medição com o seu próprio agente. É isso que permitirá dizer se esta classificação inicial se mantém.


Fontes