ai-powered-markdown-translatorArtigo traduzido do francês para o português com gpt-6.1-sol.
GPT-6 e Intelligent UI chegam a todos os utilizadores do ChatGPT: GPT-6 Sol para os planos pagos a partir de 7 de outubro, GPT-6 Luna para Free e Go a partir de 8 de outubro. A Anthropic completa a sua família 5.5 com Claude Haiku 5.5, a partir de 0,10 dólar por milhão de tokens de entrada, enquanto o evento Windows da Microsoft abre as pré-encomendas dos PC RTX Spark e anuncia que GitHub Copilot poderá em breve confiar as suas tarefas a um modelo local. A OpenAI publica também 722 manuscritos de resultados matemáticos produzidos por um modelo interno.
ChatGPT passa a GPT-6 e Intelligent UI para todos, lê ficheiros de áudio e prepara College Planner
7 de outubro — A OpenAI alarga GPT-6 a todos os utilizadores do ChatGPT. Não se trata de um novo modelo de base: GPT-6 Sol e GPT-6 Luna já estavam disponíveis para clientes pagos desde setembro (abordados aqui a 22 de setembro). Desta vez, versões de outubro destes dois modelos, ajustadas para a conversa do dia a dia, chegam ao separador Chat: GPT-6 Sol para Plus, Pro, Business e Enterprise a partir de 7 de outubro, GPT-6 Luna para Free e Go a partir de 8 de outubro. Substituem GPT-5.6 Sol e GPT-5.6 Luna no ChatGPT, enquanto Codex e ChatGPT Work continuam nas versões de setembro. A OpenAI diz assim dirigir-se às mais de 1,2 mil milhões de pessoas que utilizam ChatGPT todas as semanas.
A novidade mais visível chama-se Intelligent UI. GPT-6 compõe as suas respostas com texto, elementos visuais e elementos interativos (gráficos, botões, formulários, diagramas interativos, mapas) e pode criar, a pedido, uma pequena ferramenta, como uma calculadora de poupanças, uma ferramenta para dividir uma conta ou um jogo; quando um texto simples basta, ChatGPT limita-se a isso. Para tal, a OpenAI apoia-se numa biblioteca de componentes nativos e num compilador que apresenta a interface à medida que é gerada. Intelligent UI funciona desde o nível de esforço Instant até Extra High, sem quota separada, mas nem com o nível de esforço Pro, atribuído a GPT-6 Pro (alimentado por GPT-6 Astra), nem nas antigas aplicações de desktop para macOS e Windows.
Segunda alteração: ChatGPT pode começar a responder enquanto raciocina ou utiliza ferramentas, e depois completar a resposta sem um novo prompt. Segundo avaliações internas da OpenAI, GPT-6 Instant começa a responder, em média, 44 % mais cedo do que GPT-5.6 Instant nas perguntas que exigem uma pesquisa na web, e GPT-6 Extra High começa no mesmo prazo que GPT-5.6 Medium, com uma pontuação global superior à de GPT-5.6 Extra High.
| Plano ou definição do nível de esforço | Modelo utilizado no ChatGPT | Calendário e detalhes |
|---|---|---|
| Plus, Pro, Business e Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Disponibilização mundial a partir de 7 de outubro |
| Free e Go | GPT-6 Luna | A partir de 8 de outubro |
| Nível de esforço Pro (Pro de 100 e 200 dólares, Business, Enterprise) | GPT-6 Pro, alimentado por GPT-6 Astra | Sem Intelligent UI |
| ChatGPT Work e Codex | Versões de setembro de GPT-6 Sol e GPT-6 Luna | Sem alterações |
Quanto à segurança, a ficha do sistema publicada no mesmo dia classifica estas versões no nível de capacidade «High» em cibersegurança, bem como em biologia e química, ao abrigo do Preparedness Framework, sem atingir esse limiar em autoaperfeiçoamento; mantêm as salvaguardas de GPT-5.6, com maior resistência às tentativas de contornar as proteções (jailbreaks), incluindo ao longo de várias interações. Na API, o snapshot chat-latest aponta agora para este novo modelo do ChatGPT, e a OpenAI recomenda a família GPT-6 para produção.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇵🇹 GPT-6 e Intelligent UI estão agora a ser disponibilizados no ChatGPT para todos. No ChatGPT, Intelligent UI fornece respostas rápidas e interativas que tornam as questões do dia a dia mais visuais e os temas complexos mais fáceis de compreender, e disponibiliza de imediato ferramentas interativas adequadas à sua tarefa. — @OpenAI no X
🔗 GPT-6 e Intelligent UI para todos · Ficha do sistema, atualização de outubro · GPT-6 e outros modelos no ChatGPT
Os ficheiros de áudio no ChatGPT
6 de outubro — ChatGPT aceita agora ficheiros de áudio como anexos. Pode anexar-se uma gravação a uma conversa para obter uma transcrição, um resumo ou respostas sobre o seu conteúdo, ou para transformar uma reunião, uma entrevista ou uma aula em notas estruturadas, ou até num rascunho de e-mail de acompanhamento. A função está reservada às subscrições e aos espaços de trabalho pagos, incluindo Enterprise: o plano Free não tem acesso «por enquanto». Os formatos aceites são WAV, MP3, OGG, FLAC, AAC, M4A e PCM, bem como WebM e MP4 se contiverem apenas áudio, até 512 Mo por ficheiro. A OpenAI avisa que as transcrições podem conter erros, que a identificação dos intervenientes continua a ser pouco fiável e que o desempenho varia consoante os idiomas.
🔗 Notas de versão do ChatGPT · Carregar ficheiros e áudio para o ChatGPT
ChatGPT for Teens: primeiros números de utilização e College Planner a caminho
7 de outubro — A OpenAI faz um primeiro balanço de ChatGPT for Teens, a experiência aplicada por predefinição às contas identificadas como pertencentes a menores de 18 anos. Segundo a empresa, cerca de 1,2 milhões de adolescentes utilizaram Learning Visualizations numa semana e mais de 180 000 utilizaram Study Mode; passam aí, em média, menos de 15 minutos por dia, e menos de 2 % ultrapassam três horas consecutivas. A novidade anunciada, College Planner, chegará «em breve», primeiro aos Estados Unidos para alunos do 10.º ao 12.º ano do ensino secundário que pretendam frequentar um curso universitário de quatro anos: um único plano reunirá requisitos de candidatura, prazos, tarefas e procedimentos de apoio financeiro, incluindo bolsas. A OpenAI apoia também College Advising Corps e, durante três anos, o Digital Wellness Lab do Boston Children’s Hospital, sem divulgar o montante.
🔗 Ajudar os adolescentes a aprender, planear e moldar o futuro da AI
Claude Haiku 5.5, cerca de 75 % mais barato do que Haiku 4.5 segundo a Anthropic
7 de outubro — Quinze dias depois de Opus 5.5 e nove dias depois de Sonnet 5.5, a Anthropic completa a família Claude 5.5 com Claude Haiku 5.5 (claude-haiku-5-5). O modelo destina-se a tarefas de grande volume e sensíveis ao custo (resumos, compactações de contexto, consultas a bases de dados, classificação), ao papel de subagente de Opus 5.5 e Sonnet 5.5 em programação, e a utilizações em que a velocidade conta, como o apoio ao cliente em tempo real ou o controlo de um navegador: é o modelo mais rápido da Anthropic à velocidade padrão, embora os Opus em Fast Mode continuem a ser mais rápidos. É também o primeiro Haiku com uma definição do nível de esforço (medium por predefinição), com um contexto de 1 milhão de tokens e até 128 000 tokens de saída.
O preço segue dois escalões. Até 100 000 tokens de prompt, Haiku 5.5 custa 0,10 dólar por milhão de tokens de entrada e 0,50 dólar de saída, ou seja, 90 % menos do que Haiku 4.5; acima desse limiar, passa para 0,50 e 2,50 dólares, 50 % menos. A poupança de «cerca de 75 %» destacada é uma média calculada pela Anthropic: 90 % dos pedidos enviados a Haiku 4.5 ficavam abaixo do limiar, e a nova divisão em tokens (tokenizer) conta cerca de 30 % mais tokens para o mesmo texto.
| Tipo de preço (por milhão de tokens) | Haiku 5.5 até 100 000 tokens de prompt | Haiku 5.5 acima de 100 000 tokens | Haiku 4.5 |
|---|---|---|---|
| Tokens de entrada | 0,10 dólar | 0,50 dólar | 1 dólar |
| Tokens de saída | 0,50 dólar | 2,50 dólares | 5 dólares |
| Leituras de cache | 0,01 dólar | 0,05 dólar | 0,10 dólar |
| Escritas de cache | 0,125 dólar | 0,625 dólar | 1,25 dólar |
Nos benchmarks publicados pela Anthropic, a diferença em relação a Haiku 4.5 é grande, e Haiku 5.5 supera GPT-6 Luna da OpenAI em todos os casos em que ambos aparecem. Continua, porém, atrás de Sonnet 5.5, que a Anthropic continua a recomendar, juntamente com Opus 5.5, para programação agêntica complexa.
| Benchmark avaliado (números da Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (programação agêntica) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, subconjunto offline | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, sem ferramentas | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (esforço Xhigh) |
| Chartography, sem ferramentas | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Seis clientes partilharam os resultados dos seus testes antecipados: a HubSpot refere 92,8 % no seu conjunto de testes CRM, a sua melhor pontuação até à data, a AlphaSense 0,84 contra 0,76 de Haiku 4.5 em 400 consultas, e a Box mais 11 pontos com cerca de metade da latência. A migração de Haiku 4.5 exige trabalho: o guia enumera onze alterações, incluindo o fim de budget_tokens, dos parâmetros temperature, top_p e top_k e do preenchimento prévio, e o comando /claude-api migrate de Claude Code automatiza parte desse trabalho. Quanto à segurança, a Anthropic descreve salvaguardas de cibersegurança mais restritivas do que as de Haiku 4.5, mas um pouco menos do que as dos seus outros modelos recentes: são permitidas mais tarefas defensivas do que com Sonnet 5.5, mas os testes de intrusão continuam bloqueados.
O lançamento é acompanhado por uma redução de preços: as leituras de cache de Sonnet 5.5 passam de 0,20 para 0,10 dólar por milhão de tokens a partir de 7 de outubro, o que torna o modelo cerca de 20 % mais barato na maioria das tarefas agênticas, segundo a Anthropic. Haiku 5.5 está disponível desde já na API Claude, Amazon Web Services, Google Cloud e Microsoft Azure, bem como em Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇵🇹 Apresentamos Claude Haiku 5.5: o modelo pequeno mais barato, mais rápido e com melhor desempenho que alguma vez lançámos. Em média, a sua execução custa cerca de 75 % menos do que a de Claude Haiku 4.5. — @claudeai no X
🔗 Anúncio de Claude Haiku 5.5 · Guia de migração para Haiku 5.5
Haiku 5.5 no Cursor: 48,4 % no CursorBench
7 de outubro — O Cursor disponibiliza Claude Haiku 5.5 logo no dia do lançamento, podendo ser ativado nas definições de modelos. Segundo o Cursor, custa 10 vezes menos do que Claude Haiku 4.5 nos pedidos curtos. No CursorBench, a classificação que o Cursor publica no seu site, Haiku 5.5 com nível de esforço Max ocupa o 10.º lugar com 48,4 % de sucesso por 1,12 dólar por tarefa, imediatamente à frente de Sonnet 5.5 com nível de esforço High, cujos custos o Cursor recalculou a 7 de outubro para ter em conta o novo preço, e à frente de Opus 5 com nível de esforço Max. No entanto, trabalha mais: 325 934 tokens e 163 etapas por tarefa, em média, contra 37 391 tokens e 41 etapas de Sonnet 5.5 com nível de esforço High.
| Configuração testada pelo Cursor | Posição na classificação | Pontuação CursorBench | Custo por tarefa |
|---|---|---|---|
| Opus 5.5, esforço Max | 1 | 57,8 % | 13,43 dólares |
| Haiku 5.5, esforço Max | 10 | 48,4 % | 1,12 dólar |
| Sonnet 5.5, esforço High | 11 | 47,8 % | 1,20 dólar |
| Opus 5, esforço Max | 13 | 46,6 % | 11,95 dólares |
| Haiku 5.5, esforço Low | 54 | 30,9 % | 0,08 dólar |
🔗 Anúncio do Cursor no X · Classificação CursorBench
Um crédito API mensal de 100 a 500 dólares para os planos Max e Team
7 de outubro — Anunciado na mesma publicação que o Haiku 5.5, um crédito mensal utilizável na Claude Platform chega aos subscritores Max e Team, com uma disponibilização faseada ao longo de alguns dias. Serve para criar as suas próprias ferramentas, aplicações e agentes com a API; segundo @ClaudeDevs, funciona com todos os modelos, incluindo o Haiku 5.5, tanto no seu próprio código como em ferramentas de terceiros.
| Plano abrangido | Crédito API mensal |
|---|---|
| Max 5x | 100 dólares |
| Max 20x | 200 dólares |
| Team, licença Standard | 20 dólares por licença |
| Team, licença Premium | 100 dólares por licença |
| Limite de uma equipa Team | 500 dólares, partilhados |
| Free, Pro e Enterprise | Não elegíveis |
No Team, os créditos das licenças somam-se numa reserva comum: três licenças Standard e duas Premium dão, por exemplo, 260 dólares por mês. O crédito abrange todos os modelos da API Claude, incluindo a API Message Batches, assim como o Playground da Console, Claude Managed Agents e o Claude Agent SDK. Não abrange o Claude Code em utilização interativa (terminal, IDE, aplicação de computador ou web), nem a utilização adicional para além dos limites do plano, nem os modelos Claude disponibilizados através de Amazon Bedrock, Google Cloud Vertex AI ou Microsoft Foundry, e não altera os limites de utilização de Claude, Claude Code ou Cowork.
Para o obter, é necessário ter uma subscrição ativa há pelo menos sete dias num plano elegível e, depois, associar uma organização da Claude Console nas definições de faturação de claude.ai, sem adicionar um método de pagamento. Só pode ser associada uma organização, e apenas o suporte pode alterá-la. O crédito renova-se a cada ciclo de faturação, não acumula para o ciclo seguinte e é utilizado antes dos créditos comprados; quando se esgota, as chamadas param até à atribuição do crédito seguinte, exceto se a organização tiver comprado créditos ou ativado o carregamento automático, e nada é cobrado na subscrição Claude. Em maio, a Anthropic tinha anunciado um crédito mensal para utilização programática a partir de 15 de junho; a página de ajuda esclarece que o novo crédito não corresponde a esses «créditos Agent SDK», que indica estarem indisponíveis.
🔗 Página de ajuda: créditos API mensais dos planos Max e Team · Anúncio de @ClaudeDevs
IA local no Windows: NVIDIA abre as pré-encomendas dos PCs RTX Spark e apresenta uma antevisão da DGX Station for Windows
7 de outubro — NVIDIA e Microsoft aproveitam o evento Windows AI and Surface, organizado em São Francisco com uma conversa entre Jensen Huang e Satya Nadella, para lançar comercialmente o RTX Spark, o chip para PCs Windows anunciado na Build a 2 de junho. As pré-encomendas dos computadores portáteis estão abertas desde 7 de outubro, com disponibilidade a 16 de outubro; os mini-PCs chegarão em novembro. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI e Gigabyte estão a preparar máquinas, e a Microsoft apresenta um Surface Laptop Ultra desenvolvido em torno do chip. A publicação da NVIDIA não indica qualquer preço.
O RTX Spark combina um GPU Blackwell RTX e um CPU Grace ligados a 600 Go/s, para um petaflop de cálculo de IA em FP4 e até 128 Go de memória unificada. A NVIDIA destaca a execução local de modelos de grande dimensão, sem envio de dados para a cloud nem contador de utilização, com a mesma stack CUDA que usa nos seus servidores. O chip destina-se também aos criadores (NVFP4, codificação AV1 e 4:2:2 por hardware) e aos jogadores, com jogos a 1440p acima de 100 imagens por segundo graças ao DLSS 5.
Para as empresas, a NVIDIA apresenta uma antevisão da DGX Station for Windows, também anunciada na Build em junho, que descreve como o primeiro supercomputador de IA de secretária do ecossistema Windows: permite executar localmente modelos da ordem de um bilião de parâmetros sem sair do Windows, mantendo as ferramentas Linux acessíveis através do WSL. Não há data nem preço, apenas uma inscrição para receber uma notificação. Por sua vez, a Microsoft passa Microsoft Execution Containers (MXC) para disponibilidade geral, a infraestrutura que executa os agentes em segundo plano sob o controlo do Windows.
| Elemento comparado | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | GPU Blackwell RTX (até 6 144 núcleos) e CPU Grace (até 20 núcleos) | Superchip GB300 Grace Blackwell Ultra Desktop |
| Memória | Até 128 Go, unificada | 748 Go, coerente |
| Cálculo de IA em FP4 | 1 petaflop | Até 20 petaflops |
| Disponibilidade anunciada | Portáteis em pré-encomenda, disponíveis a 16 de outubro; mini-PCs em novembro | Antevisão, sem data nem preço |
🔗 Publicação da NVIDIA sobre o evento Windows
Desenvolver localmente no Windows: Copilot encaminhará para MAI Code 1.1 Flash, o seu sandbox passa para disponibilidade geral, Replit prepara uma aplicação de computador
7 de outubro — O GitHub Copilot poderá em breve escolher sozinho entre um modelo que é executado na máquina do programador e um modelo na cloud. Segundo a publicação da Microsoft e do GitHub no blog Microsoft Command Line, este encaminhamento chega «até ao final do mês»: ainda não está disponível. O GitHub apresenta-o como a próxima etapa do Project HydraFusion, o seu orquestrador que já distribui tarefas por vários modelos, e destaca uma poupança de créditos de IA, sem a quantificar.
Estão previstos dois modos de utilização no Copilot CLI, na aplicação GitHub Copilot e no VS Code. O modo Auto escolherá, a cada interação, entre inferência local e na cloud, de acordo com o contexto da tarefa e o estado da cache; o programador também poderá selecionar diretamente um modelo local, MAI Code 1.1 Flash através do fornecedor Windows ML ou qualquer modelo exposto por um ponto de acesso local (endpoint) compatível com a API da OpenAI. A publicação relembra: a inferência local não torna a sessão offline.
A demonstração é executada num Surface Laptop Ultra equipado com RTX Spark. A Microsoft AI executa nele uma versão local de MAI Code 1.1 Flash, uma mistura de especialistas (mixture-of-experts) especializada em código, com 137 mil milhões de parâmetros, dos quais 6,8 mil milhões ativos. Quantizado a cerca de 3,3 bits por peso, ocupa 53 Go, 80 % menos do que a variante na cloud, com um pico de memória de 75,5 Go para 256 000 tokens de contexto.
| Benchmark avaliado (testes da Microsoft de 5 de outubro) | MAI Code 1.1 Flash | Versão quantizada no dispositivo | GPT OSS 120B (versão GGUF da Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 tarefas) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 tarefas) | 62,9 % | 66,29 % | 23,6 % |
A Microsoft esclarece que estes testes foram executados num ambiente de execução llama.cpp para Windows ARM64 e que os resultados variam consoante o dispositivo e a configuração. Um primeiro componente já está disponível no terminal: desde a versão de pré-visualização 1.0.94-0 do Copilot CLI, o comando /model descobre os modelos de uma instância local do Ollama. Nada é adicionado sem confirmação, o Ollama e o modelo já têm de estar instalados, e só são apresentados modelos que suportam chamadas de ferramentas e fluxo contínuo (streaming).
🔗 Trazer modelos locais e ferramentas em sandbox para o Windows e o GitHub Copilot · Descobrir modelos locais no GitHub Copilot CLI
O sandbox local do Copilot em disponibilidade geral
7 de outubro — O sandbox local do GitHub Copilot sai da versão de pré-visualização pública aberta a 2 de junho: passa para disponibilidade geral no Copilot CLI, na aplicação GitHub Copilot e nas sessões do VS Code que passam pelo Agent Host, sem custo adicional. As ferramentas e os comandos lançados pelo Copilot são então executados com acesso restrito aos ficheiros, à rede, às credenciais do Git e do GitHub CLI e a outras capacidades do sistema, de acordo com políticas definidas pelo programador ou pela sua organização; uma empresa pode impor definições que os programadores não podem flexibilizar, independentemente do modelo utilizado. O motor, Microsoft eXecution Container (MXC), é uma biblioteca open source da equipa Windows que se apoia no ProcessContainer no Windows, no Seatbelt no macOS e no bubblewrap no Linux, sem máquina virtual. As suas limitações estão documentadas: as ferramentas de ficheiros integradas são controladas pelo próprio Copilot e não pelo sistema, e os servidores MCP remotos ficam fora do sandbox local.
🔗 O sandbox local do GitHub Copilot já está em disponibilidade geral
Replit cria aplicações localmente no Windows
7 de outubro — A Replit anuncia, com a Microsoft, a versão de pré-visualização de uma aplicação de computador que cria e executa as aplicações diretamente no computador do utilizador, no Windows. A Replit já disponibilizava uma aplicação de computador: a novidade está nesta criação local, em que cada build é executado no seu próprio sandbox, baseado em Microsoft Execution Containers e no OpenShell, o ambiente de execução open source da NVIDIA. O acesso antecipado passa por uma lista de espera, sem data nem preço, e não é mencionada qualquer versão para macOS. A Replit apresentou esta versão de pré-visualização em palco durante o evento Windows de 7 de outubro.
🔗 Anúncio da Replit no X · Lista de espera da versão de pré-visualização
OpenAI publica 722 manuscritos de resultados matemáticos produzidos por um modelo interno
6 de outubro — A OpenAI publica de uma só vez um vasto conjunto de resultados matemáticos produzidos por um modelo interno de ponta, que não está disponível publicamente. Anunciado na noite de 6 de outubro, o repositório GitHub openai/math reúne 722 manuscritos agrupados em 372 famílias classificadas por disciplina: um resultado principal pode ser acompanhado de argumentos complementares, consequências ou provas alternativas.
A grande maioria dos resultados provém do mesmo procedimento: cerca de 4 000 problemas apresentados ao modelo, com uma média equivalente a três horas de reflexão do ChatGPT Pro por resultado. A OpenAI explica que alargou as suas avaliações a problemas de investigação em aberto depois de ter saturado as suas avaliações matemáticas existentes. Dois trabalhos são exceções a este procedimento: uma região sem zeros da função zeta de Riemann, cuja redação foi revista por uma pessoa para melhorar a legibilidade, e a prova de um caso particular da conjetura de Hodge, o das variedades abelianas CM.
| Indicador publicado pela OpenAI | Valor anunciado |
|---|---|
| Manuscritos publicados | 722 |
| Famílias de resultados | 372 |
| Problemas apresentados ao modelo | Cerca de 4 000 |
| Cálculo médio por resultado | Cerca de três horas de reflexão do ChatGPT Pro |
| Resumos de raciocínio publicados | 10 |
Nem todos os resultados são verificados da mesma forma. Muitas demonstrações estão formalizadas em Lean, uma linguagem que permite verificar uma prova por computador, mas não todas: a OpenAI avisa que «alguns resultados não formalizados poderão conter erros», promete corrigi-los rapidamente e acrescentará novas formalizações à medida que ficarem disponíveis. Os dez resumos do raciocínio do modelo abordam temas como o expoente de irracionalidade de π, as conjeturas de Mahler, a conjetura de finitude direta de Kaplansky em característica dois ou o isomorfismo dos fatores de grupos livres.
A própria publicação foi preparada com o grupo consultivo independente sobre matemática e IA do Institute for Advanced Study: protocolos de revisão e de citação, correções publicadas como novas versões, histórico preservado. A OpenAI anuncia também o financiamento de workshops, conferências e programas dedicados a estes resultados, e afirma estar a trabalhar num acesso «responsável» dos cientistas ao modelo que os produziu, sem calendário.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇵🇹 Publicamos um vasto conjunto de novos resultados matemáticos produzidos por um modelo interno de ponta. Consultámos o grupo consultivo independente sobre matemática e inteligência artificial do Institute for Advanced Study e baseámo-nos nos seus conselhos e recomendações públicas para decidir como publicar estes resultados. — @OpenAI no X
🔗 Partilhar os progressos da IA na matemática · Repositório openai/math no GitHub
Perplexity publica pplx-embed-v2-late, embeddings multivetoriais para texto e imagens
7 de outubro — A Perplexity Research publica pplx-embed-v2-late, dois modelos de embeddings de interação tardia (late interaction) com 0.6B e 9B parâmetros, disponíveis no Hugging Face sob licença MIT. Enquanto um embedding denso comprime cada documento num único vetor, estes modelos do tipo ColBERT conservam um vetor de 128 dimensões por token e pontuam cada par consulta-documento através de MaxSim: cada token da consulta é associado ao token mais próximo do documento. Pesquisam em texto, imagens e páginas renderizadas (PDF, diapositivos, digitalizações) sem recorrer a OCR, o que preserva tabelas, figuras e a disposição da página.
Os dois tamanhos partilham o mesmo espaço de embeddings, porque são destilados token a token a partir de um modelo professor interno de 18B, derivado de uma base de 27B. Um corpus indexado com o 9B pode, assim, ser consultado com consultas codificadas pelo 0.6B: no ViDoRe v3 com imagens, esta configuração atinge 63,5 %, contra 62,3 % com o 0.6B em ambos os lados, sem custo adicional por consulta. O 0.6B, podado a partir de Qwen3.5-0.8B, serve assim como codificador leve de consultas, inclusive no próprio dispositivo.
| Benchmark avaliado (medições da Perplexity) | Pontuação do 9B | Pontuação do 0.6B | Ponto de comparação |
|---|---|---|---|
| 72 tarefas especializadas (nDCG@10) | 81,3 % | 78,0 % | O 9B supera o modelo seguinte em 1,6 pontos |
| Q2D-Web, pesquisa web (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 com imagens (nDCG@10) | 65,2 % | 62,3 % | Apenas EVIE supera o 9B |
| BrowseComp+ (agente GPT-OSS-120B) | 64,0 % | — | Melhor ColBERT seguinte: menos 4,9 pontos |
| MADQA (agente Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
O 9B não ganha em todos os casos, e a Perplexity reconhece-o: EVIE, da Tencent, supera-o no ViDoRe v3 com imagens, gemini-embedding-2 no MIRACL-Vision e no benchmark interno PPLX-Q2I, e Mixedbread Agentic Search obtém uma pontuação melhor no MADQA, uma diferença que a Perplexity considera estar dentro do seu intervalo de confiança. A empresa reconhece também que o armazenamento e o custo de pontuação aumentam com o comprimento dos documentos. Está anunciado um relatório técnico para «mais tarde este ano», e a Perplexity prevê disponibilizar progressivamente os seus embeddings de interação tardia, densos e contextuais na sua plataforma API, sem data definida.
🔗 Artigo da Perplexity Research · pplx-embed-v2-late-9b no Hugging Face
Agentes de código: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor no iOS, Antigravity 2.21.0 e Warp Factories
Cinco ferramentas de agentes de código evoluem: Claude Code adota Haiku 5.5, Codex CLI liga-se a servidores MCP a partir do terminal, Cursor pode ser controlado a partir de um iPhone, Antigravity agrupa as ações do seu agente e Warp passa a integrar as ferramentas da Microsoft.
Claude Code 2.1.293 passa a usar Haiku 5.5 por predefinição
7 de outubro — Publicada poucos minutos depois do anúncio de Haiku 5.5, a versão 2.1.293 de Claude Code torna-o o modelo Haiku predefinido na API Anthropic. Acrescenta um campo agentType ao payload de subagentStatusLine, para distinguir os subagentes personalizados, e uma opção isDeferred que expõe desde o início o esquema das ferramentas declaradas por mods. O essencial são 38 correções em 56 entradas: após uma compactação, Claude podia situar as suas últimas ações anteriores à compactação como tendo ocorrido depois dela e, em seguida, desfazer ou repetir trabalho concluído; as regras limitadas a um caminho e os CLAUDE.md aninhados também são carregados quando Claude lê um ficheiro com cat ou grep em Bash; uma fuga de memória das ligações MCP HTTP é eliminada. Duas alterações recentes são revertidas (a mensagem de recusa do modo automático da 2.1.281, uma correção das sessões cloud da 2.1.290), e o limite de regras de canal de Claude Tag passa de 20 para 50.
🔗 Claude Code 2.1.293 no GitHub
Codex CLI 0.161.0 coloca Daybreak atrás de uma opção
7 de outubro — Codex CLI 0.161.0 é a primeira versão estável desde a 0.160.1 de 5 de outubro. O comando /mcp login <name> permite ligar-se a um servidor MCP sem sair da sessão de terminal em curso, e as conversas por voz passam a permitir escolher o microfone, o altifalante e os canais de entrada. Daybreak, a gama de cibersegurança da OpenAI, passa a depender de uma opção: o controlo /daybreak e o estado de Daybreak na linha de estado permanecem ocultos até o utilizador o ativar com --enable cli_daybreak (ou features.cli_daybreak=true), e sem essa opção o encaminhamento Cyber automático é omitido. Para uma única interação, codex exec --cyber-access-program escolhe um programa de acesso Cyber. No Amazon Bedrock, o multi-agent V2 e o esforço de raciocínio Ultra chegam aos modelos compatíveis, e Bedrock Mantle aceita as regiões AWS GovCloud. As correções abrangem as permissões, a retoma de conversas e a deteção de uma base de dados SQLite corrompida.
Cursor controla a partir do iOS os agentes do computador
6 de outubro — A aplicação iOS de Cursor mostra agora os agentes que estão a executar localmente no computador: é possível ver o que cada um faz e responder-lhe, e o tweet de anúncio também menciona o lançamento de novas tarefas. Os agentes permanecem na máquina, e a aplicação liga-se a ela: o computador tem, por isso, de continuar ligado e online, e uma definição Keep this computer awake impede que entre em suspensão, com a máquina ligada à corrente e o ecrã aberto. A função está ativada por predefinição, exceto nas organizações Enterprise, onde um administrador tem de a ativar; o emparelhamento é validado na aplicação de computador, e os agentes cloud não são necessários. A aplicação iOS lançada no final de junho destacava os agentes cloud: agora são os agentes locais que passam a estar acessíveis a partir do telemóvel.
Antigravity 2.21.0 agrupa as ações do seu agente
6 de outubro — A aplicação Antigravity da Google passa para a versão 2.21.0, com 9 melhorias e 14 correções. A pesquisa avançada encontra uma conversa através do seu conteúdo, com ⌘+K (Ctrl+K no Windows). O separador das tarefas agendadas (Scheduled Tasks) passa a chamar-se Automations: permite executar uma automatização de imediato com Run Now, ou pedir ao agente que oriente a criação de uma nova com Create with Prompt. As alterações de ficheiros, os comandos de terminal e as leituras que o agente realiza entre duas respostas são agora agrupados numa única linha recolhível, acompanhada de um breve resumo. Entre os problemas corrigidos, um vídeo MP4 ou MOV truncado lido pelo agente podia fazer falhar todo o resto da conversa, e um ficheiro de definições guardado com o Bloco de Notas do Windows ou PowerShell deixava de funcionar. O changelog avisa que uma versão pode demorar alguns dias a chegar a todos os utilizadores.
Warp Factories passa a integrar Microsoft Teams e Azure DevOps
7 de outubro — A Warp abre Warp Factories, a sua plataforma de fábricas de software (software factories), ao Microsoft Teams e ao Azure DevOps Services. No Teams, mencionar a aplicação Warp num canal ou numa conversa configurados atribui a tarefa à fábrica com o contexto da conversa; esta comunica o seu progresso na mesma conversa e envia para lá as suas pull requests para revisão. No Azure DevOps, menciona-se a fábrica a partir de um item de trabalho (work item) ou de uma pull request, ou desencadeiam-se execuções em resposta aos respetivos eventos; cada fábrica recebe a sua própria identidade para as operações Git, com acesso limitado aos repositórios escolhidos. As duas integrações estão disponíveis para todos os clientes de Warp Factories. A Warp apresenta este duplo suporte nativo como uma estreia na indústria; Devin já se integrava com Teams e Azure DevOps Server.
API e plataformas: os toolsets computer use e browser use dos SDK Claude, Grok 4.7 no Microsoft Foundry
Dois anúncios para os programadores que desenvolvem sobre modelos alojados: a Anthropic simplifica o controlo de um computador ou de um navegador, e Grok 4.7 chega à disponibilidade geral na Microsoft.
Os toolsets computer use e browser use dos SDK Claude
7 de outubro — Os SDK Python e TypeScript de Claude integram, em beta, os conjuntos de ferramentas (toolsets) computer use e browser use. Até agora, a API indicava onde Claude queria clicar ou o que queria escrever, e era necessário escrever o próprio ciclo para traduzir cada ação num comando. O SDK passa agora a tratar desse ciclo: o programador cria uma subclasse de BetaAbstractBrowserToolset20260801 ou BetaAbstractComputerToolset20260801, escreve um método por ação, e o SDK encaminha as chamadas, aplica as políticas de URL e de ficheiros fornecidas, solicita as aprovações e constrói os resultados devolvidos ao modelo. A Anthropic não fornece um navegador nem um controlador pronto a usar: liga-se a própria automatização ou um controlador de Browser Use, Browserbase, E2B ou Daytona, e é publicado um exemplo mínimo em Chrome DevTools Protocol no repositório claude-quickstarts. A execução de JavaScript e o envio de ficheiros estão desativados por predefinição e, sem uma política de URL, nenhum endereço é verificado.
🔗 Conversa de @ClaudeDevs no X · Documentação dos toolsets do SDK
Grok 4.7 em disponibilidade geral no Microsoft Foundry
7 de outubro — Grok 4.7, o modelo da SpaceXAI lançado a 21 de setembro, está disponível no Microsoft Foundry, anunciou @SpaceXAI durante a noite. A documentação da Microsoft classifica-o como estando em disponibilidade geral, entre os modelos vendidos diretamente pelo Azure: texto e imagem como entrada, contexto de 500 000 tokens (entrada e saída combinadas), chamadas de ferramentas, acesso por Chat Completions ou pela Responses API, e esforço de raciocínio de low a xhigh, com high por predefinição. A Microsoft compromete-se a disponibilizar os modelos Grok em disponibilidade geral, a partir de Grok 4.7, durante pelo menos seis meses; Grok 4.6 continua a constar como versão de antevisão. A página de preços do Azure ainda não incluía Grok 4.7 na noite de 7 de outubro. Depois do Amazon Bedrock (28 de setembro) e do Google Cloud em versão de antevisão (1 de outubro), Grok 4.7 passa assim a estar disponível nos três grandes fornecedores de cloud.
🔗 Implementar e utilizar modelos Grok no Microsoft Foundry
Modelos abertos: Open d1 da Liquid AI, Bolmo da Ai2 na Nature com Bwen 8B e Blama 8B
Duas publicações com pesos abertos, uma para decidir rapidamente na periferia da rede, outra para ler texto byte a byte.
Open d1, os modelos de decisão abertos da Liquid AI
7 de outubro — A Liquid AI abre a sua família de modelos de decisão com Open d1: dois modelos com pesos abertos, d1-3B (texto e imagem) e d1-omni-600M (texto com imagem ou áudio), este último numa versão inicial de investigação. Não geram texto: atribuem, numa única passagem, uma probabilidade a cada resposta permitida. Segundo a Liquid AI, d1-3B obtém 48,57 no Decision Index 0.2.1, a melhor pontuação abaixo de 10 mil milhões de parâmetros, à frente de Decider 35B-A3B (47,11), e uma média de 82,9 em sete conjuntos de dados públicos. Medida com a NVIDIA, a sua latência para uma pergunta vai de 8 ms numa RTX 4090 a 50 ms num Jetson Orin Nano, o que permite visar a periferia da rede (edge). Não é publicado qualquer benchmark de visão ou de áudio. Os pesos estão no Hugging Face sob a licença própria da Liquid AI (lfm1.0), com versões GGUF; o d1 de 29 de setembro só estava acessível por API.
🔗 Artigo da Liquid AI no Hugging Face
Bolmo da Ai2 na Nature, com Bwen 8B e Blama 8B
7 de outubro — A Ai2 publica na Nature, online a 7 de outubro, o método por trás de Bolmo, a sua família de modelos inteiramente abertos que leem diretamente os bytes em vez de subpalavras. Ler os bytes evita os pontos cegos de um vocabulário fixo (ortografia, sequências invulgares, certos sistemas de escrita), mas exigia até agora um treino completo de raiz. A conversão em bytes (byteifying) parte, pelo contrário, de um modelo de subpalavras já eficaz e transforma-o através de um breve treino adicional. Bolmo 1B e 7B, derivados de Olmo, datam de dezembro; a Ai2 apresenta também Bwen 8B (derivado de Qwen 3 8B, licença Apache-2.0) e Blama 8B (derivado de Llama 3 8B, licença llama3), cujos repositórios existem desde 26 de agosto, bem como checkpoints «Stage 1», nos quais apenas a nova camada de bytes é treinada. Segundo a Ai2, os dois modelos aproximam-se dos seus modelos de origem e Bwen 8B supera Bolmo 7B, sem números publicados.
SynthID Detector aberto a todos para verificar imagens, vídeos e sons
7 de outubro — A Google abre a todos SynthID Detector, a ferramenta que identifica as marcas de água invisíveis SynthID em conteúdos gerados por IA. Apresentado no ano passado numa versão preliminar destinada a profissionais dos meios de comunicação, está acessível em synthid.com, em todo o mundo e em inglês. Permite carregar uma imagem, um vídeo ou um ficheiro de áudio. A verificação abrange conteúdos da Google e dos seus parceiros OpenAI, NVIDIA e Kakao, e em breve da Apple. O portal avisa que não é um detetor de IA de uso geral: um conteúdo proveniente de um modelo sem SynthID, ou muito alterado, pode obter o resultado «não detetado». A Google afirma ter aplicado marcas de água a mais de 180 mil milhões de imagens e vídeos e a 240 000 anos de áudio desde 2023, face aos 100 mil milhões e 60 000 anos anunciados em julho, e realizar mais de um milhão de verificações por dia no Search, na aplicação Gemini e no Chrome.
🔗 Google alarga SynthID Detector para conteúdos de IA
Segurança: o classificador do GitHub para segredos expostos
7 de outubro — O GitHub coloca em serviço um classificador ModernBERT ajustado, dedicado a segredos expostos e desenvolvido com a Microsoft Applied Sciences: lê o código em torno de um valor para identificar prováveis credenciais, incluindo palavras-passe sem formato reconhecível. Avalia um lote de candidatos em menos de 2 ms e poderia, segundo o GitHub, «mais do que duplicar» os segredos bloqueados durante o push. A partir de agora, os alertas de palavras-passe detetadas por IA passam a usar este modelo, sem custo adicional. A proteção de pushes por IA, em versão de antevisão privada, deverá chegar «mais tarde este mês» às organizações elegíveis, e as verificações do comando /security-review de Copilot entrarão «em breve» em versão de antevisão privada, ambas mediante créditos de IA. O ensaio de Erin Havens, responsável de produto de segurança no GitHub, recorda que uma em cada três pull requests envolve um agente de IA e que a proteção de pushes só bloqueia cerca de 30 % dos novos segredos detetados.
🔗 A proteção de segredos tem de acompanhar a escala do software
Infraestrutura: o GitHub reconstrói o Git para a atividade dos agentes
6 de outubro — O GitHub está a reconstruir a sua infraestrutura Git para acompanhar o ritmo do desenvolvimento agêntico. Segundo o artigo de engenharia de Brian Celenza, a atividade Git total passou de 218,2 para 473,3 mil milhões de eventos por mês entre setembro de 2025 e agosto de 2026; programadores e agentes produziram 7,38 mil milhões de commits em setembro de 2026, mais de cinco vezes mais do que um ano antes, e os pushes foram multiplicados por 4,9. A arquitetura atual, Spokes, replica cada repositório em vários servidores e valida cada atualização por votação maioritária: adicionar cópias para as leituras torna, portanto, as escritas mais lentas. A nova arquitetura separa armazenamento e computação, com os dados de referência no Azure Blob Storage e processos leves (workers) que servem as leituras a partir de uma cache. Nos seus benchmarks internos, o GitHub mede até 35 vezes mais capacidade de escrita, sem indicar uma data para a transição.
🔗 Construir infraestrutura Git para desenvolvimento à escala dos agentes
IA de voz: a ElevenLabs assina um memorando de entendimento com um estado indiano
7 de outubro — Por ocasião do seu Summit em Bengaluru, a ElevenLabs assinou o seu primeiro memorando de entendimento (MOU) com o governo de um estado indiano, para um projeto-piloto de IA de voz. A empresa não identifica o estado nem apresenta calendário, âmbito ou montante: o anúncio resume-se a um tweet, sem artigo no blog. O número que o acompanha esclarece o que está em jogo: no último ano, o ElevenAgents conduziu mais de 100 milhões de conversas na Índia, das quais mais de 70 % em hindi, canarês, tâmil e telugu. O Summit reuniu mais de 500 dirigentes empresariais, programadores e parceiros.
Investigação: PivotOPD, o método da NVIDIA para recuperar do erro decisivo de um agente
7 de outubro — Os investigadores da NVIDIA apresentam PivotOPD, um método de treino para agentes que encadeiam vários turnos de ação. A sua constatação: no ALFWorld, 59 % dos fracassos de três modelos Qwen3 contêm um «erro pivô», cometido cedo, após o qual o agente continua na direção errada. PivotOPD alarga a destilação on-policy (on-policy distillation): a cada erro pivô, um modelo professor indica a ação correta e, depois, uma ação de recuperação para os turnos seguintes, de modo que o aluno aprende a evitar o erro e a recuperar dele. Em comparação com 13 métodos de referência, obtém a melhor média no ALFWorld, WebShop e Search-based QA com alunos Qwen3 de 1.7B e 8B, e recupera de 72,7 % dos 72 erros pivô reproduzidos, contra 20,3 % para a destilação padrão. O ganho transfere-se para o código: um aluno Nemotron-3.5 passa de 62,8 % para 66,0 % no SWE-Bench Verified. O artigo está no arXiv; o código está anunciado para breve.
Otimização: mPDLP distribui programas lineares gigantes por várias GPU no cuOpt
7 de outubro — A NVIDIA adiciona ao cuOpt, a sua biblioteca open source de otimização, mPDLP, um solver de programação linear distribuído por várias GPU ligadas por NVLink, para grandes problemas de planeamento (cadeias logísticas, redes elétricas). Ao agrupar na mesma GPU as variáveis e restrições interdependentes, limita as trocas e reduz até 6 vezes o pico de utilização de memória por GPU. Num nó DGX B200, a aceleração atinge 11,4 vezes no cálculo PDLP e 4,2 vezes de ponta a ponta; em comparação com D-PDLP, mPDLP é 1,2 a 2,5 vezes mais rápido na maioria dos grandes problemas, mas mais lento nas três maiores instâncias e nos problemas pequenos. A Kinaxis resolve 3,3 vezes mais depressa uma cadeia logística com mais de 135 milhões de variáveis em oito H100, e a PSR resolve mais de 5 vezes mais depressa um modelo energético com 185 milhões de variáveis em oito B200.
🔗 Artigo da NVIDIA sobre mPDLP
Robótica: robôs montam os tabuleiros de teste GB300
7 de outubro — O Seattle Robotics Lab da NVIDIA conta como ensina robôs a montar os tabuleiros de teste dos GB300, que verificam os módulos antes da expedição. Foram escolhidos dois movimentos em conjunto com a Foxconn, que fabrica estes sistemas: colocar e aparafusar um barramento em 16 pontos, e ligar quatro conectores montados em cabos flexíveis. O requisito definido com a Foxconn é uma taxa de sucesso de 99,5 %, demorando, no máximo, o dobro do tempo de um operador qualificado, sem colisões. Os robôs aproximam-se desse objetivo sem o atingir: mais de 95 % de sucesso em 160 segundos para o barramento, contra uma meta de 124, e 90 a 95 % para os conectores, a 40 segundos por cabo. A equipa combina uma cadeia clássica de perceção e controlo, a estimativa de pose DOPER e aprendizagem por reforço no Isaac Lab, ajustada no robô real. A NVIDIA promete publicar DOPER e o seu orquestrador TALOS, sem indicar uma data.
🔗 Artigo do blog técnico da NVIDIA sobre os tabuleiros GB300
Breves
- A aplicação iOS do ChatGPT 1.2026.272 — Apresenta pré-visualizações de páginas diretamente nas respostas, abre os links de tarefas Codex na aplicação e, no Codex Mobile, reformula o seletor de aprovação e torna mais fluida a navegação em conversas longas. 🔗 fonte
- Radisson Hotel Group — Segundo um estudo de caso da OpenAI, o seu plugin ChatGPT, construído em seis semanas com a Accenture Song, converte cerca de 1,5 vezes melhor do que a sua pesquisa orgânica em julho-agosto de 2026, e 54 % dos eventos de pagamento e reserva da sua campanha publicitária no ChatGPT são atribuídos a simples visualizações de anúncios. 🔗 fonte
- Jump Trading — A empresa de trading quantitativo confia a agentes GPT-6 Astra análises que podem decorrer durante vários dias, cruzando numerosas fontes de dados, com uma revisão humana no final do processo; o estudo de caso da OpenAI não publica qualquer número sobre os ganhos. 🔗 fonte
- Extensões de plugins ChatGPT — Na sequência de publicações do seu tutorial em vídeo, a OpenAI Developers cita Adobe, Canva, Figma, Shopify, Instacart e Atlassian entre as empresas que as utilizam, além de tldraw e MagicPath; apresentadas a 29 de setembro, permitem iniciar um plugin a partir da barra lateral, gerir menções @ e adicionar visualizadores de ficheiros. 🔗 fonte
- Every e Claude Managed Agents — A equipa da Every construiu com Claude Managed Agents um agente empresarial que todos utilizam no Slack para partilhar as suas skills a cada novo modelo, e depois disponibilizou-o aos seus subscritores; a Anthropic divulga uma entrevista em vídeo, sem números. 🔗 fonte
- Zed 1.23 e versão preliminar 1.24.1 — A 1.23 passa a estável com a sua pré-visualização de ficheiros JSONL e NDJSON, e a versão preliminar 1.24.1 permite arrastar um separador de terminal para o Agent Panel, aceita modelos Amazon Bedrock personalizados com ferramentas, imagens e raciocínio, cria tags Git e reduz em cerca de 23 % o tamanho do binário Linux. 🔗 fonte
- Puck, o meta-agente da Amp — Passa a aceitar várias conversas separadas: o botão + abre uma, um clique no seu nome permite alternar entre elas, e as que ficam inativas durante três dias são guardadas à parte. 🔗 fonte
- Copilot CLI 1.0.93 — Agora estável, aplica as alterações de configuração dos servidores MCP entre dois turnos, sem reiniciar a sessão, e disponibiliza a todos a sandbox de comandos através de /sandbox e —sandbox; o SDK Copilot 1.0.17 também passa a estável. 🔗 fonte
- As métricas de utilização do Copilot — Contabilizavam menos atividade dos agentes do que a real desde que vários IDE passaram a encaminhar as suas sessões pelo Copilot SDK; a correção exige uma atualização (VS Code 1.139.0 desde já, Visual Studio 18.12 em outubro, JetBrains no final de outubro, Eclipse e Xcode até novembro), e os dados perdidos não serão recuperados. 🔗 fonte
- Gemini CLI v0.65.0-nightly.20261007 — Esta versão nightly inaugura a série 0.65.0 com cinco correções, incluindo duas para evitar perdas de dados: as definições do projeto passam a ser apenas de leitura numa pasta não fiável, onde
gemini mcp addpodia esvaziar.gemini/settings.json, e sair imediatamente de uma sessão retomada já não elimina o seu histórico. 🔗 fonte - Transformers.js 4.3.1 — No dia seguinte ao lançamento do EmbeddingGemma 2, a biblioteca calcula os seus embeddings multimodais (740 milhões de parâmetros, 768 dimensões) diretamente no navegador, com WebGPU ou WASM, ou em Node.js. 🔗 fonte
- RL Environment Explorer — Adithya S K, da Hugging Face, apresenta este Space da FineEnvs para explorar, visualizar e executar os ambientes de aprendizagem por reforço do Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): mais de 12 milhões de entradas de tarefas, provenientes sobretudo de alguns grandes ambientes OpenEnv. 🔗 fonte
- Seb-9B — Stas Veretennikov publica este modelo de decisão local sob licença Apache-2.0 (texto, JSON ou imagem, até 20 opções), que obtém uma média de 0,792 em 17 suites públicas, contra 0,786 para Jev 1.13; o autor realizou todas as medições e esclarece que os seus dados de treino incluíam a parte de treino de um dos benchmarks, sem os respetivos casos de teste. 🔗 fonte
- Nemotron nas olimpíadas de 2026 — A NVIDIA detalha a receita comum (ajuste supervisionado, aprendizagem por reforço, ciclo que gera, verifica e corrige) por trás dos 535,4 em 600 na IOI 2026, numa participação não oficial, e dos 30 em 42 na IMO 2026, com um limiar de 29 para o ouro, e publica o benchmark Nemotron-IMO-Bench com 200 problemas. 🔗 fonte
- Instadocs: AI Gone Wild — A Netflix anuncia para 12 de outubro este documentário que reconstitui o ciberataque sofrido pela Hugging Face em julho, conduzido, segundo a Netflix, por agentes autónomos criados por investigadores da OpenAI. 🔗 fonte
- Runway no diretório de aplicações do ChatGPT — Depois de instalar o plugin e ligar a conta Runway, uma menção @Runway numa conversa solicita-lhe a geração de imagens ou vídeos; a Runway não especifica preços nem custos em créditos. 🔗 fonte
- Face Swap da Luma — A função substitui o rosto de uma personagem num plano existente para permitir iterar sem recomeçar tudo; o anúncio resume-se a dois tweets, sem página de produto, preços ou detalhes sobre o modelo. 🔗 fonte
- DSX Air — A NVIDIA mostra como testar alterações numa fábrica de IA neste gémeo digital: os agentes aplicam a alteração, verificam a configuração, a segurança e o isolamento e, depois, apresentam um relatório, ficando a passagem à produção sujeita a validação humana; um artigo sobre o método, sem números. 🔗 fonte
- cuPhoton — Um tutorial da NVIDIA aplica este conjunto de ferramentas open source à análise de imagens astronómicas em GPU, desde a leitura dos ficheiros FITS até à revisão dos candidatos; os ganhos anunciados, de até 14 900 vezes, referem-se a determinadas operações e não ao processamento de ponta a ponta. 🔗 fonte
- Cosmos e SynthID — Os conteúdos gerados pelos modelos NVIDIA Cosmos em build.nvidia.com contêm a marca de água SynthID e podem agora ser verificados por qualquer pessoa com o detetor disponibilizado pela Google. 🔗 fonte
- O SDK TypeScript da SpaceXAI 0.2.3 — Adiciona um nível de serviço
fast, intercambiável compriority, e o identificadorgrok-imagine-video-1.5-lite, um modelo de vídeo mais leve que não consta das notas de versão: segundo os dados da página dos modelos, não aceita áudio como entrada e custa quatro vezes menos por segundo do quegrok-imagine-video-1.5em 480p. 🔗 fonte - Guia RAG vs. LLM — A Perplexity publica um guia educativo que apresenta RAG e LLM como complementares, distingue três tipos de RAG (ingénuo, modular, avançado) e esclarece quando basta um LLM; nenhuma funcionalidade nem número novo. 🔗 fonte
O que isto significa
Os modelos pequenos estão a tornar-se o produto de massas. A partir de 8 de outubro, é o GPT-6 Luna que responde aos utilizadores gratuitos do ChatGPT, e a Anthropic fixa o preço do Haiku 5.5 em 0,10 dólar por milhão de tokens de entrada para prompts com menos de 100 000 tokens, ao mesmo tempo que reduz para metade o preço das leituras de cache do Sonnet 5.5. Estes modelos absorvem a maior parte do volume: conversas do dia a dia, subagentes, resumos, compactações. A classificação do Cursor recorda, porém, que o preço por token não diz tudo: com esforço Max, o Haiku 5.5 consome quase nove vezes mais tokens por tarefa do que o Sonnet 5.5 com esforço High, com um custo por tarefa apenas ligeiramente inferior (1,12 dólar contra 1,20). Por sua vez, o crédito API mensal dos planos Max e Team incentiva os subscritores a experimentar estes modelos no seu próprio código.
A IA também regressa ao computador do utilizador. Os portáteis RTX Spark chegam a 16 de outubro, o DGX Station for Windows promete até 20 petaflops numa secretária, e o Copilot deverá delegar por iniciativa própria certas tarefas ao MAI Code 1.1 Flash localmente até ao final do mês. O Replit passa a construir as aplicações na máquina do utilizador. Agentes que executam código num computador pessoal levantam uma questão de segurança, e o mesmo componente aparece por todo o lado: Microsoft Execution Containers (MXC), em disponibilidade geral no Windows, isola tanto os comandos do Copilot como os builds do Replit. O GitHub, por seu lado, está a implementar um classificador dedicado a segredos expostos e a reconstruir a sua infraestrutura Git, porque uma em cada três pull requests já envolve um agente e os commits foram multiplicados por mais de cinco num ano.
A resposta também se torna uma interface. Com Intelligent UI, o ChatGPT responde com gráficos, formulários ou uma pequena ferramenta construída a pedido, e começa a responder antes de terminar o raciocínio. Para os programadores, os SDK do Claude passam a suportar o ciclo de computer use e browser use, e o Cursor permite acompanhar a partir de um iPhone os agentes que trabalham no computador e responder-lhes. Nestes três casos, o texto passa a ser apenas uma parte da interação: a IA apresenta, clica e dá conta do que faz, enquanto o utilizador supervisiona.
Por fim, muitos dos números do dia são medidos por quem os publica: os benchmarks do Haiku 5.5 pela Anthropic, os do MAI Code 1.1 Flash pela Microsoft, o Q2D-Web pela Perplexity, que o concebeu, as pontuações do Open d1 pela Liquid AI, e a capacidade de escrita multiplicada por 35 nos testes internos do GitHub. A própria OpenAI avisa que resultados não formalizados dos seus 722 manuscritos podem conter erros, e os seus ganhos de velocidade para o GPT-6 provêm de avaliações internas. Estas medições continuam a ser úteis para comparar os produtos entre si; avaliações externas, como a classificação CursorBench, em que um fornecedor de ferramentas mede o modelo de outro, permitirão cruzar os resultados.
Fontes
- GPT-6 e UI inteligente para todos (OpenAI)
- Anúncio do GPT-6 para todos (@OpenAI)
- Ficha de sistema do GPT-6 Sol e do GPT-6 Luna, atualização de outubro
- GPT-6 e outros modelos no ChatGPT
- Notas de versão do ChatGPT
- Carregar ficheiros e áudio no ChatGPT
- Ajudar os adolescentes a aprender, planear e moldar o futuro da AI (OpenAI)
- Anúncio do Claude Haiku 5.5 (Anthropic)
- Lançamento do Claude Haiku 5.5 (@claudeai)
- Guia de migração para o Haiku 5.5
- Haiku 5.5 no Cursor (@cursor_ai)
- Classificação do CursorBench
- Créditos mensais de API dos planos Max e Team (suporte Claude)
- Anúncio do crédito de API (@ClaudeDevs)
- RTX Spark e DGX Station para Windows (blog NVIDIA)
- Trazer modelos locais e ferramentas em sandbox para Windows e GitHub Copilot (Microsoft Command Line)
- Descubra modelos locais no GitHub Copilot CLI
- Sandboxing local para GitHub Copilot agora disponível para todos
- Versão preliminar da aplicação de desktop Replit (@Replit)
- Lista de espera da aplicação de desktop Replit
- Partilhar os progressos da IA em matemática (OpenAI)
- Repositório openai/math
- Anúncio dos resultados matemáticos (@OpenAI)
- Embeddings multimodais para além de um único vetor (Perplexity Research)
- pplx-embed-v2-late-9b no Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Controlo remoto de agentes locais (changelog do Cursor)
- Changelog do Antigravity
- Warp Factories, Microsoft Teams e Azure DevOps (blog da Warp)
- Toolsets computer use e browser use nos SDK (@ClaudeDevs)
- Documentação dos toolsets do SDK Claude
- Implemente e utilize modelos Grok no Microsoft Foundry
- Open d1 (Liquid AI no Hugging Face)
- Bolmo na Nature (Ai2)
- Google expande o SynthID Detector para conteúdos de AI
- A proteção de segredos tem de acompanhar a expansão do software (GitHub)
- Criar infraestrutura Git para desenvolvimento à escala dos agentes (GitHub)
- Memorando de entendimento com um estado indiano (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP no cuOpt (blog técnico NVIDIA)
- As máquinas que fabricam as máquinas (blog técnico NVIDIA)
- Changelog do ChatGPT e do Codex, ChatGPT para iOS 1.2026.272
- Radisson Hotel Group traz a descoberta de hotéis para o ChatGPT (OpenAI)
- Como a Jump Trading está a expandir a investigação quantitativa com o ChatGPT (OpenAI)
- Extensões de plugins do ChatGPT (@OpenAIDevs)
- Every e Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Muitos, muitos Pucks (Amp)
- Copilot CLI 1.0.93
- Atualize o seu IDE para restabelecer a atividade dos agentes nas métricas de utilização do Copilot
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B frente a frente (blog Hugging Face)
- Nemotron na IOI e na IMO 2026 (blog Hugging Face)
- Instadocs: AI à solta (@netflix)
- Runway no ChatGPT (@runwayml)
- Troca de rostos (@LumaLabsAI)
- Valide alterações em fábricas de AI com gémeos digitais e agentes de AI (blog técnico NVIDIA)
- Análise mais rápida de imagens científicas com NVIDIA cuPhoton
- Cosmos e SynthID (@NVIDIAAI)
- SDK TypeScript da SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)