Suchen

OpenAI wird Texte von ChatGPT und Codex in der Europäischen Union mit Wasserzeichen versehen, Devin erinnert sich über Sitzungen hinweg, GitHub startet ReviewBench

ai-powered-markdown-translator

Artikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

OpenAI wird in den kommenden Wochen für seine Nutzer in der Europäischen Union ein unsichtbares Wasserzeichen in Texte von ChatGPT und Codex einfügen. Damit reagiert das Unternehmen auf den AI Act, der verlangt, generierte Texte maschinell erkennbar zu machen, und bietet dieses Wasserzeichen ab heute seinen API-Kunden weltweit als Option an. Bei den Agenten hält das Gedächtnis Einzug: Cognition stattet Devin mit einem Gedächtnis über Sitzungen hinweg aus und veröffentlicht dessen Format als offenen Standard, und Cohere startet North 2 mit einem Gedächtnis, das den Kontext von einer Sitzung zur nächsten bewahrt; GitHub veröffentlicht seinerseits ReviewBench, einen offenen Benchmark für Code Reviews durch KI. Bei den offenen Modellen stellt Reflection AI Beam mit 501 Milliarden Parametern vor, dessen Gewichte für später im Oktober angekündigt sind.


Unsichtbares Wasserzeichen von OpenAI: Texte von ChatGPT und Codex in der Europäischen Union markiert, weltweite Option in der API

5. Oktober — OpenAI veröffentlicht seine Antwort auf die europäischen Regeln zur Herkunft von Texten. Der AI Act verpflichtet Anbieter generativer KI dazu, die von ihnen erzeugten Texte maschinenlesbar erkennbar zu machen; OpenAI reagiert darauf schrittweise und weist von Anfang an darauf hin, dass die derzeitigen Technologien für Textwasserzeichen erhebliche Einschränkungen haben (erhebliche Einschränkungen).

Betroffene NutzergruppeWas sich ändertAngekündigter Zeitplan
Nutzer von ChatGPT und Codex in der Europäischen Union, alle TarifeUnsichtbares Wasserzeichen wird Texten hinzugefügt, die die Voraussetzungen erfüllenIn den kommenden Wochen
API-Kunden weltweitOptionales Wasserzeichen (opt-in) auf ausgewählten, nicht genannten Modellen, standardmäßig deaktiviertAb dem 5. Oktober
Zugelassene Forscher und FachorganisationenZugang zum Detektor nach Einzelfallprüfung und BewerbungBewerbungen ab dem 5. Oktober möglich

OpenAI aktiviert die Funktion nicht weltweit standardmäßig und arbeitet mit Cloud-Partnern daran, in den kommenden Wochen dasselbe Wasserzeichen für die von ihnen bereitgestellten OpenAI-Modelle anzubieten. Die Technologie textGrain fügt der Wortwahl des Modells ein unsichtbares statistisches Signal hinzu, ohne sichtbare Markierung oder Sonderzeichen; laut OpenAI erreicht oder übertrifft sie die anderen getesteten Ansätze, darunter SynthID für Text. Ein technischer Bericht wurde veröffentlicht, und OpenAI plant, den Code offenzulegen. Der Detektor ist zum Start hingegen nicht öffentlich zugänglich, da Wasserzeichen übersehen werden können und das Risiko falsch positiver Ergebnisse besteht: Der Zugang richtet sich nach dem Verhaltenskodex (Code of Practice) der Europäischen Kommission.

Die veröffentlichten Zahlen zeigen vor allem die Grenzen der Erkennung:

MessbedingungVeröffentlichte Erkennungsrate
Passagen mit 200 Tokens, psychologische Inhalte, angestrebte Rate falsch positiver Ergebnisse von 1 %etwa 80 %
Passagen mit 400 Tokens, psychologische Inhalte, angestrebte Rate falsch positiver Ergebnisse von 1 %etwa 95 %
Mathematische Inhalte, derselbe Schwellenwert von 1 %deutlich niedriger (Wert nur in einer Grafik angegeben)
Unbearbeitete englische Passagen mit 400 Tokens (ELI5-Datensatz)etwa 92 %
Dieselben Passagen, 10 % der Wörter durch Synonyme ersetzt66 %
Dieselben Passagen, 25 % der Wörter ersetzt17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇩🇪 Wasserzeichen haben Grenzen. Sie sind oft nicht erkennbar, insbesondere in kurzen Passagen. Das Umschreiben oder Übersetzen eines Textes kann das Wasserzeichen vollständig entfernen. — @OpenAI auf X

Bei der Qualität misst OpenAI auf acht Benchmarks von GPT-6 Astra ohne und mit Wasserzeichen keinen signifikanten Unterschied (94,44 % gegenüber 93,94 % auf GPQA Diamond, 53,90 % gegenüber 56,06 % auf Terminal-Bench 4.0). Der Beitrag erläutert auch, was ein Wasserzeichen nicht aussagt: weder den Anteil menschlicher Arbeit noch das Eigentum am Text oder die Verantwortung dafür, weder die Identität des Nutzers noch die Richtigkeit; und sein Fehlen beweist nicht, dass ein Mensch den Text geschrieben hat. Für Bilder und Audio ändert sich nichts: openai.com/verify und die Content Provenance API bleiben für Organisationen zugänglich, und seit dem 19. Mai ergänzt SynthID die C2PA-Metadaten generierter Bilder.

🔗 OpenAI-Beitrag zur Herkunft von Texten in der EU


5. Oktober — Cognition führt in Devin zwei zusammenhängende Funktionen ein: Memory, ein Gedächtnis, das von einer Sitzung zur nächsten bestehen bleibt, und Dreaming, einen täglichen „Traum“, der es neu organisiert. Memory bewahrt, was der Agent bei der Arbeit mit jedem Nutzer lernt: Vorlieben, Korrekturen und Erkenntnisse aus einem Projekt oder einem Arbeitsablauf. Dabei handelt es sich nicht um Zusammenfassungen von Sitzungen, sondern um kurze Notizen, die jeweils mit der Sitzung verknüpft sind, in der die Erkenntnis gewonnen wurde. Dieses Gedächtnis bleibt persönlich: Es wird nicht zu einer Anweisung, die für die gesamte Organisation gilt.

Die Notizen liegen im Memory Drive, einem dauerhaften Git-Repository mit Markdown-Dateien, die nach Repository, Projekt oder Thema geordnet sind. Eine bewusst kurz gehaltene Datei MEMORY.md bündelt die allgemeinen Vorlieben und das Verzeichnis der übrigen Inhalte: Devin erhält sie zu Beginn jeder Sitzung und sucht anschließend mit den Tools, die es zum Durchsuchen von Code verwendet, nach nützlichen Notizen, ohne das gesamte Archiv in seinen Prompt zu laden. Jede Sitzung arbeitet mit ihrer eigenen Git-Kopie: Devin führt die Aktualisierungen anderer Sitzungen zusammen, eine Versionsprüfung weist veraltete Schreibvorgänge zurück, und Konflikte werden gemeldet, statt Inhalte stillschweigend zu überschreiben.

Dreaming ist eine tägliche Sitzung im Hintergrund (nachts, wie der Thread von Cognition präzisiert): Devin liest frühere Gespräche im Licht seines Gedächtnisses erneut, führt sich überschneidende Notizen zusammen, entfernt vorübergehend relevante Details, sucht nach Erkenntnissen, die nicht festgehalten wurden, und löscht Erinnerungen, die keine Sitzung verwendet hat. Der Zugriff erfolgt auf devin.ai über das Menü Customize → Memory; der Beitrag erwähnt weder Devin Desktop noch Devin CLI und kündigt keine Preise an.

Cognition veröffentlicht das Format außerdem unter dem Namen Agent Memory Repo als offenen Standard unter MIT-Lizenz. Die Spezifikation ist offen für Beiträge und beschreibt den Ablauf jeder Sitzung (das Gedächtnis klonen, durchsuchen, ohne menschliches Eingreifen aktualisieren und nach jeder Änderung pushen) sowie die Kombination mehrerer Gedächtnisse in derselben Sitzung, jeweils in einem eigenen Repository mit eigenen Zugriffsrechten und eigener Historie. Zu den genannten Einsatzmöglichkeiten gehören Teamgedächtnisse und Agentenschwärme (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇩🇪 Bei ersten Experimenten haben wir beobachtet, wie ein Schwarm von Devin-Agenten das Gedächtnis nutzte, um sich in großem Maßstab zu koordinieren, ohne dass wir sie darum gebeten hatten (versprochen, sie haben niemanden gehackt). — @cognition auf X

Ein „Traum“, der das Gedächtnis eines Agenten neu organisiert, existierte bereits bei Anthropic (Claude Managed Agents, im Mai) und bei OpenAI (Gedächtnis von ChatGPT, im Juni); neu ist hier ein Gedächtnis in mit Git versionierten Dateien, das als Spezifikation veröffentlicht wird, die andere Agenten übernehmen können.

🔗 Gedächtnis und Träumen, Beitrag von Cognition 🔗 Spezifikation von Agent Memory Repo

Cursor: Agenten seines SDK während der Ausführung steuern

5. Oktober — Cursor erweitert sein SDK, mit dem sich seine Agenten aus TypeScript- oder Python-Code starten lassen. Die Methode run.steer() fügt eine Nachricht in den laufenden Durchlauf eines Agenten ein; arbeitet zu diesem Zeitpunkt ein Unteragent, wechselt dieser in den Hintergrund und setzt seine Arbeit fort. Unteragenten im Hintergrund melden auch ihre Ergebnisse zurück: Ihr Ergebnis erreicht den übergeordneten Agenten als zusätzlicher Durchlauf derselben Ausführung, statt verloren zu gehen, wenn der Durchlauf des übergeordneten Agenten endet.

Neuerung im SDKLaut Changelog abgedeckter Bereich
run.steer(), Steuerung während der AusführungLokale Agenten in TypeScript; bei einem Cloud-Agenten wird die Nachricht als normaler erneuter Aufruf gesendet
Rückgabe der Ergebnisse von Unteragenten im HintergrundLokale Agenten in TypeScript und Python
MCP-Annotationen für benutzerdefinierte Tools (readOnlyHint, destructiveHint…)TypeScript; reine Hinweise, deren Einhaltung das SDK nicht erzwingt
Austauschbarer System-Prompt, Regeln und Skills werden weiterhin geladenLokale Agenten in TypeScript; Zugriff wird für jedes Konto einzeln aktiviert

Für diese Änderungen werden keine Preise genannt.

🔗 Der Thread von Cursor auf X 🔗 Changelog des Cursor-SDK

Qwen Code v0.25.0: Workspace-Agenten, E-Mail-Kanal und Mem0-Gedächtnis

5. Oktober — Qwen veröffentlicht v0.25.0 von Qwen Code, seinem Programmieragenten für die Kommandozeile, als erste stabile Version seit v0.24.7 vom 29. September: 42 Funktionen, davon 23 für den Managed Agent, 79 Fehlerbehebungen und keine bekannten Breaking Changes. Drei Ergänzungen, die alle ausdrücklich aktiviert werden müssen, stechen hervor. Workspace-Agenten arbeiten nun lokal zusammen: Der Daemon startet ihre Durchläufe und setzt sie fort, und über die Web Shell lassen sich Agenten und Aufgaben verwalten sowie Agenten mit @agent aus einer Unterhaltung heraus ansprechen. Diese dauerhaften Agenten unterstützen nun das Protokoll A2A 1.0 über Freigaben, die ablaufen und widerrufen werden können. Schließlich lässt sich das Mem0-Gedächtnis direkt an den CLI anbinden: Es genügt, einen Endpunkt und einen Schlüssel anzugeben, und Qwen Code registriert selbst den entsprechenden MCP-Server. Ein E-Mail-Kanal gibt dem Agenten außerdem ein eigenes Postfach über IMAP und SMTP, und der Code Mode führt die vom Modell gebündelten Bash-Aufrufe parallel aus. Das TypeScript-SDK v0.1.18 und die Desktop-Anwendung v0.25.0 folgten am selben Morgen, ohne Tweet von Qwen.

🔗 Versionshinweise zu Qwen Code v0.25.0

5. Oktober — Together AI startet Together Link als Beta. Damit laufen bereits installierte Code-Agenten auf den offenen Modellen, die auf der Plattform gehostet werden. Ein Installationsbefehl (macOS oder Linux) verbindet Claude Code, Claude Desktop, Codex, OpenCode und Pi mit seiner API und nutzt dabei den Kontoschlüssel; die Dokumentation ergänzt ChatGPT Desktop und weist darauf hin, dass sich Befehle, Routing und Modellliste noch ändern können. Neben dem Modus Auto werden vier Modelle angeboten, alle mit 1M Tokens Kontext:

Angebotenes ModellEntsprechung im Menü /model von Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

Der standardmäßig ausgewählte Modus Auto kann schwierige Aufgaben an Opus 5.5 übertragen, wenn der Nutzer einen Anthropic-Schlüssel bereitstellt. Beitrag und Dokumentation beschreiben dieses Routing jedoch unterschiedlich: Laut Beitrag wird einmal pro Sitzung eine Auswahl getroffen, um den Prompt-Cache zu bewahren; laut Dokumentation erfolgt eine Auswahl für jede einzelne Anfrage, die Claude Code und Claude Desktop vorbehalten ist. Together AI kündigt eine Kostenersparnis von mehr als 50 % an, ohne die Berechnungsmethode zu veröffentlichen, und zeigt nach jeder Sitzung deren Kosten neben den Kosten an, die sie mit Opus 5.5 verursacht hätte.

🔗 Beitrag von Together AI 🔗 Dokumentation von Together Link

Selbst gehosteter IBM Bob setzt auf Nemotron 3 Ultra von NVIDIA

5. Oktober — IBM erklärt, warum die selbst gehostete Version (self-hosted) von Bob, seinem agentischen Entwicklungsassistenten, neben Poolside Laguna S 2.1 auf Nemotron 3 Ultra von NVIDIA setzt. Diese Option ist seit der Vorwoche allgemein verfügbar und betreibt den Assistenten auf der Infrastruktur des Kunden, bis hin zu vom Netz getrennten Umgebungen (air-gapped). Das Team bewertete die Modelle anhand von vier Kriterien (Hardwarebedarf, Genauigkeit bei Code, Latenz und Offenheit der Gewichte) und testete sie mit dem Agent Harness von Bob, wobei geschlossene Modelle von Anthropic, OpenAI und Google als Referenz dienten. Nemotron war zunächst zu wortreich und wurde gemeinsam mit NVIDIA angepasst: Prompts, Sampling-Parameter, Einstellungen für das Reasoning und Korrekturen am Harness. Laut internen Tests von IBM bietet Nemotron 3 Ultra auf Blackwell-GPUs eine bis zu etwa um den Faktor 4 geringere Latenz als führende SaaS-Modelle, die über das Netzwerk aufgerufen werden, und hält die Tool-Schemas strikt ein; Laguna S 2.1 wurde wegen seines Verhältnisses von Leistung zu Ressourcenbedarf ausgewählt. Der Beitrag veröffentlicht keine Genauigkeitswerte.

🔗 IBM-Beitrag zu selbst gehostetem Bob


ReviewBench: GitHub startet einen offenen Benchmark für Code-Reviews durch KI

5. Oktober — GitHub startet ReviewBench, einen offenen Benchmark für KI-Agenten zur Code-Review, als Forschungsvorschau (research preview). Die zugehörige Website veröffentlicht den vollständigen Datensatz, die Rangliste, die Methodik, den Prompt und die Konfiguration des Bewerters sowie eine Ausführungsumgebung zur selbstständigen Nutzung. Der Beitrag stammt von Michelle Zhou und Alejandro Carderera de Diego; die Danksagung nennt GitHub und Microsoft als am Projekt Beteiligte.

Das Korpus umfasst 219 Pull Requests aus 187 öffentlichen Open-Source-Repositories in 19 Programmiersprachen. Die Verteilungen der Programmiersprachen und Repository-Größen bilden diejenigen von GitHub nach, die anhand von 103,9 Millionen Pull Requests ermittelt wurden, mit einer bewussten Gewichtung zugunsten mittelgroßer und großer Änderungen. Die Ground Truth (golden set) kombiniert menschliche Reviewer, aus Folge-Commits abgeleitete Probleme, deterministische Analysewerkzeuge und mehrere führende LLMs; die Befunde werden durch einen LLM-Bewerter validiert, laut Beitrag Claude Sonnet 5. Erfahrene Ingenieure, die nicht am Aufbau des Datensatzes beteiligt waren, haben jeden Befund neu annotiert: Ihr Urteil stimmt in 96,6 % der Fälle mit ReviewBench überein. Der „verankerte“ Recall (grounded), der ausschließlich anhand der Ground Truth gemessen wird, dient als Hauptvergleichsgröße.

Laut der ersten Rangliste von GitHub liegt Copilot code review an der Spitze:

Bewerteter Agent (Konfiguration)Verankerter F1Verankerte PräzisionVerankerter RecallAusführungsdatum
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1. Oktober 2026
Devin AI37,0 %84,0 %23,8 %28. September 2026
Qodo35,1 %85,3 %22,1 %28. September 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19. Juli 2026
Cubic27,3 %85,5 %16,3 %29. Juni 2026
Greptile27,2 %86,1 %16,2 %16. Juni 2026
Cursor17,3 %87,7 %9,6 %27. September 2026

Die Website stellt klar, dass diese ersten Einträge vom ReviewBench-Team erstellt wurden, indem es das öffentlich verfügbare Produkt jedes Anbieters zum angegebenen Datum ausführte, und dass die Anbieter diese Ausführungen weder selbst vorgenommen noch überprüft haben. Ab sofort kann jeder seinen Agenten einreichen: Der Teilnehmer stellt ein Container-Image und einen Modellschlüssel bereit, GitHub den Bewerter; zunächst erfolgen Tests mit 25 Pull Requests, dann die vollständige Ausführung in drei Durchgängen. Ein Score wird erst nach der Validierung durch einen Maintainer veröffentlicht und nur dann, wenn er den bisherigen Score des Agenten verbessert oder dessen ersten Eintrag darstellt.

GitHub nutzt den Benchmark auch zur Weiterentwicklung von Copilot code review. In einem A/B-Test erzielte ein Review mit mehreren Modellen auf der Stufe Lite, das mehrere unabhängige Ausführungen kombiniert, einen um 13,6 % höheren Recall bei um 8,0 % niedrigeren Kosten pro Review – in der offline vorhergesagten Richtung. Der Beitrag widerspricht sich bei der Anzahl der Kommentare: +61 % laut Text, +25,0 % laut Grafik.

🔗 Beitrag von GitHub zu ReviewBench 🔗 Website und Rangliste von ReviewBench


Cohere startet North 2 und geht mit PwC eine globale Allianz ein

5. Oktober — Cohere startet North 2, die neue Version von North, seiner Plattform für KI-Agenten in Unternehmen, die am 9. September als „bald verfügbar“ angekündigt und anschließend für Oktober zugesagt worden war. Der Thread zum Start nennt mehr als 15 neue Funktionen (15+ new features), eine Zahl, die der Beitrag nicht aufgreift. Das Herzstück der Version ist ein neuer Agent-Harness (agent harness), der für mehrstufige Automatisierungen und Agenten neu konzipiert wurde, auf einer weiterhin modellagnostischen Plattform: Modelle von Cohere oder Modelle des Kunden.

FunktionsbereichVon Cohere genannte Neuerungen
AgentenWiederverwendbare Agenten und Automatisierungen, die per Prompt erstellt und innerhalb der Organisation geteilt werden; Orchestrierung mehrerer Agenten; Speicher, der den Kontext von einer Sitzung zur nächsten bewahrt
ProduktivitätFähigkeiten (Skills), Bibliotheken (Libraries) und Anwendungen, die Präsentationen, Dashboards und Dokumente erstellen; Automations, Ende Juli gestartet, mit einsatzbereiten Vorlagen und visuellem Editor
KonnektorenSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion und GitHub; Anbieter von Finanzdaten (PitchBook, FactSet und weitere) sind lediglich geplant
Bereitstellung und SicherheitSelbst gehostet, VPC, hybrid, vor Ort oder vollständig vom Netz getrennt; SOC 2 Type 2, ISO 27001 und ISO 42001; Richtlinien zur Autonomie mit menschlicher Freigabe kritischer Entscheidungen
GovernanceKonsole North Admin, Verbrauchsstufen für Anfragen und Tokens pro Nutzer oder Gruppe, Warnungen vor Erreichen der Obergrenzen

Cohere nennt zwei Kunden, LG CNS in Südkorea und Bell Cyber in Kanada, und hebt einen höheren Durchsatz seiner Modelle auf NVIDIA Blackwell und Hopper GPUs hervor, ohne Zahlen zu nennen, mit einem Zitat von Kari Briski, der Verantwortlichen für generative KI bei NVIDIA. Preise und ein Zeitplan für die Bereitstellung werden nicht genannt: Der Beitrag verweist auf eine Demonstration, die beim Vertrieb gebucht werden kann.

🔗 Beitrag zum Start von North 2 🔗 Thread zum Start von North 2 auf X

Die globale Allianz mit PwC, die in Kanada beginnt

5. Oktober — Am selben Tag kündigen PwC und Cohere eine globale Allianz (global alliance) an, die in Kanada beginnt, in einer mit Toronto datierten Pressemitteilung von PwC Canada, auf die ein kurzer Beitrag von Cohere verweist. Die Rollenverteilung ist klar: Cohere liefert North, seine Unternehmensmodelle und seine Werkzeuge zur Informationssuche; PwC bringt seine Expertise in Branchenfragen, Regulierung, Risikomanagement und Transformation ein, von der Auswahl der Anwendungsfälle bis zur Integration der KI in die Daten und Systeme des Unternehmens. Die angekündigten Anwendungen umfassen unternehmensweite Suche, Wissenszugang, vertiefte Recherche, Entscheidungshilfe und Aufgabenautomatisierung, in einer privaten Cloud, vor Ort oder in einer vom Netz getrennten Umgebung, wobei regulierte Branchen die erste Zielgruppe sind. Die Pressemitteilung zitiert Domenic Marino und Annie Veillet von PwC Canada sowie Aidan Gomez von Cohere; sie nennt weder einen Betrag noch einen Kunden oder einen Zeitplan über Kanada hinaus. Cohere hatte bereits am 16. September eine Allianz mit OpenText geschlossen.

🔗 Beitrag von Cohere zur Allianz mit PwC 🔗 Pressemitteilung von PwC Canada


Offene Modelle: Beam, MetaEncoder-30B und Gemma 4 in der Pflanzengenomik

Drei offene Modelle prägen die Nachrichten des Tages, in drei unterschiedlichen Phasen: Eines ist angekündigt, das zweite ohne Ankündigung online gestellt, das letzte wird einen Monat nach seiner Veröffentlichung hervorgehoben.

Beam: Das offene Modell von Reflection AI mit 501 Milliarden Parametern

5. Oktober — Reflection AI stellt Beam vor, sein erstes Modell mit offenen Gewichten: ein Sparse-MoE mit 501 Milliarden Parametern, davon 23 Milliarden aktiv, das für Code, Reasoning und agentische Aufgaben konzipiert und von Grund auf durchgängig trainiert wurde. Das Vortraining umfasste 23 800 Milliarden Tokens; in der Phase des Reinforcement Learning kamen vier Wochen lang 10 500 NVIDIA GB300 GPUs zum Einsatz und es entstanden mehr als 100 Millionen Trajektorien (rollouts).

Laut den Tabellen von Reflection AI:

Bewerteter BenchmarkBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Ein Strich kennzeichnet einen Score, der im Beitrag nicht angegeben wird. Reflection AI gibt an, bei einem um den Faktor 3 bis 4 geringeren Rechenaufwand für die Inferenz vergleichbare Reasoning-Scores wie GLM-5.2 zu erzielen, und räumt ein, dass Kimi K3 bei der reinen Leistungsfähigkeit weiterhin vorne liegt. Noch lässt sich nichts herunterladen: Beam befindet sich in den abschließenden Evaluierungen und in adversarialen Tests (red-teaming), der frühzeitige Zugang erfolgt über eine Anmeldung, und die Gewichte, der technische Bericht, die Modellkarte sowie Entwicklerwerkzeuge sind für später im Oktober angekündigt.

🔗 Beitrag von Reflection AI zu Beam

MetaEncoder-30B, der Entscheidungsencoder, den Meta ohne Ankündigung online stellt

5. Oktober — Meta hat MetaEncoder-30B auf Hugging Face unter seiner Organisation facebook online gestellt, ohne dass eine Ankündigung gefunden wurde: Das am 30. September erstellte und am 5. Oktober geänderte Repository verzeichnete zum Zeitpunkt unserer Erhebung nur zwei Downloads. Die Modellkarte beschreibt einen multimodalen „System One“-Encoder, das Format der Entscheidungsmodelle von Jev: Man gibt ihm eine Aufgabe in natürlicher Sprache (Frage, Anweisung, Zustandsbeschreibung, Kriterien) und eine Liste von Kandidaten in Textform, ergänzt durch Bilder und Videos, und er bewertet jeden Kandidaten. Da Aufgabe und Kandidaten separat encodiert werden, reduziert sich der Vergleich auf ein Skalarprodukt, und ein Index der nächsten Nachbarn kann Millionen von Kandidaten abdecken, ohne das Modell erneut auszuführen. MetaEncoder ist ein kontrastives Fine-Tuning von Muse Glimmer 30B, dem agentischen Modell mit offenen Gewichten, das Meta im August veröffentlicht hat und dessen Lizenz Apache 2.0 es übernimmt; der Download setzt die Zustimmung zu Bedingungen voraus, und vLLM stellt es für Text und Bilder bereit.

EvaluierungsbenchmarkScore laut ModellkarteVerwendete Metrik
JEVBench (Original / leicht / schwierig)0,9444 / 1,0000 / 0,7387Genauigkeit
ImaJEV-Bench0,8958Genauigkeit
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (Bild / Video / visuelle Dokumente)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Modellkarte von MetaEncoder-30B auf Hugging Face

Living Models verbindet Gemma 4 und BOTANIC-1, um die DNA von Pflanzen zu entschlüsseln

5. Oktober — Google hebt in einem X Article von @GoogleAI und auf seiner Gemmaverse-Präsentationsseite die Arbeit von Living Models hervor, einem KI-Biologielabor mit Sitz in Paris. Gemma 4 E4B orchestriert dort die Analyse (Verarbeitungsketten im Terminal, Datenfilterung, Tool-Aufrufe), lokal über Ollama auf einer einzigen NVIDIA L4 GPU, während BOTANIC-1, ein auf 320 Pflanzenarten vortrainiertes genomisches Foundation Model, die Auswirkungen von Mutationen bewertet; die proprietären Genome bleiben vor Ort. Die Fallstudie greift eine Entdeckung von Adnane Boualem am INRAE auf: Ein einziger veränderter Buchstabe im Gen CmEIN3 der Melone lässt die Blüte von weiblich zu zwittrig wechseln. Unter den 2 494 möglichen Punktmutationen landet die validierte Mutation allein auf Platz eins, laut X Article in weniger als vier Minuten.

Getestete Konfiguration (20 Ausführungen)Recall@1
Ohne Anleitung0,00
Mit fachkundiger Anleitung0,15
Mit dem Score von BOTANIC-10,90

Die Modelle Botanic1 (mit 0,3 bis 2 Milliarden Parametern) und die Vorveröffentlichung auf bioRxiv stammen von Anfang September: Neu sind diese Hervorhebung durch Google und die detaillierten Ergebnisse.

🔗 X Article von Google AI 🔗 Gemmaverse-Seite von Google DeepMind


Werbung in ChatGPT: Ein visuelles Format im Test und erweiterte Messung

5. Oktober — OpenAI bereitet ein visuelles Werbeformat für ChatGPT vor: Bilder sollen Inspiration rund um ein Produkt, seine Nutzung oder das Erlebnis zeigen, das es ermöglicht. Der erste Test wird während der Bildgenerierung stattfinden, mit klar gekennzeichneten Anzeigen, die vom gerade entstehenden Bild getrennt sind; er beginnt im weiteren Verlauf dieses Monats in den USA mit einer ersten Gruppe von Werbetreibenden. OpenAI betont erneut, dass Werbung die Antworten von ChatGPT nicht beeinflusst, das nach Angaben des Unternehmens jede Woche 1,2 Milliarden Menschen erreicht.

Der Großteil der Ankündigungen betrifft die Messung: Übermittlung von Conversions über Hightouch, Tealium und LiveRamp, zehn namentlich genannte Attributionspartner (darunter AppsFlyer, Adjust und Triple Whale), geografische Experimente zur Inkrementalität mit Haus, Measured und WorkMagic, ein Conversion-Zeitfenster von einem Tag nach einer Impression in den Berichten und eine Kennzahl für die Signalqualität (Event Quality Score). Bei der Markensicherheit können berechtigte Werbetreibende Ausdrücke ausschließen (Negative Phrases), und Pilotprojekte zur Bewertung werden mit DoubleVerify und Integral Ad Science vorbereitet. Das Pixel und die Conversions API gibt es bereits seit dem 5. Mai.

Von OpenAI veröffentlichtes ErgebnisVeröffentlichter WertMessung durchgeführt von
Kosten pro Akquisition von WeightWatchers im Vergleich zum eigenen Benchmark für bezahlte Suche−15,3 %DV Rockerbox
Inkrementelle Käufe der Marke Dose durch Neukunden67 %WorkMagic
Besucher von Portland Leather aus ChatGPT Ads, die neu für die Marke waren93 %Triple Whale

🔗 Beitrag von OpenAI zum neuen Werbeformat 🔗 Beitrag im Ads-Blog zur Messung


Changelog von Perplexity vom 5. Oktober: Browser-Erweiterung für Computer, Wiley und Stripe Projects

5. Oktober — Perplexity veröffentlicht ein Produkt-Changelog mit 18 Einträgen, das zum Zeitpunkt unserer Erhebung noch nicht auf X geteilt wurde. Acht greifen bereits behandelte Ankündigungen auf (Automations, Claude Opus 5.5, Videogenerierung, Skills American Express, Portable Computer auf AMD, Fast Search, Profiles der Agent API, Claude Fable 5.1), ein neunter ergänzt die Grafiken vom 1. Oktober um interaktive 3D-Erklärungen, und neun Neuerungen werden erstmals vorgestellt:

Erstmals vorgestellte NeuerungPlattform oder VersionZielgruppe
Erweiterung für Chrome, Edge oder Brave, mit der Computer den Browser nutzen kann (Comet bleibt Standard)Perplexity für Mac 26.38.0 und neuerNicht angegeben
Computer-Aufgaben in separaten Tabs und FensternPerplexity für Mac 26.37.1 und neuerNicht angegeben
Aufwandsmodus (Light, Standard, High, Ultra) auf MobilgeräteniOS 26.38.0 und Android 2.100.0 und neuerPro, Max, Enterprise Pro, Enterprise Max
Zeitschriften und Bücher von Wiley ohne separates Wiley-AbonnementPerplexity und ComputerAlle Tarife, variable Premium-Kontingente
GPT-6.1 Sol, das auch die Aufwandsstufe Light von Computer anstelle von GPT-6 Sol antreibtPerplexity und ComputerBerechtigte zahlende Abonnenten
Geführtes Gespräch zum Starten einer ersten Computer-AufgabeWebNeue kostenlose Konten
Verbinden einer App über den Eingabebereich (App verbinden)Computer im WebNicht angegeben
DocSend-Connector für Investment-Datenräume (deal rooms)ComputerBerechtigtes DocSend-Konto
Stripe Projects: Schlüssel für die Perplexity API über die CLI von Stripe erstelltCLI von StripeEntwickler für die Perplexity API

Mit Stripe Projects erstellt oder verknüpft ein Befehl das Projekt, generiert den Schlüssel und schreibt ihn in die Datei .env; Perplexity schlägt vor, diese Konfiguration Claude Code, Cursor oder Codex zu überlassen.

🔗 Changelog von Perplexity vom 5. Oktober


Generative Kreation: Suno Albums und HyperFrames Studio von HeyGen

Suno fügt Alben hinzu

5. Oktober — Suno fügt Alben hinzu, die bisher auf seiner Plattform fehlten. Laut dem begleitenden Blogbeitrag macht die Funktion aus den besten eigenen Stücken vollständige Projekte (Projekte in voller Länge), und eine Wiedergabeliste (Playlist), die bisher als Album diente, lässt sich nun in ein Album umwandeln. Suno stellt die Künstler hinter den ersten fünf Alben vor: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) und VOID (ECHLO). Der Anbieter nennt weder die betreffenden Tarife noch die Anzahl der Titel pro Album oder das genaue Datum der Freischaltung. Bereits im Juni befragte Suno seine Community zu ihrem Hörerlebnis mit Wiedergabelisten, Alben und Radios.

🔗 Ankündigung von Suno auf X 🔗 5 Alben, die Sie nicht verpassen dürfen, Suno-Blog

HyperFrames Studio, der für Agenten entwickelte Videoeditor von HeyGen

5. Oktober — HyperFrames, das Open-Source-Framework von HeyGen, das HTML-Code in Video umwandelt, wird zur Desktop-Anwendung. HyperFrames Studio präsentiert sich als Videoeditor, der von Grund auf für Agenten entwickelt wurde: Man beschreibt das gewünschte Video, der Agent (Claude Code, Codex oder ein eigener Agent) liefert einen ersten Schnitt, dann arbeiten Mensch und Agent auf derselben Zeitleiste (timeline). Die Steuerung erfolgt über Gesten statt über den Prompt: ein Element im Bild einkreisen, einen Kommentar an ein Wort heften oder selbst schneiden. Die Anwendung exportiert in 4K und wirbt mit Hunderten von Inspirationen und Vorlagen; laut dem HyperFrames-Konto auf X ist sie kostenlos, und zum Download wird nur eine macOS-Version angeboten. Sie führt die Studio Preview vom Juli weiter, mit der sich bereits per Code generierte Videos visuell bearbeiten ließen.

🔗 Ankündigung von HyperFrames Studio 🔗 Von HeyGen geteilt


Kurzmeldungen

  • Warp Factories auf dem Weg zur allgemeinen Verfügbarkeit — In einem Beitrag vom 3. Oktober über sein Herbstseminar erklärt Warp, dass Warp Factories, seine Agenten-Infrastruktur, gerade vom Early Access zur allgemeinen Verfügbarkeit übergeht, ohne Datum oder Preisangabe; das Team gibt an, damit im vergangenen Monat seine Kosten pro PR um 70 % gesenkt zu haben. 🔗 Quelle
  • Versionshinweise von Devin vom 2. Oktober — Die Zugriffseinstellungen von Microsoft Teams werden jetzt durchgesetzt, ein Klick wählt alle Sicherheitsbefunde desselben Schweregrads aus (einschließlich API v3), und angebotene Plugins zeigen vor der Installation ihre Skills, MCP, Hooks und Regeln; für die Erstellung von Umgebungen auf großen Perforce-Repositories stehen nun 3 Stunden zur Verfügung, statt nach 10 Minuten fehlzuschlagen. 🔗 Quelle
  • TikTok Ads MCP in Replit — Replit fügt TikTok Ads seinem Katalog mit mehr als 450 Integrationen hinzu: Sobald das Konto verbunden ist, kann sein Agent TikTok-Anzeigen erstellen und verwalten, Zielgruppen erreichen und die Leistung direkt im Arbeitsbereich messen, ohne dass für die Verbindung Credits verbraucht werden. 🔗 Quelle
  • Cockle Finance auf Replit — Replit pinnt ein Video über Cockle Finance an, dessen Tool von Dan und seinem Vater Steve auf Replit entwickelt wurde, um den Kundenzulauf zu verfolgen; laut Replit hat Dan sein Geschäft in drei Monaten um 15 % vergrößert, ohne dass die verwendete Kennzahl genannt wird. 🔗 Quelle
  • Copilot CLI 1.0.92 als stabile Version — Diese Version vereint die Neuerungen der Vorabversionen 1.0.92-0 bis -5; die einzige neue Änderung betrifft Microsoft Entra: Nach einer Anmeldung wählt der Nutzer das zu verwendende Konto aus, /logout beendet diese OAuth-Sitzungen, und durch Entra geschützte MCP-Server erneuern ihre Zugangsdaten ohne Eingriff. 🔗 Quelle
  • Codex CLI 0.160.1 — Dieser Patch für 0.160.0 enthält nur einen Backport: Die Windows-Variablen SYSTEMROOT, TEMP und TMP bleiben beim Start entfernter MCP-stdio-Server erhalten, deren entfernte Umgebung ausdrücklich konfiguriert ist; dies ist die neueste stabile Version, da keine stabile 0.161.0 erschienen ist. 🔗 Quelle
  • Nightly von Gemini CLI vom 5. Oktober — Sie enthält keine Änderungen: Sie basiert auf demselben Commit wie die Version vom 3. Oktober und unterscheidet sich nur durch die Versionsnummern; die Kanäle für stabile Versionen (v0.62.0) und Vorabversionen (v0.63.0-preview.0) bleiben unverändert. 🔗 Quelle
  • TypeScript SDK von SpaceXAI 0.2.1 — Diese am 2. Oktober veröffentlichte Version fügt toJson(schema) hinzu, das die strukturierte Ausgabe mit einem Validator für Standard Schema (Zod, Valibot oder ArkType) prüft, sowie die Option retryBeforeOutput, die eine vor der ersten Ausgabe fehlgeschlagene Streaming-Anfrage (streaming) erneut startet; bei einem 429 ohne Retry-After-Header beginnt die Wartezeit nun bei einer Sekunde und steigt bis auf 30 Sekunden, statt bei 250 Millisekunden zu beginnen. 🔗 Quelle
  • Cresta Conductor auf dem Claude Agent SDK — In Anthropics Reihe über Startups, die mit Claude entwickeln, stellt Cresta Conductor vor, ein auf dem Claude Agent SDK basierendes Werkzeug zum Erstellen von Kundenservice-Agenten in natürlicher Sprache; laut Cresta hat es die Zeit bis zur ersten Bereitstellung in den ersten Anwendungsfällen etwa halbiert, ohne Angaben zu Verfügbarkeitsdatum oder Preis. 🔗 Quelle
  • npm: Ablauf von Konfigurationen für vertrauenswürdiges Veröffentlichen — Seit dem 2. Oktober läuft eine Konfiguration für vertrauenswürdiges Veröffentlichen (trusted publishing), die für keine Veröffentlichung verwendet wurde, 48 Stunden nach ihrer Erstellung ab; außerdem lehnt npm Tokens aus issue_comment-Ereignissen von GitHub Actions ab, wie bereits bei pull_request_target. 🔗 Quelle
  • npm: Vorgemerkte Veröffentlichungen erstellen Pakete — Seit dem 2. Oktober kann npm stage publish mit einer lokalen Sitzung oder einem granularen Token ein noch nicht existierendes Paket erstellen, auch wenn der Token auf das Vormerken (stage-only) beschränkt ist; die erste Version wartet auf die Freigabe durch einen Maintainer, bevor sie installierbar ist. 🔗 Quelle
  • Agent API von Perplexity mit Fast Search — Die Voreinstellungen low, medium und high der Agent API nutzen jetzt Fast Search für das Tool web_search, wodurch die Kosten von 2,50 auf 1 Dollar pro 1 000 Aufrufe sinken und die Suche etwa 800 ms schneller wird; die Voreinstellung xhigh behält die Standardsuche. 🔗 Quelle
  • RAG-Leitfaden von Perplexity — Perplexity veröffentlicht einen Leitfaden mit neun Beispielen für Retrieval-Augmented Generation (retrieval-augmented generation, RAG) und sieben Architekturen und verweist dabei für seinen Webindex und seine Funktion Instant Buy auf sich selbst, neben Beispielen anderer Anbieter wie Zendesk oder GitHub Copilot; keine Produktneuheit. 🔗 Quelle
  • Mitarbeiterzahl von Cohere — Laut Cohere ist das Unternehmen von rund 400 Beschäftigten zu Beginn des Jahres 2026 auf heute mehr als 800 gewachsen; die Zahl stammt aus einer Recruiting-Nachricht. 🔗 Quelle
  • IsoVGRBench und Logbook bei Meta — Ohne Ankündigung veröffentlicht facebookresearch den Code von IsoVGRBench, das Reward-Modelle für Videos anhand von 16 000 Paaren bewertet, die sich nur in einem Aspekt unterscheiden (beim Vergleich mit demselben Clip mit durcheinandergewürfelten Frames antworten diese Modelle nahezu zufällig), sowie den Code von Logbook, das sich mit Ereignissen in sehr langen Audioaufnahmen befasst. 🔗 Quelle
  • FiftyOne liest Datensätze im Format LeRobot v3 — Laut einem Community-Beitrag von Harpreet Sahota liest das Open-Source-Toolkit FiftyOne das Format LeRobot v3 jetzt nativ, ohne Konverter oder Kopieren der Videos; die Demonstration umfasst 497 Episoden aus den 50 Robotertypen des Community-Datensatzes von LeRobot. 🔗 Quelle
  • FetchMan-data von Ai2 — Dieser am 1. Oktober ohne Ankündigung veröffentlichte Datensatz umfasst 352 696 simulierte Episoden (52 Millionen Frames, 902 Anweisungen), in denen ein humanoider Unitree G1 Objekte greift, erzeugt in MolmoSpaces, im Format LeRobot v3 und unter der Lizenz ODC-BY. 🔗 Quelle
  • P(doom) auf Profilen von Hugging Face — Nutzer des Hubs können auf ihrem Profil ihren P(doom) anzeigen, ihre Einschätzung der Wahrscheinlichkeit, dass KI eine existenzielle Katastrophe verursacht; die Antworten fließen in eine Umfrage ein, von der in zwei Wochen ausschließlich aggregierte und anonymisierte Ergebnisse veröffentlicht werden. 🔗 Quelle
  • Erweiterung hf-image — Hugging Face stellt ohne Ankündigung eine Erweiterung seiner CLI bereit, die Container-Images über seine Registry cr.hf.co baut, pusht, pullt und startet; unkomprimierte Layer werden durch Xet dedupliziert, sodass ein 2 GB großer Layer, an dem 100 MB geändert wurden, laut README nur etwa 100 MB überträgt. 🔗 Quelle
  • Drei Experimente von Milos Kotlar — In drei Community-Beiträgen macht Milos Kotlar den KV-Cache eines kleinen Transformers 2,71-mal kompakter, bei 97,85 % Übereinstimmung beim nächsten Token, und senkt den Anteil der Tokens ohne Experten bei einem MoE-Routing von 13,84 % auf 8,09 %, ohne jeglichen Geschwindigkeitsgewinn. 🔗 Quelle
  • Audit eines LLM-Judges durch Stephen Yu — Stephen Yu hat anhand von 38 400 Stichproben den GLM-5.3-Judge untersucht, der die Faktentreue innerhalb der GRPO-Belohnung seines 12B-Modells zum Umschreiben bewertet: zuverlässig beim Erkennen einer geänderten Tatsache, verrauscht bei der Einschätzung der Schwere der Änderung; das Zählen fehlerhafter Ausgaben zeigt einen Rückgang von 39 %, den die erste Zählung verdeckte. 🔗 Quelle
  • Symposium von Sakana AI in Tokio — Sakana AI öffnet die Anmeldung für ein kostenloses Symposium am 26. Oktober in der Hitotsubashi Hall in Tokio, auf Englisch, mit einem Vortrag von Jürgen Schmidhuber und einem Gespräch mit David Ha, CEO von Sakana AI. 🔗 Quelle
  • Startups von NVIDIA Inception und Brustkrebs — NVIDIA stellt vier Startups seines Inception-Programms vor, die KI im Versorgungsprozess einsetzen, darunter iSono Health und sein von der FDA zugelassenes 3D-Ultraschallgerät ATUSA (etwa zwei Minuten pro Brust gegenüber bis zu 45 Minuten bei manueller Untersuchung), Whiterabbit.ai, Ataraxis AI und SimBioSys; einige dieser Technologien sind nicht von der FDA zugelassen. 🔗 Quelle

Was das bedeutet

Die Angabe der Textherkunft wird zur regulatorischen Pflicht. Bisher betraf die Rückverfolgbarkeit generierter Inhalte vor allem Bilder und Audio, mit überprüfbaren Wasserzeichen und Metadaten; der AI Act erweitert die Anforderung auf Text, und OpenAI reagiert schrittweise darauf: standardmäßig angewendete Wasserzeichen für Text von ChatGPT und Codex in der Europäischen Union, eine optionale Einstellung in der API, ein Detektor, der zugelassenen Organisationen vorbehalten ist. Die veröffentlichten Zahlen erklären diese Vorsicht: Rund 95 % der Passagen mit 400 Tokens werden bei Inhalten aus dem Bereich Psychologie erkannt, bei einer angestrebten Falsch-Positiv-Rate von 1 %, doch bei englischen Passagen mit 400 Tokens sinkt die Erkennungsrate von rund 92 % auf 66 %, wenn 10 % der Wörter durch Synonyme ersetzt werden, und ein Umschreiben oder eine Übersetzung kann das Wasserzeichen entfernen. Das Wasserzeichen liefert einen Hinweis auf die Herkunft, keinen Beweis, und sein Fehlen sagt nichts über den Autor aus.

Das Gedächtnis der Agenten etabliert sich und beginnt sich zu standardisieren. Devin hält seine Erkenntnisse in einem Git-Repository mit Markdown-Dateien fest, das Dreaming täglich neu organisiert, und Cognition veröffentlicht das Format unter der MIT-Lizenz, damit andere Agenten es übernehmen können; North 2 bewahrt den Kontext von einer Sitzung zur nächsten; Qwen Code bindet Mem0 direkt an seine CLI an. Die Ansätze unterscheiden sich zwischen versionierten, für Menschen lesbaren Dateien, einem externen Memory-Dienst und einer in eine Plattform integrierten Funktion, erfüllen aber denselben Bedarf: Ein Agent soll nicht bei jeder Sitzung wieder bei null anfangen. Die Entscheidung von Cognition hat einen praktischen Vorteil: Jede Notiz verweist auf die Sitzung, in der die Erkenntnis gewonnen wurde, lässt sich in der Oberfläche einsehen und behält ihre Git-Historie, sodass man nachlesen und korrigieren kann, was sich der Agent gemerkt hat.

Offene Modelle finden auf mehreren Wegen Eingang in Coding-Tools. Together Link bindet sie an bestehende Agenten an, einschließlich Claude Code und Codex, und gibt dabei um mehr als die Hälfte reduzierte Kosten an; IBM betreibt die selbst gehostete Version von Bob auf Nemotron 3 Ultra für Unternehmen, die ihre Entwicklung auf eigener Infrastruktur halten, bis hin zu Umgebungen ohne Netzverbindung; Reflection AI stellt Beam als offenes Modell vor, das auf Code und agentische Aufgaben zugeschnitten ist, mit 80,9 auf SWE-bench Verified laut den eigenen Tabellen. Das gemeinsame Argument liegt weniger im reinen Score, bei dem Reflection AI einräumt, dass Kimi K3 weiterhin vorn liegt, als in Kosten, Latenz und Datenkontrolle.

Viele der heutigen Zahlen stammen von denjenigen, die sie veröffentlichen. GitHub hat ReviewBench entwickelt und die erste Rangliste erstellt, in der Copilot code review an der Spitze steht, ohne Ausführung oder Überprüfung durch die anderen Anbieter; die Latenz von Nemotron 3 Ultra stammt aus internen Tests von IBM; die Einsparungen von Together Link und die Werbeergebnisse von ChatGPT sind Angaben von Together AI und OpenAI. GitHub veröffentlicht allerdings seinen Datensatz, seinen Judge und seine Methodik und lässt Einreichungen zu: Jeder Anbieter kann die Messung mit seinem eigenen Agenten wiederholen. So wird sich zeigen, ob diese erste Rangliste Bestand hat.


Quellen