ai-powered-markdown-translatorArtikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.
Google Cloud hat am 8. Oktober auf der Gemini at Work 2026 den Gemini-Agenten vorgestellt: einen einzigen Agenten für die gesamte Arbeit im Unternehmen, der kontinuierlich in der Cloud läuft und sowohl Gemini- als auch Claude-Modelle orchestriert. HeyGen veröffentlicht seinerseits HeyGen Voice, sein erstes selbst entwickeltes Sprachmodell, das die Spitze des Controlled Voice-Rankings von Artificial Analysis übernimmt. Gleichzeitig stellt Anthropic in Claude Managed Agents Workflows bereit, die bis zu 1 000 Agenten pro Ausführung starten können. Beim Programmieren lernt Codex, die nächste Nachricht des Nutzers vorherzusagen, und erhält unter Windows eine neue Sandbox auf Basis der Microsoft Execution Containers.
Google Cloud stellt den Gemini-Agenten vor, einen einzigen Agenten für die gesamte Arbeit
8. Oktober — Auf der Gemini at Work 2026 hat Google Cloud den Gemini-Agenten vorgestellt, den das Unternehmen als einen einzigen, universellen Agenten für die Arbeit beschreibt. Über ein einziges Eingabefeld und eine einzige API beantwortet er Fragen, übernimmt Wissensarbeit, erstellt Bilder und Medien und schreibt und führt Code aus. Die Idee, die Thomas Kurian, CEO von Google Cloud, vertritt: Man gibt ihm ein Ziel statt einer Abfolge von Anweisungen.
Der Agent läuft kontinuierlich in der Cloud, mit einem einzigen Gedächtnis, und ist überall verfügbar: im Web, auf iOS, Android, Windows und Mac, über die Kommandozeile, in Google Workspace, Microsoft 365 und Slack oder ohne Benutzeroberfläche (headless) in Anwendungen von Drittanbietern. Eine Aufgabe, die mehrere Stunden oder Tage dauert, läuft auch bei geschlossenem Computer weiter. Für längere Arbeiten erstellt er temporäre Unteragenten mit jeweils eigener Identität. Er kann auch zu einem Kollegen-Agenten (coworker agent) mit einer dauerhaften Rolle, seiner eigenen Adresse @agents.company.com und seinem eigenen Speicher werden. Das Modell wird unabhängig davon ausgewählt: Laut Google orchestriert der Agent bereits Gemini-Modelle und die Claude-Modelle von Anthropic; weitere private und offene Modelle sollen folgen. Branchenspezifische Varianten erscheinen als Vorabversion für den Finanzbereich (mehr als 50 grundlegende Skills, die bereits von CME Group und Deutsche Bank genutzt werden) und den Rechtsbereich.
| Angekündigte Kontrollkomponente | Von Google beschriebene Rolle |
|---|---|
| Identität jedes Agenten | Kryptografisch attestierte Identität, rollenbasierte Berechtigungen, Audit-Protokoll unter seinem Namen |
| Agent Sandbox | Isolierte Ausführung mit eigener Netzwerkgrenze |
| Agent Gateway | Netzwerk-Firewall für KI, durch die der gesamte Datenverkehr des Agenten läuft |
| Ausgabenlimits in Echtzeit | In Cloud Billing wird der Agent des Projekts pausiert, Fortsetzung mit einem Klick |
Google Cloud nennt außerdem seine Zahlen: Fast 500 Kunden haben innerhalb eines Jahres jeweils mehr als 1 000 Milliarden Tokens verarbeitet, und fast 90 % der Fortune 100 nutzen Gemini Enterprise. Der Beitrag nennt allerdings weder einen Verfügbarkeitstermin noch einen Preis für den Agenten selbst; Google Cloud verweist lediglich auf große Kunden, die ihn vorab getestet haben, etwa die Sportmarke On für die dynamische Modellauswahl.
🔗 Gemini at Work 2026 (Google Cloud-Blog)
Gemini Enterprise macht Claude Opus 5.5 und Claude Sonnet 5.5 für die Antigravity-Tools verfügbar
8. Oktober — Am selben Tag ermöglichen die Versionshinweise von Gemini Enterprise Administratoren, Claude Opus 5.5 und Claude Sonnet 5.5 in Antigravity 2.0, der Antigravity CLI und den Antigravity-Erweiterungen für IDEs zu aktivieren. Der Administrator akzeptiert deren Nutzungsbedingungen direkt in der Google Cloud-Konsole, ohne separates Anthropic-Konto.
| Aktivierungsparameter | Von Google angegebener Wert |
|---|---|
| Standardzustand | Modelle von Drittanbietern deaktiviert, Aktivierung durch Administratoren |
| Abrechnungsmodus | Nutzungsabhängig, innerhalb des Ausgabenlimits des Projekts |
| Inferenzstandorte | global, us und eu |
| Denkstufen | Low, Medium (Standard), High oder Max |
Der Entwickler behält seine Gemini Enterprise-Lizenz und wählt Claude in der Modellauswahl aus. Mehrverbrauch (overages) muss aktiviert werden, bevor ein Modell eines Drittanbieters freigeschaltet wird. Dessen Kosten fließen in das gemeinsame Limit für alle Modelle ein. Dieselbe Seite kündigt die allgemeine Verfügbarkeit von Gemini 3.8 Flash in Singapur an.
🔗 Versionshinweise zu Gemini Enterprise
Stimmen: HeyGen Voice an der Spitze des Controlled Voice-Rankings, Mistral veröffentlicht zwei Modelle für Arabisch
9. Oktober — HeyGen veröffentlicht HeyGen Voice, das Joshua Xu als erstes intern entwickeltes Sprachmodell des Unternehmens vorstellt, das bislang für seine Avatare bekannt war. Das Modell ist in HeyGen und über die API für 30 Dollar pro Million Zeichen verfügbar; bis zum 31. Oktober zahlen API-Nutzer 15 Dollar, wobei der Rabatt automatisch angewendet wird.
Das Argument dafür liefert Artificial Analysis, das seine Ergebnisse eineinhalb Minuten vor HeyGen veröffentlicht hat. Im Controlled Voice-Ranking, in dem alle Modelle mit denselben 8 geklonten Stimmen in amerikanischem und britischem Englisch sprechen, übernimmt HeyGen Voice mit einem Elo von 1 201 bei 1 468 Auftritten den ersten Platz. Dort liegt es in den Kategorien Assistenten und Kundenservice sowie im britischen Englisch vorn.
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇩🇪 HeyGen Voice übernimmt den ersten Platz im Controlled Voice TTS Arena-Ranking von Artificial Analysis, vor Qwen-Audio-3.1-TTS-Plus von Alibaba und Eleven v4 Turbo von ElevenLabs. — @ArtificialAnlys auf X
| Bewertetes Modell | Elo Controlled Voice (9. Oktober) | API-Preis pro Million Zeichen |
|---|---|---|
| HeyGen Voice | 1 201 | 30 Dollar (15 bis zum 31. Oktober) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3 Dollar |
| Eleven v4 Turbo | 1 166 | 40 Dollar |
| Eleven v4 | 1 162 | 80 Dollar |
Dieser erste Platz gilt für einen klar umrissenen Bereich: das Klonen von Stimmen. Im Provider Voice-Ranking, in dem jeder Anbieter seine eigenen Stimmen verwendet, lagen Eleven v4 Turbo und Eleven v4 am Abend des 9. Oktober weiterhin vorn; HeyGen Voice war nicht unter den ersten acht. Bei der Aussprachezuverlässigkeit erreicht HeyGen Voice 83,1 %, also den 10. Platz von 29.
Über die API erfolgt das Klonen sofort: Eine einzige Aufnahme, von der nur die ersten drei Minuten verwendet werden, liefert in wenigen Sekunden eine einsatzbereite Stimme, ohne Training. Die Synthese erfolgt in einem Stück (WAV-Datei mit 44,1 kHz) oder als Stream. Artificial Analysis hat die Standardeinstellungen der API bewertet.
Voxtral Mini 4B Realtime Arabic und LIDstral Arabic: zwei Modelle von Mistral für Arabisch
8. Oktober — Mistral hat ohne Ankündigung zwei offene Modelle unter Apache 2.0-Lizenz für Arabisch auf Hugging Face veröffentlicht. Voxtral Mini 4B Realtime Arabic transkribiert arabische Dialekte und modernes Hocharabisch als Stream, auch wenn Sprecher mitten im Gespräch die Sprache wechseln (code-switching). Es wurde auf Basis von Voxtral Mini 4B Realtime feinabgestimmt und umfasst rund 4,4 Milliarden Parameter. Laut seiner Modellkarte wurde es gemeinsam mit dem marokkanischen Ministerium für digitalen Wandel und Verwaltungsreform entwickelt, im Rahmen der im Januar 2026 unterzeichneten Partnerschaft zwischen Mistral und Marokko, aus der auch zwei neue Benchmarks hervorgegangen sind: ISMA und Darija in the Wild.
| Veröffentlichtes Modell | Funktion des Modells | Ergebnis laut Modellkarte |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | Streaming-Transkription von Arabisch | Durchschnittliche Zeichenfehlerrate von 8,82 % auf 7 Benchmarks bei 480 ms, gegenüber 7,91 % für Voxtral Transcribe Arabic |
| LIDstral Arabic | Erkennung von Sprache und Dialekt, 51 Klassen, auf der CPU | F1 von 88,67 % für marokkanisches Darija, gegenüber 71,28 % für GlotLID v3 |
🔗 Voxtral Mini 4B Realtime Arabic auf Hugging Face · LIDstral Arabic auf Hugging Face
Claude Managed Agents: dynamische Workflows mit bis zu 1 000 Agenten pro Ausführung
9. Oktober — Anthropic stellt die dynamischen Workflows (dynamic workflows) von Claude Managed Agents als öffentliche Beta bereit, eine neue Art der Multiagent-Orchestrierung. Der Agent, der die Sitzung leitet, schreibt selbst ein Programm, das der Server im Hintergrund ausführt. Dabei startet er zahlreiche Agenten in mehreren Phasen und kombiniert anschließend ihre Ergebnisse. Sobald der Typ multiagent_20261001 aktiviert ist, entscheidet der Agent selbst, eine Ausführung zu starten.
Eine Ausführung startet bis zu 1 000 Agenten, davon 64 gleichzeitig, läuft standardmäßig 24 Stunden, und eine Sitzung kann 10 solcher Ausführungen offen halten. Ihre Tokens werden wie die der Sitzung abgerechnet und zählen zu deren Budget; Anthropic weist darauf hin, dass es viele sein können, und nennt einen internen Test mit 70 absichtlich eingebauten Bugs in einer Codebasis mit 116 000 Zeilen.
| Testkonfiguration von Anthropic | Gefundene Bugs in 3 Versuchen |
|---|---|
| Einzelner Agent | 14, 15 und 27 |
| Dynamischer Workflow | 66 in jedem Versuch |
🔗 Ankündigung von @ClaudeDevs · Dokumentation der Workflow-Ausführungen
Coding-Agenten: Nachrichtenvorhersagen und MXC-Sandbox für Codex, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex erhält am selben Tag zwei Neuerungen, während Anthropic und Mistral neue Versionen ihrer Kommandozeilen-Agenten veröffentlichen.
Codex sagt die nächste Nachricht des Nutzers voraus, als Beta für Pro-Abonnenten
9. Oktober — OpenAI stellt die Eingabefeldvorhersagen (composer predictions) in der Codex-Desktop-App als Beta bereit. Wenn Codex seine Antwort beendet hat, kann im Eingabefeld ein Vorschlag für die nächste Nachricht erscheinen, der aus dem aktuellen Gesprächsverlauf erstellt wird, ohne auf Erinnerungen oder verbundene Anwendungen zuzugreifen. Die Tab-Taste fügt ihn ein; der Text bleibt bearbeitbar und wird niemals automatisch gesendet. Der Vorschlag betrifft eine vollständige Nachricht, keine wortweise Vervollständigung.
| Bedingung der Beta | Von OpenAI angegebener Wert |
|---|---|
| Tarif und Alter | Persönliches ChatGPT Pro, ab 18 Jahren |
| Gesprächsverläufe und Modelle | Lokale und SSH-Gesprächsverläufe, mit GPT-6 Astra oder GPT-6.1 Sol |
| Standardeinstellung | Aktiviert, deaktivierbar unter General > Composer > Show predictions |
| Kosten während der Beta | Außerhalb der Codex-Nutzungslimits, kein Verbrauch von Credits |
Gesendete Nachrichten, einschließlich akzeptierter Vorhersagen, werden weiterhin regulär angerechnet. Die Funktion ist in Chat nicht verfügbar.
🔗 Ankündigung von @OpenAIDevs · Hilfeartikel von OpenAI
Codex unter Windows: eine Sandbox auf Basis der Microsoft Execution Containers
9. Oktober — OpenAI ergänzt Codex unter Windows um einen Sandbox-Modus auf Basis der Microsoft Execution Containers (MXC), die Microsoft am 7. Oktober allgemein verfügbar gemacht hat. Er erfordert ein kompatibles Windows 11-Gerät (24H2 Build 26100.9278 oder 25H2 Build 26200.9278) und verspricht eine schnellere Einrichtung, eine strengere Netzwerkkontrolle und feiner abgestimmte Dateizugriffe.
Laut Dokumentation wird MXC zur empfohlenen Implementierung: Es isoliert Prozesse nativ, ohne eine von einem Administrator genehmigte Konfiguration, ohne zusätzliche Windows-Konten und ohne lokale Firewall-Regeln. Die Modi elevated und unelevated werden zu älteren Ausweichlösungen. Die Desktop-App wählt MXC für Privatkonten automatisch aus; in der CLI oder im Unternehmen wird es mit prefer_mxc = true in config.toml aktiviert, und ein Administrator kann es mit allow_mxc = false blockieren. Zwei Einschränkungen sind dokumentiert: Das verwaltete Netzwerk erfordert allow_local_binding = true, und verbleibende Kindprozesse werden beendet, sobald der Befehl im Vordergrund abgeschlossen ist.
🔗 Ankündigung von @OpenAIDevs · Dokumentation der Windows-Sandbox
Claude Code 2.1.296: eigene Compaction für Unteragenten und ein einheitliches Modell für Workflow-Agenten
9. Oktober — Claude Code 2.1.296 umfasst 79 Einträge, darunter 56 Fehlerbehebungen, und wurde von keinem Tweet begleitet. Die Version bietet vor allem mehr Kontrolle über Unteragenten.
| Neuerung der Version | Was sie ändert |
|---|---|
autoCompactWindow (Unteragenten, --agents) | Ein Unteragent komprimiert seinen Kontext früher als die Hauptkonversation |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | Alle Agenten eines Workflows verwenden dasselbe Modell, die anderen Unteragenten behalten ihr eigenes |
Option allow_large von Read | Lesen einer großen Textdatei mit einem einzigen Aufruf, sofern der Kontext es erlaubt |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | Längere maximale Wartezeit zwischen zwei Wiederholungsversuchen nach einem Fehler 529 |
| Sofort übermittelte Beschreibungen von MCP-Tools | Standardlimit von 2 048 auf 4 096 Zeichen erhöht |
/cost und die Statuszeile rechnen Cache-Lesevorgänge von Sonnet 5.5 nun mit 0,10 Dollar pro Million Tokens ab. Im Sicherheitsbereich behebt die Version Fehler bei verwalteten PreToolUse-Hooks, die einen Aufruf ablehnten, ohne den Turn zu beenden, bei Bash-Prüfungen, die bestimmte Befehle mit BASH_ARGV0 automatisch genehmigten, bei Cloud-Sitzungen, die bei Aktionen von Claude in Chrome die Prüfungen des Auto-Modus übersprangen, sowie bei Änderungen durch Edit und NotebookEdit, die alle Nicht-ASCII-Zeichen in Dateien ohne UTF-8-Kodierung ersetzten und nun abgelehnt werden.
🔗 Claude Code 2.1.296 auf GitHub
Vibe CLI 2.26.1: lokales Devstral-Modell entfernt, erweiterter nicht interaktiver Modus
9. Oktober — Drei Tage nach Version 2.26.0 und ohne Tweet veröffentlicht Mistral Vibe CLI 2.26.1. Trotz ihrer Patch-Versionsnummer umfasst die Version 85 Einträge (23 Ergänzungen, 24 Änderungen, 36 Fehlerbehebungen, 2 Entfernungen), davon 37 für die neue Oberfläche in Rust. Sie entfernt das bisher mitgelieferte lokale Devstral-Modell: Eine Konfiguration, die es weiterhin fest vorgibt, wechselt mit einer Warnung zum standardmäßig gehosteten Modell zurück. Dieses bietet nur noch zwei Denkstufen, off und high, und gibt ein Kontextfenster von 256k an, an dem sich die automatische Compaction orientiert.
Der nicht interaktive Modus vibe -p erhält ein Zeitlimit, das Einlesen des Prompts aus einer Datei oder der Standardeingabe, einen bei jedem Beenden geschriebenen Bericht export.json und unterschiedliche Exit-Codes: 1 für einen Bedienungs- oder Konfigurationsfehler, 2 für einen Infrastrukturfehler, 3 für ein erreichtes Limit oder eine Ablehnung durch das Modell. Die Rust CLI ergänzt /proxy-setup, einen Sprecher, der die Zusammenfassung jeder Runde laut vorliest, /plugins und /whoami. Neue Einstellungen verbieten dem Agenten Hintergrundprozesse oder Subagenten, und der Document Library-Connector bleibt standardmäßig deaktiviert.
🔗 Versionshinweise zu Vibe CLI 2.26.1
Generative Bilder, Videos und Spiele: Qwen-Image-2.1-Turbo, Thinking-Modus von Midjourney, Syren von Synthesia, Playground von Google
Ein schnelleres und günstigeres Bildmodell, ein Generator, der seine Ergebnisse überprüft, ein Agent, der Videos schneidet, und eine Spieleplattform ohne Code.
Qwen-Image-2.1-Turbo: 8 Denoising-Schritte und 0,016 Dollar pro Bild
9. Oktober — Qwen veröffentlicht Qwen-Image-2.1-Turbo, einen beschleunigten Checkpoint (accelerated checkpoint) von Qwen-Image-2.1, der Bilder in 8 Denoising-Schritten erzeugt und bearbeitet, auf derselben Architektur mit 7 Milliarden Parametern. Laut Qwen erzeugt er weiterhin 2K-Bilder und akzeptiert Bearbeitungsanweisungen in natürlicher Sprache, doch es werden keine spezifischen Zahlen zur Qualität oder Geschwindigkeit dieser Version veröffentlicht. Die Gewichte sind auf Hugging Face und ModelScope unter der Qwen-Forschungslizenz (Qwen Research License) verfügbar. Der Checkpoint enthält seinen Sampling-Zeitplan mit 8 Schritten und läuft standardmäßig mit einem CFG von 1.
Am selben Tag gibt Qwen die APIs für Qwen-Image-2.1 Pro und Turbo offiziell frei; QwenCloud erlaubt für Turbo 120 Anfragen pro Minute.
| Über die API bereitgestelltes Modell (Model Studio) | Preis pro Bild | Kostenlose Bilder |
|---|---|---|
| qwen-image-2.1-turbo | 0,016 Dollar | 10 |
| qwen-image-2.1-pro | 0,04 Dollar | 10 |
| qwen-image-2.0-pro | 0,075 Dollar | 100 |
🔗 Ankündigung von Qwen · Modellkarte auf Hugging Face
Midjourney testet einen Thinking-Modus und gibt geteilte Ordner auf seiner Alpha-Website frei
8. Oktober — Das am Abend veröffentlichte Alpha-Changelog von Midjourney stellt zwei Funktionen in einer frühen Version vor, die vorerst der Website alpha.midjourney.com vorbehalten sind. Die erste ist ein Test: Bei einem mit V8.2 erzeugten oder bearbeiteten Bild fordert der Button Rerun (Thinking) das Modell auf, das Ergebnis zu betrachten, Abweichungen vom Prompt zu erkennen (Objekte, Layout, Anatomie, Text) und erneut zu generieren. Midjourney berichtet von besseren Ergebnissen bei der Prompt-Treue, Typografie und Konsistenz und erwägt, daraus einen allgemeinen Modus zu machen.
Die zweite Funktion ist das Teilen von Ordnern: Man lädt Mitwirkende ein, die direkt im Ordner generieren, oder Leser, und kann den Ordner per Link teilen oder sogar für alle Midjourney-Mitglieder öffnen. Midjourney stellt klar, dass das Teilen die Sichtbarkeit der Bilder nicht verändert: Ohne Stealth-Modus können sie weiterhin in Explore und auf Profilen erscheinen.
🔗 Alpha-Changelog von Midjourney · Test des Thinking-Modus (Midjourney)
Syren: Synthesia übergibt die Videoerstellung einem Agenten, in der Beta
9. Oktober — Synthesia startet Syren als Beta für alle Kunden, einschließlich kostenloser Konten. Man beschreibt das gewünschte Video oder stellt Dokumente, Bilder, Videos, PowerPoint-Präsentationen oder YouTube-Links bereit, und Syren liefert ein fertiges Video mit animierten Grafiken (motion graphics), Avataren, Voiceover, Musik und Schnittbildern (b-roll), das sich anschließend im Gespräch korrigieren lässt. Laut Peter Hill, dem technischen Leiter von Synthesia, schreibt der Agent das gesamte Video als Code, den eine hauseigene Rendering-Engine in Echtzeit abspielt; diese wird seit Juni für die Animationen von Synthesia verwendet.
Die Videos sind bis zu 3 Minuten lang, im Quer- oder Hochformat, und werden im Browser gerendert. Die Abrechnung erfolgt über Credits, ohne detaillierte Preisangaben, und Enterprise-Administratoren können das Tool deaktivieren. Das automatische Erlernen der Markenidentität aus vorhandenen Videos wird im Beitrag für die nahe Zukunft angekündigt. Syren erscheint vier Tage nach HyperFrames Studio von HeyGen und einen Tag nach Claude Motion von Anthropic, zwei weiteren Tools, bei denen ein Agent das Video erstellt.
🔗 Vorstellung von Syren (Synthesia)
Playground: Google öffnet eine Plattform zur Spieleentwicklung ohne Programmieren
7. Oktober — Google startet Playground, eine experimentelle Spieleplattform, auf der man Spiele erstellt, spielt und teilt, indem man sie mit wenigen Prompts beschreibt, ohne Code zu schreiben. In einer dialogbasierten Oberfläche beginnt man mit einer leeren Seite, einem Beispiel zum Abwandeln oder einer geführten Anleitung und passt anschließend auf Anfrage die Physik, Regeln, Figuren oder Umgebung an.
Die Spiele laufen im Browser, auf dem Smartphone ebenso wie auf dem Computer, und können privat bleiben, per Link geteilt oder in die Explore-Galerie aufgenommen werden, bei einigen Genres mit Ranglisten und Mehrspielermodus; jedes veröffentlichte Spiel durchläuft eine Sicherheitsprüfung. Playground ist in den USA für Personen ab 18 Jahren verfügbar, wobei die Berechtigungen zur Erstellung vom Google AI-Abonnement abhängen. Eine Integration mit Unity Spark für anspruchsvollere 3D-Spiele wird als geschlossene Beta für die nahe Zukunft angekündigt. Google nennt nicht das Modell, das die Plattform antreibt.
🔗 Vorstellung von Playground (Google-Blog)
Gesundheit: klinische Studie zu AMIE in The Lancet veröffentlicht
8. Oktober — Google und das Beth Israel Deaconess Medical Center (BIDMC) veröffentlichen in The Lancet eine prospektive Machbarkeitsstudie zu AMIE (Articulate Medical Intelligence Explorer), Googles dialogbasierter Diagnose-KI; laut Google ist dies ihre erste Veröffentlichung im Hauptjournal von The Lancet. Patienten tauschten sich bis zu fünf Tage vor einem dringenden Arzttermin mit AMIE aus, und der Arzt erhielt anschließend das Transkript und eine Zusammenfassung.
| Messgröße der Studie | Veröffentlichtes Ergebnis |
|---|---|
| Eingeschlossene Patienten (April bis November 2025), anschließend nachbeobachtet | 114, anschließend 98 |
| Abbrüche aus Sicherheitsgründen | 0 |
| Festgestellte Halluzinationen | 1 |
| AMIE laut Arzt hilfreich zur Vorbereitung des Termins | 33 von 44 Fällen (75 %) |
| Mit der endgültigen Diagnose übereinstimmende Diagnosen (Google) | 90 % |
Die Studie wurde an einem einzigen Standort, ohne Kontrollgruppe und mit Finanzierung durch Alphabet durchgeführt und stellt weder eine Zulassung noch einen Einsatz in der Praxis dar: Die Autoren fordern größere Studien.
🔗 Beitrag von Google · Der Artikel in The Lancet
Forschung bei OpenAI: die Antwort auf den Brief dreier Forscher, von denen sich das Unternehmen getrennt hat
9. Oktober — In einer auf @OpenAINewsroom im Namen seiner Forschungsleiter veröffentlichten Stellungnahme antwortet OpenAI auf den Brief dreier Forscher, von denen sich das Unternehmen nach eigenen Angaben in der Vorwoche getrennt hat. Laut OpenAI ergab eine interne Untersuchung, dass sie gegen klare Regeln zum Umgang mit sensiblen Informationen verstoßen hatten, mit einem Vertrauensbruch, der über die Darstellung in ihrem Brief hinausgeht; OpenAI hält an seiner Entscheidung fest. Das Unternehmen erklärt, dass diese Entscheidungen weder auf das Ansprechen von Sicherheitsbedenken noch auf eine öffentliche Äußerung zurückzuführen seien und dass es keine Mitarbeiter entlasse, weil sie Bedenken geäußert hätten.
Die Stellungnahme kündigt außerdem an:
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇩🇪 Wir arbeiten aktiv daran, Verträge mit externen Sicherheitsprüfern abzuschließen, und werden die Einzelheiten in den kommenden Wochen bekannt geben. — @OpenAINewsroom auf X
OpenAI stimmt dem Brief nach eigenen Angaben in einem Punkt zu: Die Überwachbarkeit (monitorability) von Frontier-Modellen zu bewahren, erfordert das Engagement der gesamten Branche, einschließlich OpenAI. Dieser Artikel gibt die Darstellung von OpenAI wieder; der Brief der Forscher wurde nicht eingesehen.
Offene Modelle entwickeln: sechs Modelle für rund 103 Dollar mit ML Intern, der GPU-Scheduler von Ai2
Zwei Erfahrungsberichte über die Entwicklung von Modellen: einer aus Sicht eines Agenten, der andere aus Sicht von Rechenclustern.
ML Intern: sechs offene Modelle für rund 103 Dollar Rechenkosten
8. Oktober — Der Modus ML Intern von HuggingChat, hier bereits am 1. und 8. Oktober aus anderen Blickwinkeln vorgestellt, erhält im Blog von Hugging Face eine erste zahlenbasierte Bilanz: sechs vollständig durchgeführte Projekte für insgesamt rund 103 Dollar Rechenkosten. Jedes beginnt mit einer Nachricht und endet mit einem öffentlichen Modell auf dem Hub, einschließlich Evaluation. Der Agent plant, bittet vor jeder kostenpflichtigen Rechenaufgabe um Erlaubnis, startet einen kurzen Test und trainiert, evaluiert und veröffentlicht anschließend auf der Hardware von Hugging Face.
| Von ML Intern erzeugtes Modell | Veröffentlichtes Ergebnis | Rechenkosten |
|---|---|---|
| Pocket Rewriter (0.8B) | 99,7 % gültige Ausgaben, etwa ein Viertel der Tokens des 9B-Rewriters von Qwen-Image 2.1 | Rund 16 Dollar |
| Citrus Doctor (Qwen3.5-2B) | Von 14,9 % auf 52,8 % korrekte Diagnosen von Zitruskrankheiten | Rund 1,90 Dollar |
| Zwei LoRA für Qwen-Image 2.1 | Änderung des Blickwinkels, Ersetzen einer Kritzelei durch das gewünschte Objekt | Rund 16 und 24,30 Dollar |
| Huggy LoRA (FLUX.2 klein) | Figuren-LoRA | Rund 7,60 Dollar |
| Agate 4 pas | Distillation eines kleinen Bildmodells, von 50 Schritten (100 Durchläufe mit Guidance) auf 4 | Rund 37 Dollar |
Der GPU-Scheduler von Ai2: mediane Wartezeit sinkt von 5 Minuten auf 24 Sekunden
9. Oktober — Ai2 beschreibt seinen neuen Scheduler für GPU-Cluster in einem Beitrag von Jeremy Tryba. Tausende NVIDIA H100-, B200- und B300-GPUs in Clustern mit 88 bis 1 024 GPUs werden dort von rund 150 Forschern gemeinsam genutzt, bei einer Nachfrage, die zwei- bis dreimal so hoch ist wie das Angebot. Das alte prioritätsbasierte System ließ GPUs durch leere Jobs „besetzen“ und führte dazu, dass alle Workloads schließlich die höchste Priorität erreichten.
Das neue System basiert auf GPU-Zeitbudgets, die entlang der Organisationsstruktur der Forschung verteilt werden, einer hierarchischen gerechten Verteilung (fair-share), die über die jeweils letzten sieben Tage berechnet wird, und einem „Scheduling-Vertrag“: Jeder Workload gibt eine geschützte Laufzeit von höchstens 8 Stunden an, nach der er unterbrochen und erneut in die Warteschlange gestellt werden kann. Nicht zugewiesene Zeit bleibt kostenlos, kann aber jederzeit entzogen werden.
| Von Ai2 gemessene Kennzahl | Alter Scheduler | Neuer Scheduler |
|---|---|---|
| Mediane Wartezeit, größter H100-Cluster | 5 Minuten | 24 Sekunden |
| p90-Wartezeit für Debugging-Workloads | 2 Stunden | 30 Sekunden |
| Bereitgestellte zugesagte GPU-Stunden über 30 Tage | — | 98 % |
Reparaturen, die menschliches Eingreifen erfordern, gehen um 74 % zurück. Ai2 räumt Grenzen ein, etwa interaktive Sitzungen, die nach 8 Stunden unterbrochen werden können, während sie zuvor eine Woche dauern konnten, und veröffentlicht keinen Code.
Entscheidungsmodelle: pplx-decider-v1.1-27b führt Decision Bench an, statistisch gleichauf mit neun weiteren
9. Oktober — Das bereits am 6. und 8. Oktober behandelte Entscheidungsmodell von Perplexity erhält ein externes Ergebnis. Auf Decision Bench, dem Open-Source-Benchmark von Atlan Frontier Labs (1 071 geschlossene Fragen, 36 Datensätze, 15 bewertete Modelle), erzielt pplx-decider-v1.1-27b den höchsten Rohwert von 94,5 % zu den niedrigsten Kosten von 0,017 Dollar pro 1 000 Entscheidungen. Die Website vergibt allerdings denselben Rang an Modelle, deren 95-%-Konfidenzintervalle sich überschneiden: Zehn Modelle teilen sich den ersten Platz.
| Auf Decision Bench evaluiertes Modell | Gemessene Genauigkeit | Kosten pro 1 000 Zeilen |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017 Dollar |
| DeepSeek V4.1 Flash | 94,2 % | 0,683 Dollar |
| Gemini 3.5 Flash | 94,2 % | 3,32 Dollar |
| Jev 1.13 | 93,8 % | 0,044 Dollar |
Perplexity veröffentlicht außerdem einen Praxisleitfaden (cookbook) für einen Browser-Agenten, bei dem der Code, niemals das Modell, über die Klicks entscheidet, und v1.1 ersetzt v1 in der API.
🔗 Thread von @perplexitydevs · Rangliste von Decision Bench
Grok Bot erhält eine eigene E-Mail-Adresse
9. Oktober — Grok Bot, der Agent von SpaceXAI, verfügt nun über eine eigene E-Mail-Adresse. Der Bot kann sie verwenden, um sich bei Diensten anzumelden, im Namen des Nutzers Unternehmen zu kontaktieren oder einen Termin mit jemandem zu vereinbaren. Die Funktion wird noch am selben Tag ausgerollt: Es genügt, den Bot um eine Adresse zu bitten oder @bot auf X zu erwähnen; in einem Team muss ein Administrator sie zuerst aktivieren.
Die Ankündigung besteht aus einem Thread des Kontos @bot, den @grok weiterverbreitet hat, ohne Beitrag auf x.ai. Sie nennt weder das Format noch die Domain der Adressen oder die betroffenen Tarife. Nach der eigenen Slack-Kennung für Team Bots Ende September erhält der Agent damit eine eigene Identität, um außerhalb der Plattform zu handeln.
ElevenLabs eröffnet in Singapur seinen Hub für Südostasien
8. Oktober — ElevenLabs gibt seinen Eintritt in Singapur offiziell bekannt, wo das Unternehmen ein Büro eröffnet, das als Hub für Südostasien und darüber hinaus für den asiatisch-pazifischen Raum dienen soll. Der Beitrag hebt die bereits vorhandene Infrastruktur hervor: Seit Juli können Unternehmen ihre Daten in Singapur hosten, mit Optionen ohne Datenspeicherung und geringerer Latenz in der Region.
ElevenLabs nennt vor allem seine regionalen Kunden: Funding Societies, das seine potenziellen Kunden in fünf Märkten mit dialogbasierter KI qualifiziert, Boost Bank in Malaysia, Salmon Group auf den Philippinen, MNC Group in Indonesien oder Rezonate, eine Gesundheitsplattform, die von 60 % der öffentlichen Krankenhäuser Singapurs genutzt wird. Es werden keine Mitarbeiterzahlen genannt. Die Niederlassung folgt auf jene in Brüssel und Amsterdam Ende September und Anfang Oktober.
Kurzmeldungen
- Projects in Claude Code — Anthropic hat allen Pro- und Max-Abonnenten auf der Warteliste Zugang gewährt. Projects bleibt in der Beta: Die Warteliste bleibt offen, weitere Zugänge folgen je nach Kapazität, und die Funktion wird laut Dokumentation noch nicht für Team und Enterprise angeboten. 🔗 Quelle
- Leitfaden zur Automatisierung von Agenten — Ein Leitfaden auf claude.dev beschreibt eine Referenzimplementierung auf Claude Managed Agents, die nach einem Zeitplan Slack-Kanäle und GitHub-Pull-Requests ausliest und anschließend eine Zusammenfassung in Slack veröffentlicht. Er erläutert die sechs Komponenten und ihre Vorkehrungen gegen häufige Fehler, etwa eine unlesbare Quelle nicht als ruhigen Tag zu werten oder die Ausgabenobergrenze auf das 3- bis 5-Fache der Kosten einer normalen Ausführung festzulegen. 🔗 Quelle
- Block und Claude Fable — In einem von Anthropic veröffentlichten Interview erklärt Block, dass Claude Fable seine umfangreichen Code-Migrationen plant und dabei bis zu mehrere Dutzend Opus- oder Sonnet-Modelle steuert, sodass bei einer einzigen Migration bis zu tausend Pull Requests zusammengeführt werden; Merges und Produktivsetzungen bleiben Menschen vorbehalten, Deployments erfordern eine doppelte Freigabe. 🔗 Quelle
- Die Compliance API von Claude Enterprise — Ihre Konversationsendpunkte (endpoints) geben in der Beta und mit dem bestehenden Schlüssel auch die Konversationen aus der vereinheitlichten Claude-Umgebung zurück: Eine in einer Cloud-Sitzung fortgesetzte Konversation wird als eine einzige zurückgegeben, mit Claudes Arbeit in den Blöcken
tool_useundtool_result. 🔗 Quelle - Codex CLI 0.162.1 — Dieser Patch für 0.162.0 behebt einen TUI-Absturz bei mehrzeiligen asynchronen Fragen sowie Startfehler, die auftraten, wenn ein bereits laufender Hintergrundserver andere Funktionseinstellungen als die CLI hatte. 🔗 Quelle
- Plugins nach Rolle in ChatGPT Enterprise und Edu — Wenn die rollenbasierte Zugriffskontrolle (RBAC) aktiviert ist, legen Eigentümer und Administratoren den Plugin-Zugriff für jede Rolle fest: Available, Install oder Disabled für den Workspace und Default, damit eine benutzerdefinierte Rolle diese Einstellung übernimmt. 🔗 Quelle
- Sophos und OpenAI Daybreak — Laut dem Cybersicherheitsanbieter senken seine mit Daybreak entwickelten Agenten die durchschnittliche Reaktionszeit bei den von ihnen bearbeiteten Fällen von etwa 38 Minuten auf etwa 89 Sekunden, und 52 % seiner MDR-Fälle werden vollständig durch KI gelöst; destruktive Aktionen bleiben unter menschlicher Aufsicht. 🔗 Quelle
- Asana und der Navigationsagent von StackAI — Laut Asana hat GPT-6 Astra in Codex diesen Agenten in etwa einer Woche optimiert: Auf GPT-6.1 Sol kostet eine Testausführung 0,47 Dollar und dauert etwa vier Minuten, ist also 76-mal günstiger und 5-mal schneller als die ursprüngliche Produktionskonfiguration. 🔗 Quelle
- LegalOn und Codex — LegalOn Technologies gibt an, seine geschätzten täglichen Codex-Kosten um etwa 65 % gesenkt zu haben, indem es von GPT-5.5 im unbegrenzten schnellen Modus zu einer Aufgabenverteilung zwischen GPT-6 Luna, GPT-6.1 Sol und GPT-6 Astra wechselte, mit schnellem Modus auf Anfrage und Obergrenzen pro Abteilung und Person. 🔗 Quelle
- Gemini CLI v0.64.0-preview.1 — Diese Preview unterdrückt Fehlalarme der Warnung Untrusted Command Flags Detected bei harmlosen Shell-Befehlen: Optionen für reinen Lesezugriff sind ausgenommen, Shell-Variablen bleiben erhalten, und Schleifen sind erlaubt, wenn jeder Unterbefehl seine ALLOW-Regel hat. Am 9. Oktober erschien keine Nightly-Version, und die stabile Version bleibt v0.63.0. 🔗 Quelle
- Antigravity 2.22.0 — Plugins können ihre eigene Oberfläche im Seitenpanel anzeigen (UI Extensions), Konversationen lassen sich per Drag-and-drop zwischen den Abschnitten der Seitenleiste verschieben, und Zeitstempel zeigen den Monatsnamen an. 🔗 Quelle
- Gemini 3.7 Flash als veraltet eingestuft — In der Gemini API werden Aufrufe von
gemini-3.7-flashaufgemini-3.8-flashumgeleitet, und der alte Agentdeep-research-pro-preview-12-2025wird am 23. Oktober zugunsten vondeep-research-preview-04-2026oderdeep-research-max-preview-04-2026eingestellt. 🔗 Quelle - VST3- und AU-Plugins für Google Flow Music — Nachtrag zum 6. Oktober: Spaces, diese in natürlicher Sprache erstellten Instrumente und Effekte, lassen sich als Plugins für digitale Audioworkstations (Digital Audio Workstations) exportieren, etwa das Plugin No Chaser des Produzenten Khris Riddick-Tynes. 🔗 Quelle
- Google Earth AI und die öffentliche Gesundheit — Nachtrag zum 6. Oktober: Während der Ebola-Epidemie in der RDC konnte das Afrika-Büro der OMS mit einem Prototyp eines Agenten für georäumliches Schlussfolgern innerhalb weniger Minuten 48 gefährdete Ortschaften und mehr als 45 500 gefährdete Menschen ermitteln; das PDFM-Modell erkennt außerdem Gebiete mit Cholerarisiko bis zu 8 Wochen im Voraus. 🔗 Quelle
- Abrechnung von Copilot code review — Organisationseigentümer können die von ihren lizenzierten Mitgliedern angeforderten Reviews der Organisation in Rechnung stellen, der das Repository gehört, statt deren Kontingent zu belasten, sofern die kostenpflichtige Nutzung von AI Credits aktiviert ist. Außerdem können sie das Auslösen von Reviews auf Lizenzen beschränken, die von der Organisation oder dem Unternehmen bereitgestellt werden. 🔗 Quelle
- Copilot CLI 1.0.95 — Die nun stabile Version authentifiziert sich unter macOS über den nativen Broker von Microsoft Entra und greift bei Bedarf auf den Browser zurück; die Vorabversion 1.0.96-0 zeigt in der Zeitleiste an, wer über jede Berechtigung entschieden hat: der Benutzer, Assisted Permissions, eine Richtlinie oder die unbeaufsichtigte Rückfalloption. 🔗 Quelle
- GitHub MCP Server 2.0 — Nachtrag zum 6. Oktober: Der offizielle MCP-Server von GitHub gibt typisierte Ausgaben zurück, die durch Ausgabeschemas (output schemas) beschrieben werden, für Agenten in Code Mode oder Programmatic Tool Calling; sie werden nur Clients mit der MCP-Spezifikation 2026-07-28 oder neuer angekündigt. 🔗 Quelle
- Claude Haiku 5.5 in Genspark — Genspark stellt das Modell in AI Chat, Code Agent und Claw bereit und übernimmt dabei Anthropics Aussage, dass der Betrieb etwa 75 % günstiger als bei Haiku 4.5 sei, ohne einen eigenen Tarif oder Preis zu nennen. 🔗 Quelle
- Meta-Vorlage für VR in v0 — Meta veröffentlicht gemeinsam mit Vercel eine v0-Vorlage auf Basis des Immersive Web SDK: Man beschreibt ein Erlebnis, v0 programmiert es und zeigt eine Vorschau, und mit einem Klick wird es auf Vercel bereitgestellt, um es im Browser des Quest zu öffnen; Blick- und Handsteuerung der für Frühjahr 2027 erwarteten Meta VR Glasses werden bereits unterstützt. 🔗 Quelle
- v0 for teams — v0 zeigt in einem Video, wie man die Arbeit seiner Teamkollegen einsehen, ihren Konversationen beitreten und gemeinsam entwickeln kann; der Tweet hebt Funktionen hervor, die seit September schrittweise hinzugekommen sind, ohne einen neuen Tarif anzukündigen. 🔗 Quelle
- DeepSeek Harness 0.2.1-alpha.2 — Die 26. Vorabversion, weiterhin ohne stabile Version: Der Plugin-Katalog installiert die Pakete für Claude Code und Codex bei Bedarf, zwei experimentelle Plugins kommen hinzu (Git Worktrees, Übersetzung des Schlussfolgerns), und globale Anweisungen können aus einer gemeinsam genutzten AGENTS.md stammen. 🔗 Quelle
- OGX 1.5.0 — Das frühere Llama Stack, das im April umbenannt wurde und die Organisation meta-llama verlassen hat, ergänzt eine native Weiterleitung der API /v1/messages für DeepSeek und Fireworks AI, einen Text-Embeddings-Inference-Anbieter, die Websuche von Exa und Serply sowie den MCP-Client 2.x, mit vier Breaking Changes. 🔗 Quelle
- GenIA — Meta veröffentlicht ohne Ankündigung unter der nichtkommerziellen Lizenz CC BY-NC 4.0 den Code dieser gemeinsam mit dem Tübingen AI Center durchgeführten Arbeit: Sie rekonstruiert 3D-Objekte aus einem Bild, wenigen Ansichten oder einem Video, indem sie während der Inferenz den eingefrorenen Prior von SAM 3D Objects anpasst, ohne erneutes Training. 🔗 Quelle
- Tag decision-model auf dem Hub — Hugging Face gibt Entscheidungsmodellen ein eigenes Tag mit einem Symbol und einem Filter auf der Seite Models; GGUF-Dateien von Entscheidungsmodellen werden anhand ihrer llama.cpp-Metadaten automatisch gekennzeichnet. 🔗 Quelle
- Darwin-27B-ZTC-v2 — VIDRAFT kündigt an, dass die neue Version seines Bewertungsmodells unter Apache-2.0 mit einem Borda-Score von 89,58 die Spitze des System One Mosaic Benchmark (137 Benchmarks) erreicht, vor OpenJev-27B (87,50) und Jev 1.13 (85,05); eine von den Autoren gemeldete Rangliste, die sie als Momentaufnahme einer öffentlichen Tabelle präsentieren. 🔗 Quelle
- Die Konfidenz von Entscheidungsmodellen — Stephen Solka zeigt in einem Community-Beitrag, dass GPT-6 Luna Decisions bei Abfragen über OpenRouter auf 600 SHA-256-Prüfungen mit „stimmt nicht überein“ antwortet, bei 50 % Genauigkeit und 99,8 % durchschnittlicher Konfidenz; beim kausalen Schlussfolgern grenzt ein Schwellenwert von 99 % eine Auswahl mit 47 richtigen Antworten von 49 ein, deckt aber nur 8,2 % der Fälle ab. 🔗 Quelle
- openai-math in Umgebungen für Reinforcement Learning — FineEnvs überführt 369 der 405 in Lean formalisierten Ergebnisse aus der Veröffentlichung openai/math in Harbor-Umgebungen: Der Agent muss einen Satz in einer Lean-4-Sandbox beweisen, und Comparator gewährt die Belohnung nur für einen vollständigen Beweis der exakten Aussage; ein experimenteller Datensatz unter Apache-2.0. 🔗 Quelle
- JOSIE-2 — Gökdeniz Gülmez veröffentlicht den technischen Bericht zu dieser Familie mit 2B, 4B und 9B, die auf Basis von Qwen3.5 auf zwei Mac M4 mit etwa 3 000 ausgewählten Beispielen nachtrainiert wurde: Im Reasoning-Modus erreicht JOSIE-2-4B 95,5 auf ARC-Challenge (+12,1) und 69,2 auf TruthfulQA (+20,3), auf lediglich zwei Benchmarks. 🔗 Quelle
- Gradio 6.30 —
gr.Workflowerhält eine Anwendungsansicht, und der Befehl Run this node verwendet weiterhin aktuelle Ergebnisse vorgelagerter Knoten erneut, statt den gesamten Teilgraphen noch einmal auszuführen;gr.ImageEditorerhält den Alphakanal geladener Bilder. 🔗 Quelle - tokenizers 0.23.3 — Dieser Patch betrifft ausschließlich das Python-Paket und unterstützt
huggingface_hubv2, was laut Versionshinweisen die Installation von Transformers ermöglicht; außerdem nimmt er einen Breaking Change aus 0.23.1 bei der Trunkierung zurück. 🔗 Quelle - Wissenschaftliche Begutachtung durch KI — Sakana AI stellt einen bei TMLR angenommenen Artikel vor: Ein Benchmark fügt widersprüchliche Aussagen in Artikel ein, um zu prüfen, ob KI-Gutachter sie erkennen. Das System Multi-Layered Review entdeckt laut der Ankündigung von Sakana AI mehr davon als die anderen getesteten Systeme; Zahlen nennt die Ankündigung nicht. 🔗 Quelle
- Suno Studio — Clips richten sich besser am ersten Taktschlag aus und werden gestreckt, um dem Projekttempo zu folgen, Überblendungen können exponentiell oder logarithmisch verlaufen, und Synthesizer, Keyboard und Plugin-Ansichten lassen sich in separate Fenster auslagern, auch auf einen zweiten Bildschirm; Studio ist im Premier-Abonnement enthalten. 🔗 Quelle
- World Models’ Last Exam in Physics — Bei dieser Physikprüfung von Einsia für Videomodelle (40 Aufgaben, 9 Kategorien, acht Modelle) liegt Seedance 2.5 mit 57,76 von 100 an der Spitze, vor MiniMax H3 (54,89), laut MiniMax dem besten offenen Modell, und Cosmos 3 Super von NVIDIA (42,46); ein Benchmark eines Drittanbieters. 🔗 Quelle
- Von Agenten erstellte Omniverse-Simulationen — Der NVIDIA-Blog zeigt Teams des Unternehmens, die GPT-6 Astra und in einem Fall Claude Fable 5 Simulationen mit den Bibliotheken ovphysx, ovstage, ovrtx und ovui zusammenstellen lassen, darunter digitale Zwillinge, die in etwa drei Tagen erstellt oder verbessert wurden; es gibt kein neues Produkt. 🔗 Quelle
- Verwaltung eines Shopify-Shops — Sobald der Shop verbunden ist, kann Grok Bot Bestellungen prüfen, Lagerbestände verfolgen und Produktseiten aktuell halten; weder Tarif noch Beschränkungen werden genannt. 🔗 Quelle
- Suche auf X — Nachtrag zum 7. Oktober: Grok Bot kann für alle Benutzer X durchsuchen, lesen und überwachen, ohne dass der X-Connector konfiguriert werden muss, etwa um Rückmeldungen zu einem Produkt zu verfolgen oder eine wöchentliche Zusammenfassung aus der eigenen Branche zu erhalten; Ende August musste man noch sein Konto verbinden. 🔗 Quelle
- Grokipedia v0.3 — Laut ihrem offiziellen Account hat die von Grok verfasste Enzyklopädie in einer Woche mehr als 4 400 von Lesern angeforderte Artikel veröffentlicht und mehr als 2 200 Änderungen pro Tag vorgenommen, mit durchschnittlich 78 Quellen pro neuem Artikel; eine Seite zeigt ihre Änderungen jetzt live. 🔗 Quelle
- Die CLI mistral 0.8.0 —
mistral apps deploystellt auch Workflow-Worker und alle Module gleichzeitig bereit, einschließlich in der kontinuierlichen Integration mit einem einfachen API-Schlüssel, undmistral apps devstartet eine lokale Postgres-Datenbank in Docker; dafür wird.envim aktuellen Verzeichnis nicht mehr eingelesen. 🔗 Quelle - Das Python-SDK von Mistral 3.2.0 — Chat- und Agentenaufrufe unterstützen logarithmische Wahrscheinlichkeiten (logprobs) sowohl für die Antwort als auch für den Prompt sowie
top_k, eine Wiederholungsstrafe und eine Mindestanzahl an Tokens; eine automatisch generierte Version ohne Ankündigung. 🔗 Quelle - Qwen Code v0.25.1-preview.1 — Zweite Vorabversion von v0.25.1 innerhalb von drei Tagen, mit 16 neuen Funktionen und 27 neuen Fehlerbehebungen, darunter eine sitzungszentrierte Zusammenarbeit mehrerer Agenten und PreToolUse-Hooks, die die Eingabe eines Tools mit vollständiger erneuter Validierung ändern; die stabile Version ist noch nicht erschienen. 🔗 Quelle
- Claude Haiku 5.5 in der Agent API von Perplexity — Nachtrag zum 7. Oktober: Die Agent API unterstützt
anthropic/claude-haiku-5-5zu Anthropics Preisen, 0,10 Dollar pro Million Eingabe-Tokens und 0,50 für die Ausgabe bis zu 100 000 Eingabe-Tokens, danach 0,50 und 2,50. 🔗 Quelle - Geteilte oder dedizierte Inferenz — Ein Leitfaden von Cohere für Embed und Rerank stellt fest, dass die Beschaffenheit der Anfragen wichtiger ist als ihre Anzahl, und berechnet beispielhafte Rentabilitätsschwellen gegenüber einer dedizierten Instanz mit einer NVIDIA A10-GPU: etwa 4 Anfragen pro Minute für lange Dokumente, 20 für einen Katalog und 29 für die Neusortierung (reranking). 🔗 Quelle
- Agent oder MCP — Perplexity veröffentlicht einen Leitfaden, der den Agenten, der Entscheidungen trifft, von MCP unterscheidet, das ihn mit Tools verbindet, mit einer Entscheidungstabelle, dem Beispiel eines Onlineshops und vier Risiken samt Schutzmaßnahmen; laut dem Leitfaden können Claude, ChatGPT oder Cursor über den MCP-Server von Perplexity eine Aufgabe an Computer delegieren. 🔗 Quelle
Was das bedeutet
Ein Agent orchestriert inzwischen viele andere, und jeder erhält eine Identität. Der Gemini-Agent startet Subagenten mit jeweils eigener Identität und kann zu einem Agentenkollegen mit eigener Adresse werden; Claude Managed Agents lässt einen Agenten ein Programm schreiben, das bis zu 1 000 weitere startet; Grok Bot erhält eine E-Mail-Adresse, um außerhalb der Plattform zu handeln, und Block überträgt Claude Fable die Steuerung von Dutzenden Modellen bei einer gemeinsamen Migration. Die Frage, die zunehmend aufkommt, ist nicht mehr, ob der Agent etwas kann, sondern wie man ihn unter Kontrolle hält. Google antwortet mit Agent Gateway, Agent Sandbox, einem Audit-Log im Namen jedes Agenten und Ausgabenlimits in Echtzeit; Anthropic mit einem Sitzungsbudget, das bei Erreichen alle Ausführungen pausiert; OpenAI mit einer Windows-Sandbox mit strengeren Regeln für Netzwerk- und Dateizugriffe.
Der Einsatz mehrerer Modelle etabliert sich bei den Plattformen selbst. Google, das Gemini entwickelt, lässt seinen eigenen Agenten Claude-Modelle orchestrieren, trennt ausdrücklich die Modellwahl von der Agentenwahl und stellt Claude Opus 5.5 und Sonnet 5.5 in Antigravity bereit, deren Kosten unter dasselbe Ausgabenlimit wie die eigenen Modelle fallen. Genspark und die Agent API von Perplexity nehmen Claude Haiku 5.5 in den Tagen nach dessen Einführung auf, LegalOn verteilt seine Programmierarbeit je nach Art der Aufgaben auf drei Modelle von OpenAI, und Block entwickelt eine automatische Modellauswahl.
Die Stückkosten sinken weiter, und jede Ankündigung nennt konkrete Zahlen: 0,016 Dollar pro Bild für Qwen-Image-2.1-Turbo, 2,5-mal weniger als die Pro-Version; 15 Dollar pro Million Zeichen für HeyGen Voice bis zum 31. Oktober, danach 30, weniger als Eleven v4 Turbo; 0,017 Dollar pro 1 000 Entscheidungen für pplx-decider-v1.1-27b; sechs auf dem Hub veröffentlichte Modelle für etwa 103 Dollar Rechenkosten mit ML Intern. Die Spitzenplätze erfordern dagegen einen genauen Blick: HeyGen Voice führt nur das Ranking mit kontrollierten Stimmen an, und pplx-decider teilt sich seinen Rang mit neun weiteren Modellen, deren Konfidenzintervalle sich überschneiden.
Im Gesundheitsbereich bleibt Vorsicht geboten. Die in The Lancet veröffentlichte AMIE-Studie ist eine Machbarkeitsstudie, die an einem einzigen Standort, ohne Kontrollgruppe und mit Finanzierung durch Alphabet durchgeführt wurde: 98 Patienten, kein aus Sicherheitsgründen abgebrochenes Gespräch, eine festgestellte Halluzination. Sie ist ein Schritt hin zu größeren Studien, die die Autoren selbst fordern, und weder eine Zulassung noch ein Einsatz bei Patienten.
Quellen
- Gemini at Work 2026 (Google Cloud-Blog)
- Versionshinweise zu Gemini Enterprise
- Ankündigung von HeyGen Voice (@HeyGen)
- Ergebnisse von Artificial Analysis (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Dynamische Workflows von Claude Managed Agents (@ClaudeDevs)
- Dokumentation zu Workflow-Ausführungen (Claude Platform)
- Composer-Vorhersagen in Codex (@OpenAIDevs)
- Hilfeartikel zu Composer-Vorhersagen (OpenAI)
- MXC-Sandbox für Codex unter Windows (@OpenAIDevs)
- Dokumentation zur Windows-Sandbox (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Alpha-Changelog von Midjourney
- Test des Thinking-Modus (Midjourney)
- Syren (Synthesia)
- Playground (Google-Blog)
- Klinische AMIE-Studie (Google-Blog)
- AMIE-Studie in The Lancet
- Mitteilung der Forschungsleitung von OpenAI (@OpenAINewsroom)
- Sechs Modelle mit ML Intern (Hugging Face-Blog)
- GPU-Scheduler von Ai2 (Ai2-Blog)
- pplx-decider-v1.1-27b auf Decision Bench (@perplexitydevs)
- Decision Bench-Ranking
- E-Mail-Adresse von Grok Bot (@bot)
- ElevenLabs in Singapur (ElevenLabs-Blog)
- Projects in Claude Code (@ClaudeDevs)
- Effektive Agentenautomatisierungen entwickeln (claude.dev)
- Block und Claude Fable (claude.com)
- Versionshinweise zur Claude Platform
- Codex CLI 0.162.1 (GitHub)
- Versionshinweise zu ChatGPT Enterprise und Edu
- Sophos und OpenAI Daybreak (OpenAI)
- Asana und der Navigationsagent von StackAI (OpenAI)
- LegalOn und Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Changelog von Antigravity
- Versionshinweise zur Gemini API
- Plugins für Google Flow Music (Google-Blog)
- Google Earth AI und öffentliche Gesundheit (Google-Blog)
- Abrechnung von Copilot code review (GitHub-Changelog)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Claude Haiku 5.5 in Genspark (@genspark_ai)
- Meta VR-Modell für v0 (Meta)
- v0 für Teams (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Entscheidungsmodelle auf dem Hub (Hugging Face-Changelog)
- Darwin-27B-ZTC-v2 und der System One Mosaic Benchmark (Hugging Face-Blog)
- Die Konfidenz von Entscheidungsmodellen (Hugging Face-Blog)
- FineEnvs/openai-math (Hugging Face)
- Technischer Bericht zu JOSIE-2 (Hugging Face-Blog)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- Wissenschaftliche Begutachtung durch KI (@SakanaAILabs)
- Aktualisierung von Suno Studio (@suno)
- Die letzte Physikprüfung für World Models (Einsia)
- Von Agenten erstellte Omniverse-Simulationen (NVIDIA-Blog)
- Grok Bot und Shopify (@bot)
- Grok Bot und die Suche auf X (@bot)
- Bilanz von Grokipedia v0.3 (@Grokipedia)
- mistral CLI 0.8.0 (GitHub)
- Python-SDK von Mistral 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Modelle der Agent API (Perplexity)
- Gemeinsam genutzte oder dedizierte Inferenz für Embed und Rerank (Cohere-Blog)
- Agent oder MCP (Perplexity-Blog)