Suchen

Aleph Alpha veröffentlicht Kolibri unter Apache 2.0, Meta erweitert sein Sicherheitsrahmenwerk, OpenAI ergänzt seine Agents API um drei Sandbox-Größen

ai-powered-markdown-translator

Artikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

Am Samstag, dem 3. Oktober, veröffentlicht Aleph Alpha Kolibri, ein englisch-deutsches Modell mit offenen Gewichten und 78,1 Milliarden Parametern unter der Apache-2.0-Lizenz. Cohere verbreitet die Ankündigung noch am selben Abend; der Zusammenschluss mit Aleph Alpha wartet weiterhin auf die behördlichen Genehmigungen. Am Vortag erweiterte Meta sein Sicherheitsrahmenwerk auf das Training seiner Modelle, und die Agents API von OpenAI erhielt drei Sandbox-Größen. Die Release Notes von Devin vom 30. September machen Devin zu einem nativen Jira-Agenten, Qwen-Image-2.1-Pro ist per API für 0,04 Dollar pro Bild verfügbar, und der Entwickler von Apron erklärt, wie sich der GPU-Speicherbedarf eines offenen Modells vor dem Mieten einer Grafikkarte vorhersagen lässt.


Aleph Alpha veröffentlicht Kolibri, ein englisch-deutsches Modell mit 78 Milliarden Parametern unter Apache 2.0

3. Oktober — Am Tag der Deutschen Einheit veröffentlicht Aleph Alpha Kolibri, ein englisch-deutsches Sprachmodell mit offenen Gewichten. Dieses Modell mit einer Mischung aus Experten (Mixture-of-Experts) hat 78,1 Milliarden Parameter, von denen 3,46 Milliarden pro Token aktiv sind. Seine Gewichte stehen auf Hugging Face unter der Apache-2.0-Lizenz bereit. Aleph Alpha richtet es auf souveränes Arbeiten in regulierten Bereichen aus: öffentliche Verwaltung, Industrie und Luftfahrt.

Die Architektur zielt vor allem auf die Betriebskosten ab: 6 aktive Experten von 384, und 40 von 50 Schichten sind auf ein gleitendes Fenster von 512 Tokens beschränkt. Das Modell akzeptiert bis zu 1 048 576 Tokens, wurde aber nur bis zu 262 144 trainiert; seine Modellkarte empfiehlt, diese Länge nicht zu überschreiten. Laut dem Beitrag konnte eine Version mit 123 Milliarden Parametern auf zwei H100 nur 3 Anfragen mit jeweils 256k Tokens verarbeiten, gegenüber 18 bei der gewählten Modellgröße. Für das Training wurden 768 B200-GPUs in Deutschland und Finnland eingesetzt, für knapp 24T Tokens; Deutsch macht 21,3 % des Pretrainings aus.

Nach den Messungen von Aleph Alpha (eigenes Test-Harness, maximaler Reasoning-Aufwand) liegt Kolibri im Gesamtscore vor Qwen3.5 35B-A3B und Nemotron 3 Super, das 12 Milliarden Parameter aktiviert. Das dichte Modell Qwen3.8 27B liegt jedoch fast überall vorn:

Benchmark (Messungen von Aleph Alpha)Kolibri 78B-A3,46BQwen3.5 35B-A3BNemotron 3 Super 120B-A12BMistral Small 4 119B-A6BQwen3.8 27B (dense)
Gesamtscore (Englisch)75,574,773,063,180,2
Gesamtscore (Deutsch)70,869,867,961,479,9
GPQA Diamond (Englisch)84,383,878,074,789,2
AIME 2026 (Englisch)96,092,190,483,197,7
SWE-Bench Verified66,471,660,260,872,6

Das Argument von Aleph Alpha ist also nicht der erste Platz, sondern die Pareto-Grenze zwischen Qualität und Betriebskosten. Kolibri wurde darauf trainiert, auf Antworten zu verzichten, und zieht es bei 44 % der AA-Omniscience-Fragen, die es nicht erfolgreich beantwortet, vor, keine oder nur eine teilweise Antwort zu geben, statt falsch zu antworten. Es wurde in Deutschland „ohne ausländische Kontrolle“ (no foreign control) entwickelt, mit Blick auf den AI Act und die RGPD konzipiert und kann vor Ort betrieben werden; ein technischer Bericht mit knapp 200 Seiten begleitet die Veröffentlichung.

Cohere, dessen endgültige Vereinbarung zum Zusammenschluss mit Aleph Alpha weiterhin unter dem Vorbehalt behördlicher Genehmigungen steht, verbreitete die Ankündigung noch am selben Abend, nachdem CEO Aidan Gomez seine Glückwünsche übermittelt hatte; Kolibri bleibt ein Modell von Aleph Alpha.

New Apache 2.0 model from @Aleph__Alpha. It’s really good. If you like that, you’re going to love what we build together.

🇩🇪 Neues Modell unter Apache 2.0 von Aleph Alpha. Es ist wirklich gut. Wenn euch dieses gefällt, werdet ihr lieben, was wir gemeinsam entwickeln werden. — @cohere auf X

🔗 Beitrag von Aleph Alpha · Gewichte auf Hugging Face


Meta erweitert sein Sicherheitsrahmenwerk auf das Training und präzisiert seine Regeln für offene Gewichte

2. Oktober — Meta Superintelligence Labs aktualisiert sein Meta Superintelligence Scaling Framework, das seine Sicherheitsanforderungen vor dem Training und anschließend vor der Bereitstellung festlegt. Laut Meta spiegelt diese Version die in dieser Woche im Weißen Haus eingegangenen Verpflichtungen wider. Diese sehen interne Kontrollen vor, die von einem unabhängigen Team innerhalb des Unternehmens sowie von einem externen Auditor oder Gutachter überprüft werden.

Der Kontrollverlust (loss of control) wird nun während des Trainings und der Evaluierung durch Vorgaben adressiert, da ein in Cybersicherheit leistungsfähiges Modell laut Meta Schwachstellen seiner Umgebung ausnutzen kann. Ein risikobehaftetes Reinforcement Learning erfordert validierte Sandboxes, unveränderbare Logs einschließlich der Chain of Thought und eine automatische Überwachung, die den Run stoppen kann.

Bei offenen Gewichten berücksichtigt das Rahmenwerk mögliche Änderungen nach der Veröffentlichung, etwa das Entfernen des Ablehnungsverhaltens durch Fine-Tuning. Ein für die kommenden Monate angekündigter KI-Ausschuss des Verwaltungsrats wird die Einhaltung des Rahmenwerks unabhängig überprüfen. Dieses Rahmenwerk hieß zuvor „Advanced AI Scaling Framework“ und wurde mit dieser Version 2.1 umbenannt: Nach ihm war Muse Spark im April evaluiert worden.

🔗 Leistungsfähige Modelle verantwortungsvoll entwickeln (Meta)


Die Agents API von OpenAI erhält drei Sandbox-Größen und die Wiederverwendung von Umgebungen

2. Oktober — Steve (@stevendcoffey), der laut seiner X-Bio an der API von OpenAI arbeitet, listet die Neuerungen der Woche für die Agents API auf; @OpenAIDevs verbreitet den Beitrag weiter. Neben drei Erinnerungen an den DevDay gibt es vier neue Punkte. Der erste wird durch die Dokumentation bestätigt: Der Parameter environment.container_size, der beim Erstellen einer Session festgelegt wird, bestimmt CPU und Speicher der von OpenAI gehosteten Sandbox.

Container-GrößeZugewiesene vCPUZugewiesener Speicher
small11 Go
medium (Standard)24 Go
large416 Go

Die drei anderen stehen nur im Tweet: über das Dashboard konfigurierbare Subagenten, die Wiederverwendung einer Umgebung über mehrere Sessions hinweg und eine höhere Zuverlässigkeit, ohne veröffentlichte Messmethode.

Overall better reliability: 99.97% turn reliability, fewer SSE disconnects, 20% faster tool calls 🪨

🇩🇪 Verbesserte Gesamtzuverlässigkeit: 99,97 % Zuverlässigkeit pro Turn, weniger SSE-Verbindungsabbrüche, 20 % schnellere Tool-Aufrufe. — @stevendcoffey auf X

🔗 OpenAI-Dokumentation


Coding-Agenten: Devin in Jira, Antigravity CLI 1.2.13 und 1.2.14

Devin wird zum nativen Jira-Agenten und übergibt die Befunde von Devin Review an seine Sessions

30. September — Die Release Notes von Devin vom 30. September umfassen 25 Rubriken. Die wichtigste macht Devin zu einem nativen Agenten (native agent) in Jira: Sobald ein Administrator die App Devin for Jira installiert hat, startet das Zuweisen eines Tickets an Devin oder eine Erwähnung eine Session, die im Agenten-Panel von Jira verfolgt wird. Wenn Devin nicht starten kann (fehlende Berechtigung, Nutzungslimit), zeigt Jira seine Erklärung statt einer allgemeinen Fehlermeldung an.

Bei einem Pull Request, der von einer noch aktiven Devin-Session geöffnet wurde, übermittelt Devin Review seine Befunde (findings) zunächst an diese Session: Mit der automatischen Korrektur (Auto-fix) behebt Devin, was es kann, und nur die verbleibenden Befunde werden veröffentlicht. Automatisierungen erhalten Vorabprüfungen (preflight checks): Nach jedem Trigger läuft vor Devin ein Skript, um das Ereignis zu validieren, anzureichern oder zu ignorieren. Preise werden nicht genannt.

🔗 Release Notes von Devin vom 30. September

Antigravity CLI 1.2.13 und 1.2.14: Wartezeiten für erneute Versuche, Nachrichtenwarteschlange, Remote Control ohne systemd

29. und 30. September — Der Changelog von Googles Antigravity CLI führt zwei Versionen auf. Version 1.2.13 befolgt die von der Modell-API angegebene Wartezeit für einen erneuten Versuch, statt immer 5 Sekunden zu warten, und bricht sofort ab, wenn diese Wartezeit 30 Sekunden überschreitet oder das erreichte Limit eine Tages- oder Abrechnungsgrenze ist.

Version 1.2.14 (6 Verbesserungen, 3 Fehlerbehebungen) ergänzt in /config die Option Queued Messages: Standardmäßig (Queue) wartet eine Nachricht, die während der Arbeit des Agenten gesendet wird, bis zum Ende des Turns; im Modus Send Immediately unterbricht sie ihn. Auf Linux-Rechnern ohne systemd-Verwaltung für Benutzerdienste, wie den meisten Containern, startet Remote Control seinen Daemon als einfachen Hintergrundprozess, der weder nach einem Absturz noch beim Systemstart erneut startet. Die Option --json-schema wird strikt: Ein ungültiges Schema führt zu einem Fehler und dem Exit-Code 1. Der Rollout erfolgt schrittweise über einige Tage.

🔗 Changelog von Antigravity


Qwen-Image-2.1-Pro ist per API auf Model Studio und QwenCloud verfügbar, für 0,04 Dollar pro Bild

2. Oktober — Alibaba nimmt Qwen-Image-2.1-Pro für den Servicebereich International in den Katalog seiner API-Plattform Model Studio auf, und QwenCloud widmet ihm eine mit „NEW“ markierte Modellkarte, ohne Tweet oder Beitrag von Qwen. Das Modell baut auf Qwen-Image-2.1 auf, das am 20. September mit offenen Gewichten veröffentlicht wurde: Erstellung und Bearbeitung in einem einzigen Modell, 7 Milliarden Parameter für die visuelle Generierung, native transparente Bilder. Die Modellkarte sagt nicht, ob sich die bereitgestellte Version von den veröffentlichten Gewichten unterscheidet.

Vergleichspunktqwen-image-2.1-proqwen-image-2.0-pro
Preis pro ausgegebenem Bild0,04 dollar0,075 dollar
Kostenloses Kontingent10 Bilder100 Bilder

Der Preis sinkt um fast die Hälfte, aber das kostenlose Kontingent ist zehnmal kleiner. Auf QwenCloud ist das Modell auf 20 Anfragen pro Minute und 10 gleichzeitige Aufrufe begrenzt.

🔗 Modellprotokoll von Model Studio · Modellkarte auf QwenCloud


Apron prognostiziert laut seinem Autor den GPU-Speicherbedarf von 14 offenen Modellen vor dem Mieten

3. Oktober — Vlad Ryzhkov, Entwickler von Apron, stellt im Community-Blog von Hugging Face dieses Open-Source-Tool vor. Es sagt vor dem Mieten einer GPU voraus, ob ein offenes Modell in den Speicher passt und mit einer bestimmten Version von vLLM startet, und überprüft dies anschließend auf einer echten Grafikkarte.

Laut dem Autor weicht der vorhergesagte Speicherbedarf der Gewichte bei 11 der 14 gestarteten Modelle um weniger als 2 % vom Messwert ab, von einer RTX 4090 bis zu acht H200. Vier Modelle scheiterten, bevor ein durch einen zweiten Start validierter Fix sie wieder zum Laufen brachte. DeepSeek-V4.1-Flash belegt standardmäßig 189 Gio Host-Speicher, die bei einer auf die GPU beschränkten Prüfung unsichtbar bleiben.

Der Autor weist darauf hin, dass pro Modell nur ein Start gemessen wurde und die Ergebnisse keine Rangliste darstellen. Das CLI-Tool ist noch nicht für die Nutzung durch Außenstehende bereit, und sein Repository beschreibt sich weiterhin als Spezifikation ohne Implementierung.

🔗 Beitrag von Vlad Ryzhkov (Hugging Face)


Kurzmeldungen

  • Copilot CLI 1.0.92-3 und Copilot SDK 1.0.17-preview.3 — Die Vorabversion von Copilot CLI ergänzt eine Auswahl, die sich vor dem Gespräch mit Ctrl+E öffnen lässt, um zwischen lokaler Ausführung und Ausführung in der Cloud zu wählen; die Vorabversion des SDK erlaubt experimentell, die Tools des Clients in einer laufenden Sitzung auszutauschen. Die neueste stabile Version bleibt 1.0.91. 🔗 CLI · 🔗 SDK
  • Copilot code review per API — Eine Review durch Copilot lässt sich jetzt über die REST- und GraphQL-APIs anfordern, wobei der Aufwand bei jeder Anfrage festgelegt wird. Die Funktion ist für die Tarife Pro, Pro+, Max, Business und Enterprise allgemein verfügbar; die Dokumentation schätzt die Kosten einer Review auf 0,05 bis 1 Dollar an KI-Guthaben bei Lite und auf 0,25 bis 5 Dollar bei Balanced, dem standardmäßigen Aufwand. 🔗 Quelle
  • Nightly von Gemini CLI — Die v0.64.0-nightly vom 3. Oktober enthält nur eine Fehlerbehebung: Eingabe- und Leertaste bestätigen Auswahllisten zuverlässig, auch in Terminals ohne Kitty-Tastaturprotokoll, etwa dem von PyCharm unter Windows, wo eine weniger als 30 ms nach einer anderen Taste gedrückte Eingabetaste als Umschalt+Eingabe erkannt wurde. Die stabile Version und die Vorabversion bleiben unverändert. 🔗 Quelle
  • DeepSeek Harness 0.2.1-alpha.1 — Diese 25. Vorabversion, weiterhin ohne stabile Version, ergänzt eine experimentelle Kompatibilitätsschicht für die Mods von Claude Code. Laut DeepSeek soll sie prüfen, ob deren API im Großen und Ganzen eine Teilmenge der Möglichkeiten der Harness-Plugins bildet, und keine vollständige Kompatibilität bieten. 🔗 Quelle
  • GPT-6.1 Sol in Warp — Am Abend des 29. September hat Warp GPT-6.1 Sol in seinem agentischen Terminal verfügbar gemacht, nutzbar mit einem Codex- oder ChatGPT-Abonnement; die Ankündigung nennt weder einen Preis noch Warp-spezifische Messwerte. 🔗 Quelle
  • Ende von grok-voice-transcribe-1.0 — SpaceXAI hat am 2. Oktober die alte Version seines Transkriptionsmodells in der API eingestellt: Anfragen werden an grok-voice-transcribe-2.0 weitergeleitet, das laut SpaceXAI zum gleichen Preis genauer arbeitet. Die Abkündigung war am 18. September ohne Datum angekündigt worden. 🔗 Quelle
  • September für OpenAI-Entwickler — Der Account @OpenAIDevs fasst in einem X-Artikel die Entwicklerankündigungen vom September zusammen, vom DevDay am 29. bis zu GPT-6 Sol und Luna, ohne neue Ankündigungen; die einzige zusätzliche Angabe betrifft OpenAIs Decisions API, die seit dem 29. September als begrenzte Vorschau verfügbar ist und laut dem Artikel bald allgemein zugänglich sein soll, ohne Datumsangabe. 🔗 Quelle
  • Zwei Agenten-Einsätze von ElevenLabs — Banner Health überträgt ElevenAgents die Terminvereinbarung in der medizinischen Grundversorgung, mit Übergabe an einen Menschen und HIPAA-Konformität; der Versicherer Admiral berichtet über die Einführung seiner Sprachagenten in den Produktivbetrieb, bei denen jede Änderung innerhalb weniger Stunden statt mehrerer Wochen von 1 % auf 100 % des Traffics ausgeweitet wird. Keiner der beiden veröffentlicht Ergebniskennzahlen. 🔗 Banner Health · 🔗 Admiral
  • Kling 4.0 im Early Access — Der Vorstellungsbeitrag zu Kling 4.0 vom 30. September erläutert, dass das vollständige Modell vor einer breiteren Einführung im Oktober in den Early Access geht, während Kling 4.0 Flash seit dem 28. September für Abonnenten mit Ultra-Jahresabo verfügbar ist; das Format 21:9 kommt hinzu, ohne Angaben zu Preisen, API oder Zugangskriterien. 🔗 Quelle
  • Runway Agent, Runway MCP und die dots von OpenAI — Der Changelog von Runway führt drei Ergänzungen ohne Ankündigung auf X auf: Runway Agent nutzt den Draft-Modus von Seedance 2.5 (Entwürfe in 480p, die nach der Generierung überarbeitet werden), Ideogram 4.5 kommt für kostenpflichtige Tarife zu Runway MCP hinzu, und Runway ist seit dem 1. Oktober in den dots von OpenAI verfügbar. Kosten in Credits werden nicht genannt. 🔗 Quelle
  • Zustandslose Tokens der GitHub Apps — Abseits der KI schließt GitHub die am 27. April begonnene Einführung des zustandslosen Formats ghs_APPID_JWT für alle neuen Installationstokens der GitHub Apps ab: etwa 520 Zeichen statt 40, bei unveränderten Berechtigungen und einer unveränderten Gültigkeit von einer Stunde; der Test-Header X-GitHub-Stateless-S2S-Token wird am 30. November 2026 als veraltet eingestuft. 🔗 Quelle
  • Menschliches Feedback in Echtzeit bei Rapidata — Rapidata beschreibt seine Funktion Flows, die das Reward Model von Flow-GRPO durch paarweise Vergleiche durch Menschen in Echtzeit ersetzt, in einem Anbieterbeitrag, der keine gemessenen Trainingsergebnisse veröffentlicht. 🔗 Quelle
  • Die Abhängigkeit zwischen Agenten messen — In einem Essay ohne Experiment oder Messung schlägt Anouar Imel vor, Multi-Agenten-Systeme anhand der Abhängigkeit zwischen Agenten statt ihrer Anzahl zu bewerten und dabei in jeder Runde die Genauigkeit, die Vielfalt der Denkwege und die Kopplung zwischen Agenten zu verfolgen. 🔗 Quelle

Was das bedeutet

Kolibri zeigt, dass ein offenes Modell mithalten kann, ohne den ersten Platz anzustreben. Aleph Alpha veröffentlicht selbst Messwerte, bei denen das dichte Modell Qwen3.8 27B fast überall vorne liegt, und stellt ein anderes Kriterium in den Vordergrund: viele lange Anfragen mit wenigen GPUs zu bedienen, auf Englisch wie auf Deutsch, unter einer Lizenz, die es erlaubt, alles vor Ort zu hosten. Für eine Behörde oder ein Industrieunternehmen, das den Vorgaben des AI Act und der RGPD unterliegt, kann dieser Kompromiss mehr zählen als ein paar Benchmark-Punkte. Cohere, dessen Zusammenschluss mit Aleph Alpha noch auf die behördlichen Genehmigungen wartet, verspricht bereits die Fortsetzung.

Die Betriebskosten werden für offene Modelle zu einem zentralen Thema. Qwen-Image-2.1, das am 20. September mit offenen Gewichten veröffentlicht wurde, ist unter dem Namen Qwen-Image-2.1-Pro wieder per API verfügbar, für 0,04 Dollar pro Bild und damit fast halb so teuer wie die vorherige Generation, für alle, die es lieber nicht selbst hosten. Der Beitrag von Apron erinnert seinerseits daran, was Self-Hosting erfordert: Ein Modell kann beim Start scheitern, weil eine vLLM-Einstellung fehlt, oder 189 Gio Host-Speicher belegen, die eine auf die GPU beschränkte Prüfung nicht erfasst.

Meta setzt bei der Sicherheit schon vor dem Deployment an. Risikobehaftetes Training mit Reinforcement Learning erfordert nun validierte Sandboxes, unveränderbare Logs und eine automatische Abschaltung, weil ein in Cybersicherheit starkes Modell die Schwachstellen seiner eigenen Umgebung ausnutzen kann. Der angekündigte KI-Ausschuss im Verwaltungsrat soll zudem unabhängig prüfen, ob diese Regeln eingehalten werden. Die im Weißen Haus eingegangenen Verpflichtungen, denen Meta nach eigenen Angaben Rechnung trägt, gibt der Beitrag nur in ihren Grundzügen wieder: interne Kontrollen, die von einem unabhängigen Team innerhalb des Unternehmens und von einem externen Auditor oder Evaluator überprüft werden.

Die Agenten integrieren sich schließlich in die Tools und den Betrieb. OpenAI lässt die Größe der Sandbox wählen und eine Umgebung über mehrere Sitzungen hinweg wiederverwenden, Devin integriert sich in Jira und behebt die Befunde seiner eigenen Review vor deren Veröffentlichung, und Copilot code review lässt sich per API auslösen, mit geschätzten Kosten je Aufwandsstufe. Antigravity CLI hält die vom Server vorgegebenen Wartezeiten für erneute Versuche ein und führt Remote Control in Containern aus: eher Betriebseinstellungen als spektakuläre Funktionen, aber genau sie zählen, wenn ein Agent dauerhaft läuft.


Quellen