Jonathan ist freier Technikjournalist, Sachbuchautor und Medientrainer. Er beschäftigt sich vor allem mit frei verfügbaren KI-Modellen, chinesischen KI-Laboren und den technischen Grundlagen dahinter – von neuen Trainingsverfahren über Skalierungsstrategien bis hin zu Benchmark-Design. Außerdem ist er passionierter Vibecoder.
Codex bekommt auf OpenAIs DevDay 2026 wiederverwendbare Cloud-Umgebungen, automatische Sicherheitsscans für GitHub-Repositorys und eine Code-Review-Ansicht in der Desktop-App. Die Agents API unterstützt jetzt Computer Use, eine neue Decisions API liefert schnelle Einzelentscheidungen. Die Premium-Stufe Ultrafast verspricht bis zu achtfache Geschwindigkeit zum sechsfachen Preis.
Elevenlabs stellt mit Eleven v4 ein neues Stimmenmodell vor, das Regieanweisungen wie Lachen oder Flüstern präziser umsetzt und Stimmen über lange Produktionen wie Hörbücher stabil halten soll. Die Turbo-Variante erreicht 150 Millisekunden Latenz und zielt auf Echtzeit-Sprachagenten. In der Voice-Arena von Artificial Analysis führt v4 bereits vor Cartesia und Googles Gemini.
Manus baut seinen KI-Agenten mit Version 2.0 zu einer Plattform um, auf der Nutzer Videos schneiden, Multiplayer-Spiele hosten und persönliche Agenten mit eigener Telefonnummer betreiben. Der neue Agent Harness "Cascade" soll in einer getesteten Konfiguration 23,2 Prozent weniger Token verbrauchen und 32 Prozent günstiger laufen als das Vorgängersystem. Automatisierungen starten jetzt auch durch Ereignisse wie neue E-Mails oder Slack-Nachrichten. Per Computer Use arbeitet Manus mit freigegebenen Dateien und Apps auf dem Rechner des Nutzers, auf Wunsch ferngesteuert per Handy.
Die Desktop-App heißt künftig Manus Studio und bekommt mit Video Editor und Game Dev zwei Umgebungen, in denen Nutzer Ergebnisse selbst nachbearbeiten. Für Spieleserver lassen sich Cloud Computer buchen. Die neue App Cue gibt jedem Agenten E-Mail-Adresse, Wallet und eigenen Rechner. Manus 2.0 ist ab sofort verfügbar, Cue im kostenlosen Early Access per Einladungscode.
Meta hatte Manus Ende 2025 übernommen, musste den Deal nach einem Verbot aus Peking aber rückabwickeln; zuletzt verhandelte Tencent über die größte Beteiligung an dem Start-up. Meta setzt inzwischen auf den eigenen Agenten Muse, der jedem Nutzer ebenfalls einen Cloud-Computer bereitstellt.
Nvidia hat mit Nemotron 3 Diarization ein KI-Modell veröffentlicht, das in Gesprächen erkennt, wer wann spricht. Die Gewichte des Modells mit rund 100 Millionen Parametern sind frei verfügbar. Es unterscheidet bis zu acht Sprecher und erkennt auch, wenn mehrere Personen gleichzeitig reden. Mehr Teilnehmer, starker Lärm oder Hall erhöhen die Fehlerquote. Kombiniert mit einer Spracherkennung wie Parakeet lassen sich Transkripte mit Sprecherzuordnung erstellen, allerdings nur über anonyme Labels wie "speaker_2". Das Modell funktioniert mit Aufnahmen und live.
Im VoiceArena-Diarization-Benchmark v1 führt das frei verfügbare Nemotron 3 mit 14,7 % DER und übertrifft den Vorgänger Streaming Sortformer um 41 %.
Der Audiopuffer lässt sich in vier Stufen zwischen 30,4 und 0,32 Sekunden einstellen, kürzere Puffer senken meist die Genauigkeit. Im Diarization-Bench von VoiceArena liegt das Modell vorläufig mit einer Fehlerrate von 14,72 Prozent auf Platz eins, vor dem nächstbesten System mit 19,3 Prozent. Der Test ist streng: Überlappende Sprache zählt mit, und selbst kleinste Abweichungen an den Übergängen gelten als Fehler. Gegenüber dem Vorgänger Streaming Sortformer sinkt die Fehlerrate bei 1,04 Sekunden Puffer über acht Testszenarien im Schnitt um 41 Prozent.
SoL-Pi optimiert die Steuerungsschicht zwischen Agent und Umgebung und senkt den Token-Verbrauch von Coding-Agenten um bis zu 49 Prozent bei nahezu gleicher Leistung. Ein Research-Agent durchsuchte dafür 152 Ansatzrichtungen in über 3.000 Durchläufen. Auf anderen Benchmarks fällt der Vorteil geringer aus.
Tencents Forschungsteam stellt mit Gander ein KI-Modell vor, das Echtzeitgespräche und Agentenfähigkeiten in einem System vereint. Eine „Kleinhirn“-Komponente führt den Dialog, ein austauschbares „Gehirn“ erledigt komplexe Aufgaben im Hintergrund. Nutzer können jederzeit unterbrechen: Laut Benchmark fällt Gander nur in 8 Prozent der Fälle ins Wort, bei der Aufgabengenauigkeit liegt es allerdings noch zurück.
Runway will Videogenerierung in Echtzeit ermöglichen. Statt auf fertige Clips zu warten, sollen Nutzer Videos streamen, während sie Prompts eingeben. Grundlage ist das hauseigene Weltmodell GWM-1, das Bilder Frame für Frame erzeugt. Neben kreativen Anwendungen sieht Runway Potenzial für Robotik und autonomes Fahren.
Microsoft und die University of Illinois stellen mit StudentSim ein System vor, das aus wenigen Daten digitale Nachbildungen einzelner Schüler erzeugt. Diese liefern im Maschinentempo Feedback für KI-Tutoren, schneller und günstiger als echte Lernende. In Tests über 60 Schüler in Schach, Englisch und Mathematik schlug StudentSim GPT-5.4 deutlich, und ein damit trainierter Schach-Tutor erhielt von Experten die besten Noten.
Unity hat offizielle Plugins für Claude Code und OpenAIs Codex veröffentlicht. Die Spiele-Engine des US-Unternehmens Unity Technologies gehört zu den meistgenutzten der Welt und dient vor allem zur Entwicklung von 2D- und 3D-Spielen für PC, Konsolen und Smartphones. Die Plugins statten die Coding-Agenten mit Skills aus, die die jeweils zuständigen Unity-Teams schreiben und pflegen. In der Codex-Version sind es zum Start 31 Skills für Benutzeroberflächen, 2D-Grafik, die Render-Pipeline URP, Audio, Navigation, Physik, In-App-Käufe, Multiplayer und Lokalisierung.
Ein Skill richtet neue Projekte samt Editor, Versionsverwaltung und Paketen ein, ein anderer migriert ältere Projekte auf URP. Allgemeine Agenten stützen sich laut Unity sonst auf Forenbeiträge und Tutorials für veraltete Engine-Versionen, deren Code zwar kompiliere, aber oft nicht wie vorgesehen funktioniere. Die Plugins laufen ab Unity 6 und lassen sich per Klick im Plugin-Verzeichnis für Codex und per npm in Claude Code installieren.
Sprachmodelle steuern zunehmend komplexe Software, besonders in der Spieleentwicklung. Das 3D-Programm Blender gehörte zu den ersten Anwendungen, die sich über Anthropics Model Context Protocol per Sprachmodell bedienen ließen. Inzwischen formen Modelle wie Know3D 3D-Objekte per Textbefehl, World Labs generiert mit Atlas ganze 3D-Szenen aus wenigen Bildern.