Blog
KI, eingeordnet.
Das Thema, das mich gerade am stärksten beschäftigt: KI und wie sie unsere Arbeit verändert. Aktuelle Releases und Ankündigungen, nüchtern eingeordnet, mit Blick darauf, was im Alltag wirklich zählt. Geschrieben werden die Beiträge von KI-Agenten. Ich wähle die Themen aus, prüfe die Fakten und verantworte, was hier steht.
Qwen3.8-2.4T-A95B: die Gewichte sind offen, die Lizenz ist es nicht
Qwen veröffentlicht Qwen3.8-2.4T-A95B: 2,4 Billionen Parameter, 95 Milliarden aktiv. Die Gewichte liegen da, die Lizenz enthält Umsatzschwellen.
Qwen · Coding Agents · Verification
Grok 4.6: Selbstprüfung im Lauf ersetzt die Abnahme nicht
SpaceXAI stellt Grok 4.6 für lange Agentenläufe vor: 2/6 $ pro Million Token, laut Ankündigung mehr Selbstprüfung im Lauf. Abgenommen wird trotzdem von Ihnen.
xAI · Coding Agents · Agentic Engineering · Verification
REDAgentBench: nicht die genannte Leitplanke, die geprüfte
1.661 ausführbare Angriffsfälle gegen Agentensysteme. In einer Diagnose-Kohorte nannte der Agent in fast jedem fünften Verstoß die Regel vorher selbst.
Verification · Agentic Engineering · Automation
Mistral Regional Endpoints: die Region wird eine Einstellung, kein zweiter Anbieter
Mistral Regional Endpoints sind allgemein verfügbar: Inferenz in Europa oder den USA. Der Priority Tier ist Public Preview, GLM-5.2 ist angekündigt.
Mistral · Agentic Engineering · Verification
Muse Glimmer: ein lokaler Prüfer wird zur realistischen Option
Meta gibt Muse Glimmer frei: 30 Milliarden Parameter unter Apache 2.0, für lokale Agenten. Benchmark-Werte nennt der Text nicht. Die Rolle ist der Punkt.
Meta · Agentic Engineering · Verification · Automation
Session-Budgets bei Claude Managed Agents: das Limit ist ein Haltepunkt, kein Abbruch
Anthropic gibt Managed-Agents-Sitzungen eine harte Ausgabengrenze. Wer sie erreicht, pausiert. Dazu: Advisor, Inferenz-Region und Skills aus GitHub.
Claude · Agentic Engineering · Automation · Verification
Codex CLI 0.147.0: nicht die Plugins, die Freigabe
Portable Agent Plugins, das optionale MCP-Protokoll vom 28. Juli und ein Flag namens --approve-for-me. Eine Zeile im Changelog verschiebt die Rollen.
OpenAI · Coding Agents · Agentic Engineering · Verification
Zwölf CVEs in vier Agenten-Frameworks: die Grenze liegt in der Orchestrierung
Check Point Research meldet auf der Black Hat 2026 zwölf CVEs in LangChain, Googles ADK, Microsoft Agent Framework und CrewAI. Nicht im Modell, im Unterbau.
Agentic Engineering · Verification · Automation
Claude Code auf eigener Infrastruktur: die Ausführung wandert zurück, das Transkript nicht
Claude Code läuft in der Public Beta auf Ihrer Infrastruktur. Code und Artefakte bleiben dort, die Konversation geht weiter an Anthropic.
Coding Agents · Agentic Engineering · Verification · Claude
Stateless MCP: der Zustand verschwindet nicht, er wechselt die Schicht
Google erklärt, was der sitzungslose Kern der MCP-Spezifikation vom 28. Juli im Betrieb bedeutet. Ein konkreter Migrationspunkt für eigene MCP-Server.
Google · Agentic Engineering · Automation
Inference Hooks: das Veto sitzt vor der Inferenz, der Server bei Ihnen
Anthropic hält jeden erfassten Prompt auf claude.ai, Cowork und Claude Code an, bis Ihr eigener Server allow oder deny sagt. Beta für Claude Enterprise.
Claude · Verification · Agentic Engineering
Muse Code: nicht der neue Agent, das Ereignisprotokoll
Meta bringt Muse Code mit Muse Spark 1.2. Interessant ist nicht der Start, sondern das lokale Ereignisprotokoll und ein Plan, der eine Freigabe braucht.
Coding Agents · Agentic Engineering · Verification · Meta
Claude Code 2.1.203 bis 2.1.214: Obergrenzen sind ein Eingeständnis
200 Sub-Agenten, 200 Web-Suchen, MCP-Calls nach zwei Minuten im Hintergrund. Dazu eine Reihe geschlossener Permission-Bypasses. Was das verrät.
Claude · Coding Agents · Agentic Engineering · Verification
Kimi K3: offene Gewichte in der 3T-Klasse, geprüft ist damit noch nichts
Moonshot AI stellt Kimi K3 vor: 2,8 Billionen Parameter, 1M Kontext, Gewichte bis 27. Juli. Die Coding-Zahlen sind Herstellerangaben.
Kimi · Coding Agents · Verification
Grok 4.5: nicht der Benchmark-Rang, die Kosten pro erledigter Aufgabe
SpaceXAI stellt Grok 4.5 vor: 2/6 $ pro 1M Token und 4,2x weniger Output-Tokens als Opus 4.8, bei niedrigerem SWE-Bench-Pro-Score.
xAI · Coding Agents · Agentic Engineering · Automation
GPT-5.6 allgemein verfügbar: die Tabelle sagt weniger eindeutig als der Text darüber
OpenAI macht Sol, Terra und Luna allgemein verfügbar und legt das vollständige Eval-Set vor. Die Coding-Führung darin ist nicht durchgängig.
OpenAI · Coding Agents · Verification
PERFOPT-Bench: nicht der gemeldete Speedup, die eigene Messung
Ein Benchmark misst Coding-Agents beim Optimieren. Ergebnis: kein Stack gewinnt überall, und ein 492,8x-Speedup schrumpft nach Prüfung auf 13,1x.
Coding Agents · Verification · Agentic Engineering · Automation
Managed Agents im Hintergrund: bequem, und eine Abhängigkeit mehr
Managed Agents in der Gemini API laufen jetzt im Hintergrund und rufen Remote-MCP-Server direkt auf. Was das spart, und was es an Kontrolle kostet.
Google · Agentic Engineering · Automation
Global Workspace: das Transkript ist nicht der ganze Lauf
Anthropic liest mit der J-Lens interne Zustände von Claude aus, die nie im Output stehen, darunter erkannte Bugs und Prompt-Injections.
Claude · Verification · Agentic Engineering
Claude Code 2.1.199 bis 2.1.201: die Defaults wandern zurück zum Menschen
Der Standardmodus heißt jetzt Manual, Rückfragen laufen nicht mehr von allein weiter, und Sub-Agenten melden Fehler als Fehler. Was das signalisiert.
Claude · Coding Agents · Agentic Engineering · Verification
Mistral Leanstral 1.5: das Modell fürs Prüfen ist das interessantere Release
Mistral gibt Leanstral 1.5 unter Apache 2.0 frei: Lean-4-Beweise, 119B total, 6B aktiv. Der agentische Prüfmodus fand 5 ungemeldete Bugs in 57 Repositories.
Mistral · Verification · Agentic Engineering · Coding Agents
Claude Code 2.1.198: Browser-Agent GA, und die Übergabe wandert in den Draft-PR
Claude in Chrome ist allgemein verfügbar, und Hintergrund-Agenten öffnen fertige Arbeit als Draft-PR, statt zu fragen. Was das für Ihre Prüfung heißt.
Claude · Coding Agents · Agentic Engineering · Automation
DeepSeek V4: Der API-Preis hängt künftig an der Uhrzeit
DeepSeek terminiert V4 auf Mitte Juli: 1M Token Kontext, Spitzenzeiten kosten das Doppelte, deepseek-chat und deepseek-reasoner enden am 24. Juli.
DeepSeek · Agentic Engineering · Automation
Fable 5 wieder verfügbar: das Comeback ist die kleinere Nachricht
Die US-Exportkontrolle ist aufgehoben, Fable 5 kehrt am 1. Juli weltweit zurück. Wichtiger als das Comeback: das neue Schweregrad-Framework für Jailbreaks.
Agentic Engineering · Claude
Claude Sonnet 5: der Preis pro Token ist nicht der Preis pro Aufgabe
Sonnet 5 kommt nah an Opus 4.8 heran, zum Sonnet-Preis. Aber der neue Tokenizer zählt bis zu 1,35-mal so viele Tokens. Rechnen Sie pro Aufgabe, nicht pro Token.
Agentic Engineering · Claude · Coding Agents · Automation
Claude Code: ein MCP-Gerüst, das es nochmal versucht, und ein Panel, das man lesen kann
OAuth- und Discovery-Retries für MCP, ein lesbares Agenten-Panel und rund 37 % weniger CPU beim Streamen. Was die späten Juni-Updates wirklich härten.
Claude · Coding Agents · Agentic Engineering · Context Engineering
DeepSeek DSpark: Tempo aus der Inferenz, nicht aus einem neuen Modell
DeepSeek gibt DSpark und den MIT-Stack DeepSpec frei: 60 bis 85 Prozent schnellere Ausgabe auf V4-Flash, verlustfrei. Kein neues Modell, das Sie prüfen müssten.
DeepSeek · Agentic Engineering · Coding Agents
GPT-5.6 Sol: ein Preview ist noch kein Produktivbetrieb
OpenAI startet einen begrenzten Preview der GPT-5.6-Reihe. Stärker im Coding, enger im Zugang. Was im Datenblatt steht, ist noch nicht, was im Betrieb hält.
OpenAI · Coding Agents · Verification
Agentic Engineering: nicht das Modell, die Methode
Welches KI-Modell Sie nutzen, ändert sich ständig. Was bleibt, ist die Methode: Struktur, Prüfung, Architektur. Mein Rahmen für Software mit KI.
Agentic Engineering · Verification · Coding Agents
Delegieren statt chatten: Claude Tag zieht in Slack ein
Anthropic stellt Claude Tag vor: einen geteilten, proaktiven Agent im Slack-Kanal. Warum das mehr ist als ein Bot, und welche Frage er nicht löst.
Agentic Engineering · Coding Agents · Automation · Claude
Claude Code härtet die Orchestrierung: Verlässlichkeit gehört in die Architektur
Tiefenlimit für geschachtelte Sub-Agents, MCP-Calls, die abbrechen statt zu hängen, Kontext zurück nach /clear. Drei Changelog-Einträge, ein Thema: Verlässlichkeit.
Claude · Coding Agents · Agentic Engineering · Verification
Codex Remote ist GA: der Agent arbeitet, der Mensch gibt frei
OpenAI bringt Codex Remote in die allgemeine Verfügbarkeit. Der Agent läuft auf Ihrem Host, gesteuert aus der App. Die Freigabe bleibt beim Menschen.
OpenAI · Coding Agents · Automation · Verification
Agentic Engineering: nicht ob KI, sondern wie
Nicht ob man KI nutzt macht den Unterschied, sondern wie viel Struktur und Prüfung die Ausgabe umgibt. Meine Sicht nach drei Technologiewechseln.
Agentic Engineering · Context Engineering · Verification
Kimi K2.7 Code: offene Gewichte senken die Schwelle, nicht die Verantwortung
Moonshot AI stellt Kimi K2.7 Code vor: offene Gewichte, 256K Kontext, niedrige Preise. Der Zugang wird breiter, die Prüfung bleibt Ihre Aufgabe.
Kimi · Coding Agents · Verification
Connectors bei Mistral: Zugriff eng führen, Fehler nachvollziehen
Mistral grenzt Connectors per API-Key ein, gibt einen Schritt-für-Schritt-Debugger und bringt sie in den Coding-Agent. Zugriff eng, Fehler prüfbar.
Mistral · Coding Agents · Verification
Computer Use in Gemini 3.5 Flash: nicht die Fähigkeit, die Absicherung
Computer Use wird natives Tool in Gemini 3.5 Flash. Steuerung über Browser, Desktop und Mobile in einem schnellen Modell. Der Prüfstein bleibt die Absicherung.
Google · Agentic Engineering · Coding Agents · Automation · Verification
Mistral OCR 4: gut, weil es seine Unsicherheit zeigt
Mistral OCR 4 wandelt Dokumente in strukturierte Daten. Stark ist nicht der Benchmark, sondern die Konfidenz pro Wort. Genau das macht Prüfen möglich.
Mistral · Automation · Verification
Die Interactions API ist GA: bequem, aber wem gehört der Loop?
Googles Interactions API erreicht GA und wird der Standardpfad für Gemini-Agents. Managed Agents nehmen die Orchestrierung ab. Der Loop wandert zum Anbieter.
Google · Agentic Engineering · Automation
Sakana Fugu: Orchestrierung als Produkt, die Prüfung bleibt bei Ihnen
Sakana liefert ein Multi-Agenten-System als ein Modell hinter einer OpenAI-kompatiblen API. Die Orchestrierung übernimmt Sakana, die Prüfung nicht.
Agentic Engineering · Automation · Verification
Grok Build /goal: die Selbstprüfung ist eingebaut, der Beweis nicht
xAI bringt /goal in Grok Build: ein autonomer Ausführen-und-Prüfen-Lauf. Die Schleife steckt jetzt im Werkzeug, der Beweis bleibt Ihre Aufgabe.
xAI · Coding Agents · Automation · Verification
Fable 5 zurückgerufen: ein Modell ist kein Fundament
Drei Tage nach dem Start sperrt eine US-Exportkontrolle den Zugang zu Fable 5, weltweit. Der eigentliche Punkt ist nicht der Anlass, sondern die Abhängigkeit.
Agentic Engineering · Claude
Claude Fable 5: Fähigkeit ist nicht Verlässlichkeit
Anthropic stellt Fable 5 und Mythos 5 vor, einen Sprung über die Opus-Klasse. Für verlässlich ausgelieferte Software zählt etwas anderes als Fähigkeit.
Agentic Engineering · Claude · Coding Agents · Verification
Loop Engineering: Schleifen bauen statt prompten
Hört auf, Coding-Agents zu prompten, baut Schleifen, die sie prompten. Was Loop Engineering ist, und warum die Prüfung trotzdem bei Ihnen bleibt.
Agentic Engineering · Coding Agents · Automation · Verification · Claude
NVIDIA Nemotron 3 Ultra: gebaut für lange Agentenläufe, geprüft werden sie trotzdem
NVIDIA bringt Nemotron 3 Ultra: 550 Milliarden Parameter, offene Gewichte, gebaut für lange Agentenläufe. Günstiger und schneller heißt: mehr Läufe, mehr Prüfung.
NVIDIA · Agentic Engineering · Verification
Claude Opus 4.8: nicht die Benchmarks, die Prüfung
Opus 4.8 ist da. Wichtiger als die Benchmarks: Das Modell lässt rund viermal seltener Code-Fehler durchgehen. Da entscheidet sich der Nutzen.
Agentic Engineering · Claude · Verification · Coding Agents · Automation
NVIDIA Nemotron 3 Nano Omni: Wahrnehmung wird billig, die Verantwortung nicht
NVIDIA bringt Nemotron 3 Nano Omni: ein kleines, offenes Modell für Bild, Ton und Text. Es sieht den Bildschirm und handelt. Geprüft wird das von Ihnen.
NVIDIA · Agentic Engineering · Verification
GPT-5.5: mehr Autonomie heißt nicht weniger Prüfung
GPT-5.5 ist stärker im agentischen Coding, bei gleicher Latenz und weniger Tokens. Je länger ein Modell allein läuft, desto wichtiger wird die Prüfung.
OpenAI · Coding Agents · Verification