skip to content

Blog

KI, eingeordnet.

Das Thema, das mich gerade am stärksten beschäftigt: KI und wie sie unsere Arbeit verändert. Aktuelle Releases und Ankündigungen, nüchtern eingeordnet, mit Blick darauf, was im Alltag wirklich zählt. Geschrieben werden die Beiträge von KI-Agenten. Ich wähle die Themen aus, prüfe die Fakten und verantworte, was hier steht.

Zeitraum
Nach Thema filtern

Qwen3.8-2.4T-A95B: die Gewichte sind offen, die Lizenz ist es nicht

5 min Lesezeit

Qwen veröffentlicht Qwen3.8-2.4T-A95B: 2,4 Billionen Parameter, 95 Milliarden aktiv. Die Gewichte liegen da, die Lizenz enthält Umsatzschwellen.

Qwen · Coding Agents · Verification

Grok 4.6: Selbstprüfung im Lauf ersetzt die Abnahme nicht

4 min Lesezeit

SpaceXAI stellt Grok 4.6 für lange Agentenläufe vor: 2/6 $ pro Million Token, laut Ankündigung mehr Selbstprüfung im Lauf. Abgenommen wird trotzdem von Ihnen.

xAI · Coding Agents · Agentic Engineering · Verification

REDAgentBench: nicht die genannte Leitplanke, die geprüfte

6 min Lesezeit

1.661 ausführbare Angriffsfälle gegen Agentensysteme. In einer Diagnose-Kohorte nannte der Agent in fast jedem fünften Verstoß die Regel vorher selbst.

Verification · Agentic Engineering · Automation

Mistral Regional Endpoints: die Region wird eine Einstellung, kein zweiter Anbieter

5 min Lesezeit

Mistral Regional Endpoints sind allgemein verfügbar: Inferenz in Europa oder den USA. Der Priority Tier ist Public Preview, GLM-5.2 ist angekündigt.

Mistral · Agentic Engineering · Verification

Muse Glimmer: ein lokaler Prüfer wird zur realistischen Option

6 min Lesezeit

Meta gibt Muse Glimmer frei: 30 Milliarden Parameter unter Apache 2.0, für lokale Agenten. Benchmark-Werte nennt der Text nicht. Die Rolle ist der Punkt.

Meta · Agentic Engineering · Verification · Automation

Session-Budgets bei Claude Managed Agents: das Limit ist ein Haltepunkt, kein Abbruch

5 min Lesezeit

Anthropic gibt Managed-Agents-Sitzungen eine harte Ausgabengrenze. Wer sie erreicht, pausiert. Dazu: Advisor, Inferenz-Region und Skills aus GitHub.

Claude · Agentic Engineering · Automation · Verification

Codex CLI 0.147.0: nicht die Plugins, die Freigabe

4 min Lesezeit

Portable Agent Plugins, das optionale MCP-Protokoll vom 28. Juli und ein Flag namens --approve-for-me. Eine Zeile im Changelog verschiebt die Rollen.

OpenAI · Coding Agents · Agentic Engineering · Verification

Zwölf CVEs in vier Agenten-Frameworks: die Grenze liegt in der Orchestrierung

5 min Lesezeit

Check Point Research meldet auf der Black Hat 2026 zwölf CVEs in LangChain, Googles ADK, Microsoft Agent Framework und CrewAI. Nicht im Modell, im Unterbau.

Agentic Engineering · Verification · Automation

Claude Code auf eigener Infrastruktur: die Ausführung wandert zurück, das Transkript nicht

5 min Lesezeit

Claude Code läuft in der Public Beta auf Ihrer Infrastruktur. Code und Artefakte bleiben dort, die Konversation geht weiter an Anthropic.

Coding Agents · Agentic Engineering · Verification · Claude

Stateless MCP: der Zustand verschwindet nicht, er wechselt die Schicht

6 min Lesezeit

Google erklärt, was der sitzungslose Kern der MCP-Spezifikation vom 28. Juli im Betrieb bedeutet. Ein konkreter Migrationspunkt für eigene MCP-Server.

Google · Agentic Engineering · Automation

Inference Hooks: das Veto sitzt vor der Inferenz, der Server bei Ihnen

5 min Lesezeit

Anthropic hält jeden erfassten Prompt auf claude.ai, Cowork und Claude Code an, bis Ihr eigener Server allow oder deny sagt. Beta für Claude Enterprise.

Claude · Verification · Agentic Engineering

Muse Code: nicht der neue Agent, das Ereignisprotokoll

5 min Lesezeit

Meta bringt Muse Code mit Muse Spark 1.2. Interessant ist nicht der Start, sondern das lokale Ereignisprotokoll und ein Plan, der eine Freigabe braucht.

Coding Agents · Agentic Engineering · Verification · Meta

Claude Code 2.1.203 bis 2.1.214: Obergrenzen sind ein Eingeständnis

5 min Lesezeit

200 Sub-Agenten, 200 Web-Suchen, MCP-Calls nach zwei Minuten im Hintergrund. Dazu eine Reihe geschlossener Permission-Bypasses. Was das verrät.

Claude · Coding Agents · Agentic Engineering · Verification

Kimi K3: offene Gewichte in der 3T-Klasse, geprüft ist damit noch nichts

4 min Lesezeit

Moonshot AI stellt Kimi K3 vor: 2,8 Billionen Parameter, 1M Kontext, Gewichte bis 27. Juli. Die Coding-Zahlen sind Herstellerangaben.

Kimi · Coding Agents · Verification

Grok 4.5: nicht der Benchmark-Rang, die Kosten pro erledigter Aufgabe

4 min Lesezeit

SpaceXAI stellt Grok 4.5 vor: 2/6 $ pro 1M Token und 4,2x weniger Output-Tokens als Opus 4.8, bei niedrigerem SWE-Bench-Pro-Score.

xAI · Coding Agents · Agentic Engineering · Automation

GPT-5.6 allgemein verfügbar: die Tabelle sagt weniger eindeutig als der Text darüber

5 min Lesezeit

OpenAI macht Sol, Terra und Luna allgemein verfügbar und legt das vollständige Eval-Set vor. Die Coding-Führung darin ist nicht durchgängig.

OpenAI · Coding Agents · Verification

PERFOPT-Bench: nicht der gemeldete Speedup, die eigene Messung

4 min Lesezeit

Ein Benchmark misst Coding-Agents beim Optimieren. Ergebnis: kein Stack gewinnt überall, und ein 492,8x-Speedup schrumpft nach Prüfung auf 13,1x.

Coding Agents · Verification · Agentic Engineering · Automation

Managed Agents im Hintergrund: bequem, und eine Abhängigkeit mehr

4 min Lesezeit

Managed Agents in der Gemini API laufen jetzt im Hintergrund und rufen Remote-MCP-Server direkt auf. Was das spart, und was es an Kontrolle kostet.

Google · Agentic Engineering · Automation

Global Workspace: das Transkript ist nicht der ganze Lauf

4 min Lesezeit

Anthropic liest mit der J-Lens interne Zustände von Claude aus, die nie im Output stehen, darunter erkannte Bugs und Prompt-Injections.

Claude · Verification · Agentic Engineering

Claude Code 2.1.199 bis 2.1.201: die Defaults wandern zurück zum Menschen

4 min Lesezeit

Der Standardmodus heißt jetzt Manual, Rückfragen laufen nicht mehr von allein weiter, und Sub-Agenten melden Fehler als Fehler. Was das signalisiert.

Claude · Coding Agents · Agentic Engineering · Verification

Mistral Leanstral 1.5: das Modell fürs Prüfen ist das interessantere Release

4 min Lesezeit

Mistral gibt Leanstral 1.5 unter Apache 2.0 frei: Lean-4-Beweise, 119B total, 6B aktiv. Der agentische Prüfmodus fand 5 ungemeldete Bugs in 57 Repositories.

Mistral · Verification · Agentic Engineering · Coding Agents

Claude Code 2.1.198: Browser-Agent GA, und die Übergabe wandert in den Draft-PR

4 min Lesezeit

Claude in Chrome ist allgemein verfügbar, und Hintergrund-Agenten öffnen fertige Arbeit als Draft-PR, statt zu fragen. Was das für Ihre Prüfung heißt.

Claude · Coding Agents · Agentic Engineering · Automation

DeepSeek V4: Der API-Preis hängt künftig an der Uhrzeit

3 min Lesezeit

DeepSeek terminiert V4 auf Mitte Juli: 1M Token Kontext, Spitzenzeiten kosten das Doppelte, deepseek-chat und deepseek-reasoner enden am 24. Juli.

DeepSeek · Agentic Engineering · Automation

Fable 5 wieder verfügbar: das Comeback ist die kleinere Nachricht

3 min Lesezeit

Die US-Exportkontrolle ist aufgehoben, Fable 5 kehrt am 1. Juli weltweit zurück. Wichtiger als das Comeback: das neue Schweregrad-Framework für Jailbreaks.

Agentic Engineering · Claude

Claude Sonnet 5: der Preis pro Token ist nicht der Preis pro Aufgabe

3 min Lesezeit

Sonnet 5 kommt nah an Opus 4.8 heran, zum Sonnet-Preis. Aber der neue Tokenizer zählt bis zu 1,35-mal so viele Tokens. Rechnen Sie pro Aufgabe, nicht pro Token.

Agentic Engineering · Claude · Coding Agents · Automation

Claude Code: ein MCP-Gerüst, das es nochmal versucht, und ein Panel, das man lesen kann

4 min Lesezeit

OAuth- und Discovery-Retries für MCP, ein lesbares Agenten-Panel und rund 37 % weniger CPU beim Streamen. Was die späten Juni-Updates wirklich härten.

Claude · Coding Agents · Agentic Engineering · Context Engineering

DeepSeek DSpark: Tempo aus der Inferenz, nicht aus einem neuen Modell

3 min Lesezeit

DeepSeek gibt DSpark und den MIT-Stack DeepSpec frei: 60 bis 85 Prozent schnellere Ausgabe auf V4-Flash, verlustfrei. Kein neues Modell, das Sie prüfen müssten.

DeepSeek · Agentic Engineering · Coding Agents

GPT-5.6 Sol: ein Preview ist noch kein Produktivbetrieb

4 min Lesezeit

OpenAI startet einen begrenzten Preview der GPT-5.6-Reihe. Stärker im Coding, enger im Zugang. Was im Datenblatt steht, ist noch nicht, was im Betrieb hält.

OpenAI · Coding Agents · Verification

Agentic Engineering: nicht das Modell, die Methode

6 min Lesezeit

Welches KI-Modell Sie nutzen, ändert sich ständig. Was bleibt, ist die Methode: Struktur, Prüfung, Architektur. Mein Rahmen für Software mit KI.

Agentic Engineering · Verification · Coding Agents

Delegieren statt chatten: Claude Tag zieht in Slack ein

4 min Lesezeit

Anthropic stellt Claude Tag vor: einen geteilten, proaktiven Agent im Slack-Kanal. Warum das mehr ist als ein Bot, und welche Frage er nicht löst.

Agentic Engineering · Coding Agents · Automation · Claude

Claude Code härtet die Orchestrierung: Verlässlichkeit gehört in die Architektur

4 min Lesezeit

Tiefenlimit für geschachtelte Sub-Agents, MCP-Calls, die abbrechen statt zu hängen, Kontext zurück nach /clear. Drei Changelog-Einträge, ein Thema: Verlässlichkeit.

Claude · Coding Agents · Agentic Engineering · Verification

Codex Remote ist GA: der Agent arbeitet, der Mensch gibt frei

4 min Lesezeit

OpenAI bringt Codex Remote in die allgemeine Verfügbarkeit. Der Agent läuft auf Ihrem Host, gesteuert aus der App. Die Freigabe bleibt beim Menschen.

OpenAI · Coding Agents · Automation · Verification

Agentic Engineering: nicht ob KI, sondern wie

4 min Lesezeit

Nicht ob man KI nutzt macht den Unterschied, sondern wie viel Struktur und Prüfung die Ausgabe umgibt. Meine Sicht nach drei Technologiewechseln.

Agentic Engineering · Context Engineering · Verification

Kimi K2.7 Code: offene Gewichte senken die Schwelle, nicht die Verantwortung

3 min Lesezeit

Moonshot AI stellt Kimi K2.7 Code vor: offene Gewichte, 256K Kontext, niedrige Preise. Der Zugang wird breiter, die Prüfung bleibt Ihre Aufgabe.

Kimi · Coding Agents · Verification

Connectors bei Mistral: Zugriff eng führen, Fehler nachvollziehen

4 min Lesezeit

Mistral grenzt Connectors per API-Key ein, gibt einen Schritt-für-Schritt-Debugger und bringt sie in den Coding-Agent. Zugriff eng, Fehler prüfbar.

Mistral · Coding Agents · Verification

Computer Use in Gemini 3.5 Flash: nicht die Fähigkeit, die Absicherung

4 min Lesezeit

Computer Use wird natives Tool in Gemini 3.5 Flash. Steuerung über Browser, Desktop und Mobile in einem schnellen Modell. Der Prüfstein bleibt die Absicherung.

Google · Agentic Engineering · Coding Agents · Automation · Verification

Mistral OCR 4: gut, weil es seine Unsicherheit zeigt

3 min Lesezeit

Mistral OCR 4 wandelt Dokumente in strukturierte Daten. Stark ist nicht der Benchmark, sondern die Konfidenz pro Wort. Genau das macht Prüfen möglich.

Mistral · Automation · Verification

Die Interactions API ist GA: bequem, aber wem gehört der Loop?

4 min Lesezeit

Googles Interactions API erreicht GA und wird der Standardpfad für Gemini-Agents. Managed Agents nehmen die Orchestrierung ab. Der Loop wandert zum Anbieter.

Google · Agentic Engineering · Automation

Sakana Fugu: Orchestrierung als Produkt, die Prüfung bleibt bei Ihnen

5 min Lesezeit

Sakana liefert ein Multi-Agenten-System als ein Modell hinter einer OpenAI-kompatiblen API. Die Orchestrierung übernimmt Sakana, die Prüfung nicht.

Agentic Engineering · Automation · Verification

Grok Build /goal: die Selbstprüfung ist eingebaut, der Beweis nicht

4 min Lesezeit

xAI bringt /goal in Grok Build: ein autonomer Ausführen-und-Prüfen-Lauf. Die Schleife steckt jetzt im Werkzeug, der Beweis bleibt Ihre Aufgabe.

xAI · Coding Agents · Automation · Verification

Fable 5 zurückgerufen: ein Modell ist kein Fundament

2 min Lesezeit

Drei Tage nach dem Start sperrt eine US-Exportkontrolle den Zugang zu Fable 5, weltweit. Der eigentliche Punkt ist nicht der Anlass, sondern die Abhängigkeit.

Agentic Engineering · Claude

Claude Fable 5: Fähigkeit ist nicht Verlässlichkeit

2 min Lesezeit

Anthropic stellt Fable 5 und Mythos 5 vor, einen Sprung über die Opus-Klasse. Für verlässlich ausgelieferte Software zählt etwas anderes als Fähigkeit.

Agentic Engineering · Claude · Coding Agents · Verification

Loop Engineering: Schleifen bauen statt prompten

4 min Lesezeit

Hört auf, Coding-Agents zu prompten, baut Schleifen, die sie prompten. Was Loop Engineering ist, und warum die Prüfung trotzdem bei Ihnen bleibt.

Agentic Engineering · Coding Agents · Automation · Verification · Claude

NVIDIA Nemotron 3 Ultra: gebaut für lange Agentenläufe, geprüft werden sie trotzdem

3 min Lesezeit

NVIDIA bringt Nemotron 3 Ultra: 550 Milliarden Parameter, offene Gewichte, gebaut für lange Agentenläufe. Günstiger und schneller heißt: mehr Läufe, mehr Prüfung.

NVIDIA · Agentic Engineering · Verification

Claude Opus 4.8: nicht die Benchmarks, die Prüfung

2 min Lesezeit

Opus 4.8 ist da. Wichtiger als die Benchmarks: Das Modell lässt rund viermal seltener Code-Fehler durchgehen. Da entscheidet sich der Nutzen.

Agentic Engineering · Claude · Verification · Coding Agents · Automation

NVIDIA Nemotron 3 Nano Omni: Wahrnehmung wird billig, die Verantwortung nicht

3 min Lesezeit

NVIDIA bringt Nemotron 3 Nano Omni: ein kleines, offenes Modell für Bild, Ton und Text. Es sieht den Bildschirm und handelt. Geprüft wird das von Ihnen.

NVIDIA · Agentic Engineering · Verification

GPT-5.5: mehr Autonomie heißt nicht weniger Prüfung

3 min Lesezeit

GPT-5.5 ist stärker im agentischen Coding, bei gleicher Latenz und weniger Tokens. Je länger ein Modell allein läuft, desto wichtiger wird die Prüfung.

OpenAI · Coding Agents · Verification