AI-Briefing · Kalenderwoche 27

Was diese Woche in KI zählte.

29. Juni–5. Juli 2026 · 20 Meldungen

Jede Woche lese ich die wichtigsten KI-Quellen und destilliere, was für Mittelstands-Teams wirklich relevant ist. Hier die Auswahl der KW27.

Highlights

11
BoostGoogle DeepMind Blog

Introducing computer use in Gemini 3.5 Flash

Google DeepMind hat Gemini 3.5 Flash mit "Computer Use"-Fähigkeit aktualisiert, die es dem Modell ermöglicht, direkt mit Computern zu interagieren – ähnlich wie ein Agent Screenshots analysiert, Mausklicks und Tastatureingaben ausführt. Das Feature ist ab sofort in der API verfügbar und erweitert die Möglichkeiten von agentengestützten Anwendungen erheblich.

Warum's zähltFür AI-Builder und Ops ist das relevant, da Computer-Use-Fähigkeiten die Entwicklung von autonomen Agenten und Automatisierungslösungen massiv vereinfachen – ohne komplexe Integrations-APIs mehr schreiben zu müssen.

BoostOpenAI Blog

Previewing GPT-5.6 Sol: a next-generation model

OpenAI kündigt GPT-5.6 Sol an – ein neues Modell mit verbessertem Coding, Science und Cybersecurity-Fähigkeiten sowie erweiterter Safety-Infrastruktur.

Warum's zähltFür AI-Builder und Dev-Teams relevant: GPT-5.6 Sol bietet signifikante Verbesserungen bei technischen Use-Cases (Coding, Science) und sollte evaluiert werden für produktive Anwendungen.

BoostAnthropic News

Introducing Claude Sonnet 5

Anthropic hat Claude Sonnet 5 vorgestellt, das nächste Modell in der Sonnet-Reihe. Es verspricht verbesserte Performance über die bisherigen Sonnet-Versionen.

Warum's zähltNeue Modellversion von Anthropics bestbesetzter Serie - relevant für alle, die Claude in Production einsetzen oder evaluieren.

BoostSimon Willison

What's new in Claude Sonnet 5

Claude Sonnet 5 wurde veröffentlicht und bietet Performance nahe an Opus 4.8 zu deutlich niedrigeren Kosten. Allerdings nutzt das Modell einen neuen Tokenizer, der denselben Input etwa 30% teurer macht als Sonnet 4.6, mit Adaptive Thinking standardmäßig aktiviert und entfernten Sampling-Parametern.

Warum's zähltBuilders müssen mit 30% höheren Token-Kosten rechnen und sich an neue API-Limitations anpassen, während die Leistung substantiell verbessert ist – ein wichtiger Rechencheck für bestehende Claude-Deployments.

BoostOpenAI Blog

How agents are transforming work

OpenAI veröffentlicht Research Paper darüber, wie AI Agents längere und komplexere Aufgaben bewältigen und Produktivität über verschiedene Rollen hinweg steigern.

Warum's zähltFür Builder und Tech-Leads relevant, um zu verstehen, wie Agent-basierte Systeme in Production eingesetzt werden können und welche neuen Möglichkeiten sich für Workflow-Automation öffnen.

BoostAlex Sprogis

NUR SO nutzt du Claude Fable 5 richtig!

Claude Fable 5 ist zurück und Anthropic hat eine offizielle Prompting-Anleitung veröffentlicht. Das Video behandelt 6 zentrale Regeln für effektive Prompts bei Fable 5, um bei aktuellen Token-Kosten (10 $ pro Million Input-, 50 $ pro Million Output-Tokens) Geld zu sparen. Bis 7. Juli ist Fable 5 teilweise in Pro-, Max- und Team-Plänen enthalten.

Warum's zähltFür Devs und Builders, die Claude Fable 5 einsetzen: Durch korrekte Prompt-Struktur lassen sich Token-Kosten deutlich reduzieren und die Modell-Performance optimieren.

BoostOpenAI Blog

Mapping Europe's AI Workforce Opportunity

OpenAI veröffentlicht einen Report zur Umgestaltung von Berufsbildern in der EU durch AI, mit Analyse welche Berufe von Automatisierung betroffen, Wachstumspotenzial haben oder Workflow-Änderungen erleben werden.

Warum's zähltFür Tech-Leads und AI-Builder relevant, um zu verstehen, wie sich Skill-Anforderungen und Job-Landschaften in Europa verschieben und wo AI-Fähigkeiten künftig zentral werden.

BoostCole Medin

Finally, an Open Standard for the Karpathy LLM Wiki is HERE

Google hat das Open Knowledge Format (OKF) veröffentlicht – ein offener Standard, der Andrej Karpathys LLM-Wiki-Muster in lesbares Markdown formalisiert. Damit können AI-Agents ohne zusätzliche Integration (kein RAG, kein Plugin) Wissen aus Markdown-Dateien direkt abfragen und nutzen.

Warum's zähltOKF löst ein praktisches Infrastruktur-Problem für AI-Builder: Es ermöglicht, Wissensdatenbanken zwischen Agents ohne Custom-Integration auszutauschen – relevant für jeden, der mit RAG, Agents oder Knowledge-Management arbeitet.

BoostEverlast AI (Leonard Schmedding)

Vergiss “Second Brains”! So baust du ECHTES KI-Wissensmanagement (KOMPLETTKURS)

Leonard Schmedding von Everlast AI veröffentlicht einen umfassenden Video-Komplettkurs zu KI-Wissensmanagement mit Fokus auf praktische Implementierung: RAG-Techniken, Hybrid Search, Reranking, Knowledge Graphs und GraphRAG werden von Grundlagen bis Monetarisierung abgedeckt.

Warum's zähltFür Builders und Ops ist dieser Kurs relevant, um Wissensmanagement-Systeme über die gängigen "Second Brain"-Konzepte hinaus zu verstehen und produktiv einzusetzen – vom technischen Setup bis zur Geschäftsmodellierung.

BoostCole Medin

The Best AI Coding Setup Isn't the Most Autonomous One (Here's Why)

Cole Medin präsentiert Dan Shapiros Klassifikation der KI-Code-Automatisierung in fünf Stufen – von Autocompletion bis zur vollautomatisierten "Dark Software Factory". Das Video argumentiert, dass maximale Autonomie nicht immer das beste Setup ist und erklärt praktische Trade-offs zwischen Automation und menschlicher Kontrolle.

Warum's zähltFür AI-Builder ist das Video relevant, um zu verstehen, dass nicht Stufe 5 (vollständige Autonomie) das Ziel sein muss – je nach Use-Case können frühere Automation-Levels schneller, kostengünstiger und zuverlässiger sein.

BoostNiklas Steenfatt

KI programmiert Apps, aber es wird immer schwieriger

Niklas Steenfatt testet KI-Tools beim Software-Development über sieben Schwierigkeitsstufen und zeigt, dass AI-Code-Generierung bei einfachen Tasks zuverlässig funktioniert, aber mit steigender Komplexität deutlich fehleranfälliger wird. Die praktischen Grenzen von aktuellen LLMs beim professionellen Programmieren werden dabei konkret demonstriert.

Warum's zähltWer KI-Tools zur Code-Generierung in Production einsetzt, muss realistisch einschätzen, wofür sie taugen: Boilerplate und einfache Tasks ja, komplexe Architekturen und kritische Systems erfordern weiterhin menschliche Expertise und Review.

Releases

4
OpenAI Blog

OpenAI and Broadcom unveil LLM-optimized inference chip

OpenAI und Broadcom stellen Jalapeño vor, einen Custom-Chip speziell für LLM-Inferenz optimiert. Der Chip soll Performance, Effizienz und Skalierung in AI-Systemen verbessern.

Warum's zähltRelevant für Ops und Builder: Custom-Chips reduzieren Kosten und Latenz bei Inferenz-Workloads – wichtig für die wirtschaftliche Skalierung von AI-Anwendungen.

Google DeepMind Blog

Start building with Nano Banana 2 Lite and Gemini Omni Flash

Google DeepMind hat zwei neue Modelle angekündigt: Nano Banana 2 Lite und Gemini Omni Flash, die für Entwickler zum Bauen von Anwendungen verfügbar sind. Diese Modelle adressieren Use Cases mit geringeren Latenz- und Ressourcenanforderungen.

Warum's zähltNeue, leichtgewichtige Modelle ermöglichen es Builders, schneller und kosteneffizienter AI-Features in Produktionen zu integrieren, besonders für Edge- und Mobile-Szenarien relevant.

Anthropic News

Redeploying Fable 5

Anthropic setzt Fable 5 neu ein, nachdem ein Rückzug stattgefunden hat. Der Blogpost behandelt die technische Neuimplementierung und verbesserte Version dieses Models.

Warum's zähltFür Builder ist relevant, dass Anthropic ein Model aus der Circulation genommen und überarbeitete Version neu ausrollt - zeigt Iterationsprozess und potenzielle API-Änderungen.

Simon Willison

Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding

Ornith-1.0 ist ein neues open-source Modell von DeepReinforce (MIT-lizenziert), spezialisiert auf Agentic Coding mit mehreren Varianten (9B bis 397B). Das Modell basiert auf Gemma 4 und Qwen 3.5 und erreicht State-of-the-Art-Performance bei Open-Source-Modellen vergleichbarer Größe auf Coding-Benchmarks. Simon Willison hat es erfolgreich mit LM Studio getestet und berichtet von guter Performance bei komplexen Multi-Tool-Agentenaufgaben.

Warum's zähltFür AI-Builder und Ops relevant: Ein lokal laufbares, gut-lizenzierbares Open-Source-Modell speziell für agentic Code-Arbeiten, das die Abhängigkeit von proprietären APIs reduziert.

Trends

1
OpenAI Blog

How ChatGPT adoption has expanded

OpenAI veröffentlicht neue Daten zur weltweiten ChatGPT-Adoption: Nutzer erhöhen ihre Nutzungsfrequenz, erkunden mehr Features und treiben Wachstum über Regionen und Sprachen hinweg.

Warum's zähltRelevante Marktdaten für Builder: Zeigt, wo ChatGPT-Integration aktuell Mehrwert liefert und welche Features Nutzer tatsächlich annehmen – wichtig für Roadmap-Prioritäten.

Security & Risiken

4
OpenAI Blog

Daybreak: Tools for securing every organization in the world

OpenAI stellt neue Daybreak-Tools vor, darunter Codex Security und GPT-5.5-Cyber, um Organisationen dabei zu helfen, Sicherheitslücken in großem Maßstab zu finden, zu validieren und zu beheben.

Warum's zähltFür Tech-Leads und Ops-Teams relevant: AI-gestützte Sicherheitswerkzeuge ermöglichen es, Vulnerability-Management zu automatisieren und die Security-Posture zu verbessern – besonders wichtig für größere Organisationen mit komplexer Infrastruktur.

Simon Willison

AI and Liability

Ein deutsches Gericht hat entschieden, dass Google für Fehler in seinen AI Overviews haftet – die Fehlausagen werden als Googles eigene Aussagen behandelt. Bruce Schneier und Nathan Sanders argumentieren, dass Unternehmen ihre KI-Systeme wie menschliche Mitarbeiter behandeln sollten und für deren Fehler haften müssen, um perverse Anreize für Kosteneinsparungen auf Kosten von Qualität zu vermeiden.

Warum's zähltFür AI-Builder und Ops-Teams wird dies zum Schlüsselproblem: KI-Systeme in Produkten müssen mit Liability im Hinterkopf gebaut werden – einfach auf Halluzinationen hinzuweisen reicht nicht aus, wenn der Betreiber haftet.

Google DeepMind Blog

Securing the future of AI agents

Google DeepMind veröffentlicht ein AI Control Roadmap zur Sicherung von AI-Agenten durch Kombination von traditionellen Sicherheitsvorkehrungen und Echtzeit-Monitoring interner Systeme.

Warum's zähltFür AI-Builder und Ops ist dieses Sicherheits-Framework relevant, um Agenten in Produktionsumgebungen verantwortungsvoll zu deployen.

Simon Willison

Prompt Injection as Role Confusion

Forschung zeigt, dass LLMs ihre eigenen privilegierten Systeminstruktionen nicht zuverlässig von Benutzer-Input unterscheiden können – sie folgen stattdessen dem Schreibstil des Textes. Durch „Destyling" sinkt die Erfolgsquote von Prompt-Injection-Attacken von 61% auf 10%, was belegt, dass Modelle Form über Inhalt priorisieren.

Warum's zähltFür jeden, der LLMs in Produktion einsetzt: Prompt-Injection über Role Confusion ist ein fundamentales Sicherheitsproblem, das nicht durch Prompt-Design allein lösbar ist – eine wichtige Erkenntnis für sichere Systeme.