WAVZ® KI-Briefing

Agenten ohne Feierabend – und eine Branche, die sich selbst prüfen will

OpenAI schickt KI-Agenten in den Dauerbetrieb OpenAI hat am Dienstag auf seiner Entwicklerkonferenz DevDay in San Francisco „dots“ vorgestellt: KI-Agenten, die nicht auf die nächste Frage warten, sondern rund um die Uhr an Zielen arbeiten, die man ihnen vorgib

KI & Mittelstand

OpenAI schickt KI-Agenten in den Dauerbetrieb OpenAI hat am Dienstag auf seiner Entwicklerkonferenz DevDay in San Francisco „dots“ vorgestellt: KI-Agenten, die nicht auf die nächste Frage warten, sondern rund um die Uhr an Zielen arbeiten, die man ihnen vorgibt. Das funktioniert, weil jeder dot auf einem eigenen Cloud-Computer läuft – einem virtuellen Rechner im Rechenzentrum von OpenAI. Er arbeitet also auch dann weiter, wenn dein Laptop längst zugeklappt ist. Angetrieben wird er vom Spitzenmodell GPT-6 Astra, über Plugins lassen sich mehr als 4.000 Apps anbinden, erreichbar ist er in ChatGPT, Slack und Microsoft Teams. Braucht der Agent eine Entscheidung, meldet er sich, bevor er weitermacht. Die Kontrolle läuft über Regeln: Für jede Art von Aktion legst du fest, ob der Agent sie selbst ausführen darf, vorher um Freigabe bitten muss oder sie gar nicht anfassen darf. Eine Aktivitätsansicht zeigt, woran er gerade im Hintergrund arbeitet; eigenständige Recherche läuft nur mit Lesezugriff, und heikle Dinge wie Passwortänderungen bleiben ausdrücklich beim Menschen. Für Deutschland wichtig: Privatnutzer:innen mit dem Pro-Abo im Europäischen Wirtschaftsraum, in der Schweiz und in Großbritannien bleiben vorerst außen vor. Unternehmen mit dem Tarif Business Premium bekommen dots dagegen in allen unterstützten Regionen, der erste Agent ist ohne Aufpreis enthalten. In Enterprise-Umgebungen gibt es eine Testversion, die zunächst abgeschaltet ist, bis die IT sie freigibt. Der eigentliche Sprung ist dabei nicht die Intelligenz, sondern die Dauer. Ein Assistent, der antwortet, ist ein Werkzeug. Einer, der eigenständig weiterarbeitet, ist eher ein Mitarbeiter ohne Arbeitsvertrag – und sollte auch so geführt werden. Für dich als Unternehmer:in heißt das: Erst die Regeln festlegen, dann den Schalter umlegen – welche Aktionen frei sind, welche eine Freigabe brauchen und wer die Aktivitätsansicht regelmäßig anschaut.

Agentenbuilding

Die unscheinbarste Neuheit der DevDay könnte die nützlichste sein: Mit der „Decisions API“ gibt OpenAI Entwickler:innen ein Werkzeug für schnelle Entscheidungen mit fest vorgegebenen Antwortmöglichkeiten. Das Prinzip: Du formulierst eine Frage und legst die erlaubten Antworten fest, übergibst den Kontext als Text oder Bild und bekommst eine dieser Antworten zurück – nichts anderes. Grundlage ist das kleinere Modell GPT-6 Luna. Laut OpenAI fällt die Entscheidung mit rund 150 Millisekunden etwa zehnmal schneller als bei einem normalen Luna-Aufruf mit 1,6 Sekunden. Die Schnittstelle startet als eingeschränkte Vorschau, die breite Freigabe soll bald folgen. Warum das zählt: Viele Schritte in Geschäftsprozessen sind in Wahrheit Multiple-Choice-Fragen. Ist diese E-Mail eine Bestellung, eine Reklamation oder Werbung? Gehört das Ticket in den Vertrieb oder in den Service? Ein Modell, das nur aus festen Optionen wählen darf, kann nicht ins Blaue fabulieren – sein Ergebnis lässt sich eindeutig protokollieren, prüfen und automatisch weiterverarbeiten. Dazu passt eine zweite Neuerung: Sogenannte MCP-Events lassen Plugins Automatisierungen auslösen, sobald in einer angebundenen App etwas passiert. MCP (Model Context Protocol) ist der offene Standard, über den KI-Modelle mit externen Programmen sprechen. Meine Lesart: Weniger Freiheit, mehr Verlässlichkeit – das ist die am meisten unterschätzte Designregel beim Agentenbau. Das Prinzip lässt sich übrigens mit jedem Modell nachbauen: erlaubte Antworten fest vorgeben und alles, was nicht passt, verwerfen.

Wissenschaft & Studien

Kann KI erkennen, ob ein IKEA-Möbel falsch zusammengebaut wurde? Das Forschungsinstitut Epoch AI hat genau das getestet: 60 Fotos von drei IKEA-Aufbauten – Schuhregal, Bettgestell, Kommode –, auf denen die Modelle mit Hilfe der Bauanleitung Montagefehler finden sollten. Das Ergebnis zeigt, wie schnell sich KI im Sehen und Prüfen verbessert: Im November 2025 lag der Bestwert noch bei 28 Prozent, zehn Monate später erreicht GPT-6 Astra 80 Prozent – bei im Mittel drei Minuten pro Aufgabe. Dahinter folgen zwei Claude-Modelle von Anthropic mit 70 und 61 Prozent. Was heißt das praktisch? Visuelle Qualitätskontrolle – etwa ein Foto vom fertig montierten Bauteil gegen die Arbeitsanweisung prüfen – rückt in Reichweite allgemeiner KI-Modelle. Die Forschenden selbst mahnen aber zur Vorsicht: 60 Fotos sind eine kleine Stichprobe, wie gut sich das auf andere Aufgaben überträgt, ist offen. Einen Prüfer ersetzt das nicht – aber als zweites Paar Augen wird es zunehmend ernst zu nehmen.

Praxis

Use-Case-Idee: der Ausschreibungs-Späher. Öffentliche Aufträge sind für viele Mittelständler ein lukrativer, aber mühsamer Markt: Die passenden Ausschreibungen verteilen sich auf Vergabeportale von Bund, Ländern, Kommunen und EU, und wer sie nicht regelmäßig durchsucht, verpasst Fristen. Genau diese Fleißarbeit kann ein KI-Agent übernehmen, der einmal täglich im Hintergrund läuft. So könnte er aussehen: Der Agent durchsucht jeden Morgen die relevanten Portale nach festgelegten Stichworten und Regionen. Jede Fundstelle bewertet er anhand von drei Kriterien, die du vorgibst – passt die Leistung zu unserem Angebot, passt das Auftragsvolumen, reicht die Frist für ein solides Angebot? Daraus erstellt er eine kurze Zusammenfassung pro Ausschreibung mit Empfehlung „prüfen“ oder „ignorieren“ und schickt sie gesammelt per E-Mail oder in den Teams-Kanal. Entscheidend ist die Arbeitsteilung: Der Agent liest nur und schlägt vor – ob ein Angebot geschrieben wird, entscheidet ein Mensch. Bauen lässt sich das mit Plattformen wie n8n, Make oder Zapier, als zeitgesteuerter Ablauf mit einem KI-Schritt für die Bewertung – oder künftig mit Dauerläufer-Agenten wie den oben beschriebenen. Der größte Hebel liegt nicht in der Technik, sondern in guten Bewertungskriterien: Wer vorher sauber aufschreibt, welche Aufträge sich wirklich lohnen, bekommt vom Agenten brauchbare Vorschläge statt einer weiteren überfüllten Mailbox.

Kurz & quer

  1. Die Chefs von OpenAI, Anthropic, Google, Meta, Nvidia, Amazon und Palantir sowie Elon Musk haben im Weißen Haus eine freiwillige Selbstverpflichtung zur sicheren Entwicklung besonders leistungsfähiger KI unterzeichnet. Sie sieht interne Kontrollen, mehrere Prüfebenen und die Durchsicht von Prüfberichten durch unabhängige Aufsichtsgremien vor; Präsident Trump nannte sie „moralisch bindend“, rechtlich verpflichtend ist sie nicht. Warum das zählt: Während Europa mit dem AI Act auf Gesetze setzt, bleiben die USA bei Selbstregulierung – Kritiker im Kongress fordern bereits verbindliche Standards. (ABC News, Roll Call) 2) Microsoft baut Copilot um: Neben „Home“ und „Code“ kommt mit „Autopilot“ ein Agent, der rund um die Uhr in Teams, Outlook und Dokumenten Aufgaben erledigt – Termine planen, Kanäle beobachten, Projekte nachhalten. Autopilot startet als geschlossene Vorschau. Warum das zählt: Der Wettlauf um den dauerhaft arbeitenden Büro-Agenten hat binnen einer Woche zwei Schwergewichte – für Microsoft-365-Betriebe dürfte Autopilot der naheliegendere Kandidat sein. (TechSpot) 3) Mit GPT-6.1 Sol hat OpenAI zudem ein Modell vorgestellt, das nahezu an das Spitzenmodell Astra heranreichen soll – zu einem Fünftel von dessen Preis pro Token. Warum das zählt: Wer KI-Anwendungen im großen Umfang betreibt, sollte seine Modellwahl erneut durchrechnen; die Preiskurve zeigt weiter steil nach unten. (OpenAI, Axios)

Quellen

Daily Briefing

Täglich per E-Mail.