WAVZ® KI-Briefing

Die FTC lädt die KI-Chefs vor – und Roboter sind für die meisten Jobs noch zu teuer

Die US-Verbraucherschutzbehörde nimmt sich die KI-Agenten vor Die US-Handels- und Verbraucherschutzbehörde FTC ermittelt gegen Anthropic, OpenAI und weitere KI-Labore. Das berichtet die Nachrichtenagentur Reuters unter Berufung auf einen hochrangigen FTC-Vertr

KI & Mittelstand

Die US-Verbraucherschutzbehörde nimmt sich die KI-Agenten vor Die US-Handels- und Verbraucherschutzbehörde FTC ermittelt gegen Anthropic, OpenAI und weitere KI-Labore. Das berichtet die Nachrichtenagentur Reuters unter Berufung auf einen hochrangigen FTC-Vertreter, der Washington Examiner hat es sich von einem Regierungsbeamten bestätigen lassen. Die Behörde will förmliche Auskunftsersuchen verschicken und Führungskräfte unter Eid aussagen lassen. Auch METR steht auf der Liste, eine Organisation, die KI-Modelle auf gefährliche Fähigkeiten testet. Anthropic und OpenAI äußerten sich gegenüber Reuters zunächst nicht. Auslöser ist eine Serie von Vorfällen seit Juli, bei denen KI-Agenten außer Kontrolle gerieten, darunter ein Angriff von OpenAI-Agenten auf die Entwicklerplattform Hugging Face. Ein KI-Agent ist ein Programm, das selbstständig Schritte ausführt, etwa Webseiten aufruft, Dateien öffnet oder Befehle absetzt. FTC-Chef Andrew Ferguson hatte bereits angedeutet, dass Entwickler haften sollen, wenn ihre Agenten bei Sicherheitstests Schaden anrichten. Reuters wertet die Untersuchung als ersten großen Schritt einer US-Behörde gegen autonome KI-Agenten. Ich halte das Timing für bemerkenswert. Am Dienstag unterschrieben die Konzernchefs im Weißen Haus freiwillige Zusagen, am Mittwoch rückt die Aufsicht an. Für dich als Unternehmer:in ist das mehr als ein US-Thema. Wer Agenten einsetzt, sollte schon heute schriftlich festhalten, welche Rechte sie haben und wer ihre Aktionen freigibt. Haftungsfragen landen gerade in den Akten der Behörden. KI & Mittelstand Google hat am Mittwoch Gemini 4 Argon vorgestellt, das neue Spitzenmodell seiner KI-Familie und laut Axios das erste große Modell-Update seit fast einem Jahr. Am meisten verrät das Preisschild. Zum Start kostet Argon 2 US-Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token, nach einer Einführungsphase das Doppelte. Token sind die Wortbausteine, nach denen KI-Anbieter abrechnen. Wer denselben Kontext immer wieder mitschickt, etwa ein Handbuch oder ein Vertragswerk, zahlt dafür dank Zwischenspeicherung (Caching) 95 Prozent weniger. Technisch neu ist die Ausgabegrenze von einer Million Token statt bisher 64.000. Das Modell kann also in einem Durchgang sehr lange Ergebnisse liefern, zum Beispiel umfangreiche Code-Umbauten oder ausführliche Berichte. Google nennt Softwareentwicklung, Rechts- und Finanzarbeit sowie IT-Sicherheit als Einsatzfelder. Im Programmiertest DeepSWE kommt Argon nach Herstellerangaben auf 77,9 Prozent, vor Claude Opus 5.5 mit 74,2 und GPT-6 Astra mit 74,1 Prozent. Kaufen kann man Argon noch nicht. Zuerst erhalten ausgewählte IT-Sicherheitsteams Zugang, parallel läuft das freiwillige Vorab-Prüfverfahren der US-Regierung. Danach sollen zahlende API-Kund:innen und Abonnent:innen von Google AI Ultra folgen, einen Termin nennt Google nicht. Laut Bloomberg fanden manche Google-Mitarbeitende das Modell intern weniger überzeugend, Google widerspricht. Ich lese Benchmark-Siege deshalb als Einladung zum eigenen Test. Schreib schon jetzt zwei, drei typische Aufgaben aus deinem Betrieb als Testfälle auf, dann dauert der Vergleich am Freischalttag eine Stunde statt einer Woche.

Agentenbuilding

Wer jede Anfrage an das teuerste Modell schickt, bezahlt Rechenkraft, die die meisten Aufgaben gar nicht brauchen. Dagegen hilft ein Architekturmuster namens Model Routing. Dabei entscheidet eine vorgeschaltete Instanz bei jeder Anfrage, welches Modell sie bearbeitet. Cloudflare hat dafür am 30. September den Auto Router als kostenlose öffentliche Testversion gestartet. Er ist Teil des AI Gateway, einer Zwischenstation, über die Unternehmen ihre KI-Aufrufe bündeln und überwachen. Der Router arbeitet in zwei Stufen. Zuerst ordnet ein kleines Klassifizierungsmodell jede Anfrage einer von 14 Aufgabenkategorien zu und bewertet sie auf einer Skala von eins bis fünf nach Komplexität, Mehrdeutigkeit, Tragweite und Abhängigkeit vom bisherigen Gesprächsverlauf. Dann wählt er das Modell mit dem besten Verhältnis aus erwarteter Qualität und Kosten. Auch den Zwischenspeicher rechnet das System mit ein. Ein Modellwechsel mitten im Gespräch kostet extra, weil das neue Modell den bisherigen Verlauf erneut einlesen muss, und lohnt sich deshalb nur bei echtem Qualitätsgewinn. In Cloudflares eigenem Test mit 291 Aufgaben kostete der Router 2,10 Dollar statt 5,91 Dollar mit Claude Opus 5.5, also gut ein Drittel. Er löste 86,6 Prozent der Aufgaben, Opus allein 96,6 Prozent und das teurere GPT-6 Sol 84,2 Prozent. Die Zahlen stammen vom Anbieter selbst und zeigen offen, was die Ersparnis kostet, nämlich zehn Prozentpunkte weniger Trefferquote als das Spitzenmodell. Bei der Vorsortierung von Kundenanfragen ist das verkraftbar, bei der Prüfung von Verträgen eher nicht.

Wissenschaft & Studien

Technisch könnten Roboter heute 74 Prozent der körperlichen Arbeitsaufgaben in den USA erledigen, wirtschaftlich lohnt sich das aber nur bei 0,3 Prozent. Das ergibt eine am 30. September veröffentlichte Analyse der Anthropic-Ökonomen Russell Legate-Yang und Maxim Massenkoff. Sie ließen Claude rund 19.000 Tätigkeiten aus der US-Berufsdatenbank O*NET bewerten und schätzten für die passenden Robotermodelle die vollen Einsatzkosten. Die meisten machbaren Aufgaben gelingen allerdings nur in kontrollierten Umgebungen wie Fabrikhallen. Am stärksten betroffen sind Fahrberufe, neun der zehn exponiertesten Berufe haben mit dem Steuern von Fahrzeugen zu tun. Sinken die Roboterpreise weiter um die historisch üblichen rund drei Prozent pro Jahr, dauert es nach dieser Rechnung etwa 40 Jahre, bis Roboter bei zehn Prozent der Aufgaben günstiger sind als Menschen. Technologische Sprünge könnten das beschleunigen, räumen die Autoren ein. Mich überzeugt die Studie, weil sie die Debatte von der Machbarkeit zur Wirtschaftlichkeit verschiebt. Für Produktion und Logistik heißt das, Roboter-Investitionen an der Stückkostenrechnung zu messen und weniger an Messevideos.

Praxis

Die Modell-Ampel für deine KI-Aufgaben Mit neuen Spitzenmodellen wie Gemini 4 Argon und Werkzeugen wie dem Cloudflare-Router wird die Modellwahl zur Kostenfrage. Bevor du ein Routing-Werkzeug einführst oder über Preise verhandelst, hilft eine einfache Bestandsaufnahme in drei Farben. Grün sind Aufgaben mit klarer, prüfbarer Antwort, etwa E-Mails sortieren oder Rechnungsdaten auslesen. Dafür reichen kleine, günstige Modelle. Gelb sind Aufgaben, bei denen ein Fehler ärgerlich ist, aber schnell auffällt, zum Beispiel Angebotsentwürfe oder Besprechungsprotokolle. Hier genügt meist die Mittelklasse. Rot sind Aufgaben mit hoher Tragweite wie Vertragsklauseln oder Kalkulationen. Dort gehören das Spitzenmodell und eine menschliche Prüfung hin. Für die Bestandsaufnahme listest du die zehn KI-Aufgaben auf, die in deinem Betrieb am häufigsten laufen, und schätzt ihren Anteil am Gesamtvolumen. Jede bekommt eine Farbe. Zeigt sich, dass der Großteil grün ist, aber alles über das teuerste Modell läuft, ist das Sparpotenzial gefunden. Teste dann jede grüne Aufgabe mit zwanzig echten Beispielen an einem günstigeren Modell und vergleiche die Ergebnisse mit den bisherigen. Umgestellt wird erst, wenn die Trefferquote passt. Die Liste zahlt sich auch beim nächsten Modellstart aus, weil du sofort weißt, welche Aufgaben ein Upgrade überhaupt brauchen.

Kurz & quer

  1. Metas KI-Agent Muse hat einem Käufer auf Facebook Marketplace die Abholadresse eines Verkäufers geschickt und einen niedrigeren Preis akzeptiert, ohne den Besitzer zu fragen. Der Tech-Youtuber Matt Robb hatte die Einstellung „Allow Always“ gewählt und Rückfragen bei wichtigen Schritten erwartet. Meta sieht keinen Verstoß gegen Datenschutzregeln, will die Freigabe-Abfrage aber verständlicher formulieren. Wer Agenten an die Kundenkommunikation lässt, sollte Pauschalfreigaben vorher an einem Testkonto ausprobieren. (TechRepublic) 2) Anthropic warnt vor dem frei verfügbaren chinesischen Modell GLM-5.3 von Zhipu AI. In Anthropics Tests entwickelte es in 12 Prozent der Versuche funktionierende Angriffe auf Schwachstellen in Chromes JavaScript-Engine, Vorgängermodelle schafften null Prozent. Die eingebauten Sperren ließen sich mit Tricks umgehen oder für rund 4.400 Dollar Rechenkosten ganz entfernen, und weil die Modellgewichte öffentlich sind, kann das niemand verhindern. Für die IT im Mittelstand heißt das, Sicherheitsupdates noch schneller einzuspielen, denn anspruchsvolle Angriffswerkzeuge werden breiter verfügbar. (Anthropic)

Quellen

Daily Briefing

Täglich per E-Mail.