WAVZ® KI-Briefing

ChatGPT rechnet jetzt im Chat vor, und Heidelberg verschenkt ein Sprachmodell

ChatGPT antwortet ab heute mit Rechnern, Karten und Diagrammen Wer heute ChatGPT öffnet, bekommt ein anderes Programm zu sehen. OpenAI hat am 7. Oktober das Modell GPT-6 in ChatGPT eingeführt und dazu eine Funktion namens Intelligent UI. Antworten bestehen dam

KI & Mittelstand

ChatGPT antwortet ab heute mit Rechnern, Karten und Diagrammen Wer heute ChatGPT öffnet, bekommt ein anderes Programm zu sehen. OpenAI hat am 7. Oktober das Modell GPT-6 in ChatGPT eingeführt und dazu eine Funktion namens Intelligent UI. Antworten bestehen damit nicht mehr nur aus Text. ChatGPT baut Schaltflächen, Formulare, Diagramme und kleine Rechner direkt in die Antwort ein, und du kannst sie im Gespräch bedienen. OpenAI zeigt als Beispiele einen Rechnungsteiler, einen Sparrechner für die Rente und eine Reiseroute mit Zwischenstopps auf einer Karte. Zahlende Konten (Plus, Pro, Business, Enterprise) arbeiten seit gestern mit GPT-6 Sol. Die kostenlosen und die günstigen Go-Konten folgen heute mit dem kleineren GPT-6 Luna. In Enterprise-Umgebungen hängt die Freischaltung von den Einstellungen der Administrator:innen ab. Laut OpenAI beginnt GPT-6 mit der Antwort, während es noch nachdenkt, und ist bei Fragen mit Websuche im Schnitt 44 Prozent früher beim ersten Wort als GPT-5.6 Instant. Wem die Grafiken zu viel werden, der kann ihre Menge laut TechCrunch in den Einstellungen herunterregeln. Ich halte die Rechner für den heikelsten Teil der Neuerung. Eine Zahl im Fließtext liest man misstrauisch, ein Rechner mit Eingabefeldern wirkt wie ein geprüftes Werkzeug. Gebaut hat ihn dasselbe Modell, das sich auch im Text verrechnen kann. Bevor ein Ergebnis aus so einem Rechner in ein Angebot oder eine Kalkulation wandert, gehört eine Kontrollrechnung dazu. Kolibri-1: ein offenes Sprachmodell aus Heidelberg Aleph Alpha aus Heidelberg hat am 3. Oktober ein Sprachmodell veröffentlicht, das jeder herunterladen und auf eigenen Servern betreiben darf. Kolibri-1 hat rund 78 Milliarden Parameter, das sind die Stellschrauben, die ein Modell im Training lernt. Pro Wortbaustein arbeiten davon nur etwa 3,5 Milliarden, weil das Modell aus vielen Spezialisten besteht und für jede Eingabe nur wenige aufruft. Diese Bauweise heißt Mixture of Experts und spart Rechenleistung im Betrieb. Die Gewichte stehen unter der Lizenz Apache 2.0, die auch die kommerzielle Nutzung ohne Gebühr erlaubt. Für deutsche Betriebe sind zwei Angaben aus der Modellkarte wichtig. Knapp 24 Prozent der Trainingstexte waren deutsch, und der Tokenizer wurde für zusammengesetzte deutsche Wörter entwickelt. Der Tokenizer ist das Bauteil, das Text in Wortbausteine zerlegt. Als Mindestausstattung nennt Aleph Alpha zwei Grafikkarten vom Typ Nvidia A100 mit je 80 Gigabyte Speicher oder eine einzelne H200. Das ist Technik fürs Rechenzentrum, die ein IT-Dienstleister oder ein gut ausgestatteter Serverraum aber stemmen kann. Die Leistungswerte stammen vom Hersteller, unabhängig geprüft sind sie nicht. Im Gesamtschnitt meldet Aleph Alpha für Deutsch 70,8 Punkte und für Englisch 75,5. Empfohlen wird das Modell ausdrücklich für Assistenten unter menschlicher Aufsicht. Zum Etikett „souverän“ gehört eine Fußnote. Laut Business Punk hat Aleph Alpha im September die Fusion mit dem kanadischen Anbieter Cohere vereinbart, die Genehmigung der Behörden steht aus. Für Kanzleien und andere Betriebe, die Mandanten- oder Kundendaten in keine fremde Cloud geben dürfen, ist Kolibri trotzdem einen Test wert.

Agentenbuilding

Anthropic hat am 7. Oktober Claude Haiku 5.5 veröffentlicht und den Preis seines kleinsten Modells um 90 Prozent gesenkt. Eine Million Token Eingabe kostet 0,10 US-Dollar, eine Million Token Ausgabe 0,50 Dollar. Token sind die Wortbausteine, in denen KI-Anbieter abrechnen. Der Vorgänger Haiku 4.5 lag bei 1 und 5 Dollar. Der neue Preis gilt nur für Anfragen bis 100.000 Token, darüber kostet Haiku 5.5 das Fünffache. Weil das Modell Texte in etwas mehr Token zerlegt als sein Vorgänger, rechnet Anthropic insgesamt mit rund 75 Prozent Ersparnis. Seinen Wert bekommt das Modell durch ein Architekturmuster, das Anthropic selbst empfiehlt. Ein großes Modell plant und entscheidet, kleine Modelle erledigen als Zuarbeiter (Subagenten) die Fleißarbeit. Der Anthropic-Kunde Rogo beschreibt seinen Einsatz so, dass ein großes Modell eine Finanzpräsentation baut und Haiku währenddessen eine einzelne Umsatzzahl heraussucht. Je mehr solcher Handgriffe ein Agent pro Aufgabe macht, desto stärker schlägt der Preis des kleinen Modells auf die Gesamtrechnung durch. Neu ist außerdem ein Regler für den Denkaufwand, den es in der Haiku-Klasse bisher nicht gab. Wie viel er ausmacht, zeigt der Programmiertest Terminal-Bench 4.0. Auf höchster Stufe löst Haiku 5.5 laut VentureBeat rund 39 Prozent der Aufgaben, auf der voreingestellten mittleren etwa 20. Alle Messwerte stammen von Anthropic. Wer einen Agenten bauen lässt, sollte deshalb festlegen lassen, welche Schritte an das kleine Modell gehen und auf welcher Stufe es dort rechnet.

Wissenschaft & Studien

OpenAI hat am 6. Oktober 722 mathematische Manuskripte auf der Entwicklerplattform GitHub veröffentlicht, sortiert in 372 Gruppen zusammengehöriger Ergebnisse. Geschrieben hat sie ein internes Modell, das noch nicht öffentlich verfügbar ist. Ein durchschnittliches Ergebnis hat laut OpenAI etwa drei Stunden Rechenzeit gekostet, gemessen am Denkaufwand eines ChatGPT-Pro-Zugangs. Viele Beweise liegen zusätzlich in Lean vor. Das ist eine Programmiersprache, in der ein Computer jeden Beweisschritt formal nachprüfen kann. Ob die Arbeiten wissenschaftlich etwas taugen, ist noch nicht bewertet, darauf weist t3n hin. Lean bestätigt, dass ein Beweis in sich stimmt. Ob das Bewiesene neu oder wichtig ist, beantwortet es nicht. OpenAI will Workshops und Konferenzen bezahlen, auf denen Fachleute die Ergebnisse durcharbeiten. Mich beschäftigt an der Meldung das Mengenverhältnis. Eine Maschine liefert Hunderte Arbeiten auf einmal, und das Prüfen bleibt an Menschen hängen. Dieselbe Schieflage entsteht in jedem Betrieb, in dem KI schneller Angebote oder Code schreibt, als jemand sie gegenlesen kann.

Praxis

Vier kleine Modelle im Preisvergleich Für Massenaufgaben wie das Sortieren von Eingangspost reicht ein kleines Modell, und in dieser Klasse liegen die Listenpreise weit auseinander. Die folgenden Preise gelten pro eine Million Token, erst Eingabe, dann Ausgabe, Stand 7. Oktober laut VentureBeat und den Preislisten von Anthropic und Google. Claude Haiku 5.5 von Anthropic kostet 0,10 / 0,50 Dollar, bei Anfragen über 100.000 Token 0,50 / 2,50. GPT-6 Luna von OpenAI kostet ebenfalls 0,10 / 0,50 Dollar, mit höheren Sätzen ab 272.000 Token Eingabe. Googles Gemini 3.5 Flash-Lite liegt bei 0,30 / 2,50 Dollar. Gemini 3.8 Flash kostet 0,75 / 3,75 Dollar als Aktionspreis bis 31. Dezember und ab Januar das Doppelte. Eine Beispielrechnung macht die Unterschiede greifbar. Angenommen, dein Betrieb lässt täglich 1.000 E-Mails einordnen, jede mit 2.000 Token Eingabe (Mail plus Anweisung) und 300 Token Ausgabe. Das sind 2 Millionen Token Eingabe und 0,3 Millionen Token Ausgabe am Tag. Mit Haiku 5.5 oder GPT-6 Luna kostet das 0,35 Dollar täglich, also 10,50 Dollar in 30 Tagen. Gemini 3.5 Flash-Lite käme auf 40,50 Dollar, Gemini 3.8 Flash zum Aktionspreis auf 78,75 Dollar. Das mittelgroße Claude Sonnet 5.5 (2 / 10 Dollar) läge bei 210 Dollar. Das ist eine Überschlagsrechnung. Jedes Modell zerlegt Text anders in Token, und ein billiges Modell, das Mails falsch einordnet, wird durch Nacharbeit teuer. Über die Qualität bei deutschen Texten sagen Listenpreise nichts. Sinnvoll ist deshalb ein Probelauf mit 100 echten, bereits von Hand sortierten Mails auf zwei Kandidaten, bei dem du Treffer und Kosten nebeneinander zählst. Bei Beträgen dieser Größe entscheidet die Trefferquote. Wer gar nicht pro Token zahlen will, betreibt ein offenes Modell wie Kolibri selbst und zahlt dann für Hardware und Strom.

Kurz & quer

  1. Finnland hat die Bauvorbereitungen für zwei Google-Rechenzentren in Muhos und Kajaani vorläufig gestoppt. Die Aufsichtsbehörde LVV verdächtigt Googles Vertreterfirma Tuike Finnland, an beiden Standorten Hunderte Hektar Wald ohne die vorgeschriebene Umweltprüfung gerodet zu haben, meldet die Agentur AFP. Google räumt ein, den eigenen Standards nicht gerecht geworden zu sein. Der Konzern hatte im September 13 Milliarden Euro für vier finnische Standorte angekündigt. Genehmigungen werden damit auch in Europa zum Risiko für die Cloud-Kapazität, an der viele KI-Dienste hängen. (Tagesspiegel/AFP, Der Standard) 2) Google hat seinen Prüfdienst für KI-Medien für alle geöffnet. Auf synthid.com lässt sich testen, ob ein Bild, ein Video oder eine Tonaufnahme ein unsichtbares SynthID-Wasserzeichen trägt, wie es Googles Modelle und Partner wie OpenAI und Nvidia einbauen. Texte prüft der Dienst nicht, und ein fehlendes Wasserzeichen beweist laut Business Punk keine Echtheit. Für einen ersten Blick auf zugeschickte Schadensfotos oder Bewerbungsbilder ist er trotzdem brauchbar. (TechCrunch, Business Punk) 3) Mecka AI hat 60 Millionen Dollar eingesammelt, angeführt vom Investor Sequoia, beteiligt sind auch Nvidia und Microsofts Risikokapitalfonds M12. Das 2024 gegründete Start-up bezahlt Menschen dafür, sich mit Körpersensoren und Smartphone bei Alltagsarbeiten wie Kaffeekochen oder Autoreparaturen aufzuzeichnen, und wertet die Bewegungsdaten für das Training humanoider Roboter aus. Robotern fehlt bisher, was Sprachmodelle im Internet vorfanden, nämlich riesige Mengen an Beispielen. Wie schnell sie in Werkhallen ankommen, hängt auch an solchen Datenlieferanten. (TechCrunch)

Quellen

Daily Briefing

Täglich per E-Mail.