llm
Warum «Welches LLM ist das beste?» inzwischen die falsche Frage ist
Die Suche nach dem einen besten Sprachmodell ist ungefähr so ergiebig wie die Suche nach dem besten Werkzeug im Werkzeugkasten. Ergiebiger ist die Frage, welcher Teil der eigenen Anfragen welches Modell braucht, und dafür gibt es inzwischen Forschung, Werkzeuge und erste Produkte.
Vor ein paar Tagen habe ich ChatGPT auf eine Recherche geschickt: Welches Sprachmodell eignet sich für welche Aufgabe, lokal oder in der Cloud, und was taugen die neuen Dienste, die einem diese Wahl abnehmen wollen. Weil ich meine Fragen meistens diktiere, wurde aus «agentisch gesteuert» unterwegs «argentinisch gesteuert», und der Bericht hielt dazu mit bemerkenswertem Ernst fest, er habe für diesen Begriff keine Fachliteratur gefunden. Das war im Nachhinein der ehrlichste Satz im ganzen Dokument, und er fasst das Thema besser zusammen, als mir lieb ist: Wer einer KI eine schlecht gestellte Frage gibt, bekommt eine sehr gründliche Antwort auf die falsche Frage.
Die eigentliche Pointe des Berichts war aber eine andere. Die Frage «Welches LLM ist das beste?» hat keine brauchbare Antwort mehr.
Die bessere Frage
Solange es zwei oder drei ernstzunehmende Modelle gab, konnte man sich für eines entscheiden und damit leben. Heute gibt es in jeder Preisklasse mehrere, dazu offene Modelle, die auf einem Mac Studio laufen, und spezialisierte Modelle, die gar keinen Text mehr schreiben wollen. Die Frage, die sich in der Forschung seit etwa drei Jahren durchsetzt, lautet deshalb anders:
Welcher Teil meiner Anfragen braucht welches Modell?
Eine Rechnung zusammenzufassen braucht kein Spitzenmodell. Einen Fehler zu finden, der nur auftritt, wenn im Code zwei Dinge gleichzeitig passieren, vielleicht schon. Wer beides an dasselbe Modell schickt, zahlt entweder zu viel für das Einfache oder bekommt zu wenig für das Schwierige, und meistens beides, nur an unterschiedlichen Tagen.
Zuerst die Schranken, dann das Optimieren
Bevor es um Qualität, Tempo oder Preis geht, kommt die unbequeme Vorfrage: Dürfen diese Daten überhaupt dorthin? Für Personendaten, Kundendokumente und interne Zahlen gelten in der Schweiz das Datenschutzgesetz und die Verträge mit dem jeweiligen Anbieter, und wer Kunden in der EU hat, bekommt den AI Act dazu. (Dessen Pflichten für Hochrisiko-Systeme hat die EU im Juni mit einem Sammelgesetz auf Dezember 2027 beziehungsweise August 2028 verschoben, was ein Aufschub ist und keine Entwarnung.)
Der häufigste Fehler ist die umgekehrte Reihenfolge: Man wählt das Modell mit den schönsten Testergebnissen und merkt drei Monate später, dass die Daten nie dorthin hätten fliessen dürfen. Datenschutz, der Speicherort der Daten und die Lizenz sind deshalb keine Kriterien, die man gegen Geschwindigkeit abwägt, sondern Schranken. Ein Modell, das sie nicht erfüllt, ist nicht schlechter. Es ist schlicht nicht im Rennen.
Messen statt meinen
Öffentliche Ranglisten sind nützlich für die Vorauswahl und ziemlich nutzlos für die Entscheidung selbst. Sie messen, wie Modelle bei allgemeinen Aufgaben abschneiden, und die eigene Aufgabe ist selten allgemein.
Zwei Hochschularbeiten zeigen das schön. An der ETH Zürich hat William West für seine Masterarbeit eine eigene Testsammlung gebaut, mit Datensätzen, Prompts und automatischer Bewertung, weil es für seine Frage schlicht keinen passenden öffentlichen Test gab. An der Universität Lund haben Alexander Sae-Cho Ek und Lucas Månsson zusammen mit Bosch untersucht, wie gut ein Sprachmodell relevante Fachartikel für die Trendbeobachtung erkennt. Ein mehrstufiges Verfahren war im Gesamtbild am besten, beim Aufspüren der wirklich relevanten Artikel gewann aber der schlichtere Ansatz, dem Modell einfach ein paar Beispiele mitzugeben. Und weil ein verpasster wichtiger Artikel teurer ist als ein überflüssiger, hängt die Antwort auf «was ist besser?» davon ab, welcher Fehler einem mehr wehtut.
Das beste Modell gibt es also nur im Verhältnis zu einem Fehler, den man sich vorher überlegt hat.
Praktisch heisst das: ein paar hundert echte Fälle aus dem eigenen Alltag sammeln, einfache und schwierige gemischt, und drei, vier Modelle aus unterschiedlichen Klassen daran messen, ohne zu wissen, welche Antwort von welchem stammt. Ein kleines lokales, ein günstiges aus der Cloud, ein starkes. Das ist weniger Arbeit, als es klingt, und deutlich weniger Arbeit als ein Jahr mit dem falschen Modell.
Kosten pro erledigter Aufgabe
Der Preis pro Million Token ist die Zahl, die man leicht findet, und deshalb die, mit der am häufigsten falsch gerechnet wird. Ein günstiges Modell, das jede dritte Antwort verhaut und neu angestossen werden muss, ist am Ende das teure, nur dass die Rechnung auf mehrere Zeilen verteilt ist. Die ehrlichere Grösse lautet: Was kostet eine Aufgabe, die tatsächlich erledigt wurde, inklusive Wiederholungen, Nachkontrolle und der Zeit, die ein Mensch mit dem Ausbessern verbringt?
(Die LLM API Price List auf aiia.li zeigt die Tokenpreise, und dazu stehe ich. Sie beantwortet aber nur die erste Hälfte der Frage.)
Verteilen und Weiterreichen: erst der Junior, dann die Seniorin
Wenn verschiedene Anfragen verschiedene Modelle brauchen, braucht es jemanden, der verteilt. In der Forschung heisst das Routing, und es gibt zwei Grundmuster.
Das erste funktioniert wie ein gut geführtes Büro. Zuerst schaut sich der Junior die Sache an. Ist er sicher, ist sie erledigt, ist er unsicher, geht sie zur Seniorin. Die Stanford-Arbeit FrugalGPT hat dieses Weiterreichen 2023 für Sprachmodelle durchgerechnet und in ihren Versuchen Einsparungen von bis zu 98 Prozent bei vergleichbarer Qualität gemessen. Das ist ein Laborwert mit den Modellen von damals und kein Versprechen, aber die Richtung ist deutlich.
Beim zweiten Muster wird vorher entschieden. Ein Verteiler schaut sich die Anfrage an und schickt sie direkt an das Modell, das voraussichtlich reicht. RouteLLM lernt diese Entscheidung aus vielen Vergleichen, bei denen Menschen angegeben haben, welche von zwei Antworten besser war. RouterBench liefert die Grundlage, um solche Verteiler fair miteinander zu vergleichen. Beides liegt als Open Source auf GitHub.
Eine Warnung am Rand, weil sie hierher gehört: LiteLLM, ein verbreitetes Open-Source-Werkzeug, das Anfragen an viele Anbieter weiterreicht und in manchem solchen Aufbau unter der Haube steckt, wurde im März 2026 über seine Lieferkette angegriffen. Zwei manipulierte Versionen lagen kurzzeitig im offiziellen Python-Paketverzeichnis. Wer eine Stelle baut, die zwischen allen Modellen vermittelt, baut auch die Stelle, an der alle Daten vorbeikommen. Versionen festzuschreiben ist da keine Pingeligkeit.
Die Neuen: Jev und der Jev Router
Diesen Monat sind zwei Dinge dazugekommen, die das Thema ein Stück greifbarer machen.
Jev von TypeSafe schreibt keinen Text. Es bekommt eine Ausgangslage und eine vorher festgelegte Frage mit festen Antwortmöglichkeiten und gibt eine davon zurück, samt einer Wahrscheinlichkeit. Freigeben oder nicht, eskalieren oder nicht, Kategorie A, B oder C. Für solche Entscheidungen ein grosses Chat-Modell zu bemühen, war schon immer ein bisschen wie mit dem Lastwagen Brötchen holen.
TypeSafe sagt, Jev könne nicht halluzinieren. Das stimmt, wenn man es genau liest: Ein Modell, das nur aus vorgegebenen Antworten wählen darf, kann keinen erfundenen Text liefern. Es kann aber die falsche vorgegebene Antwort wählen. Die Form ist garantiert, der Inhalt nicht, und diesen Unterschied sollte man an den eigenen Daten prüfen, bevor man ihn im Verkaufsgespräch weglässt. Auch die Geschwindigkeitsangaben stammen bisher vom Hersteller selbst.
Der Jev Router ist seit dem 25. September auf OpenRouter verfügbar und setzt genau dort an, wo dieser Artikel angefangen hat: Er wählt pro Anfrage das Modell und wie lange es nachdenken soll, abgewogen nach Qualität, Tempo und Kosten. Das ist fast wörtlich die Antwort auf die bessere Frage. Nur ist er zum Zeitpunkt, an dem ich das schreibe, zwei Tage alt. Neu ist nicht dasselbe wie bewährt, und wer ihn einsetzen will, lässt ihn sinnvollerweise erst einmal im Hintergrund mitlaufen: entscheiden lassen, mitschreiben, vergleichen, aber noch nicht handeln lassen.
Wie das für Nutzer aussieht: Mono
Wie sich das anfühlt, wenn man einfach nur eine Frage stellen will, zeigt Mono, ein Schweizer Dienst, der mehrere Modelle unter einer Oberfläche bündelt. Offenlegung: Mono wird von einem guten Bekannten von mir betrieben.
Was mir daran gefällt, ist die Offenheit. Schon bei der Registrierung zeigt Mono, welches Modell wofür zum Einsatz kommt: GPT-6 Luna für alltägliche Fragen, Perplexity für belegbare Analysen, Gemini Pro für grosse Datenmengen, Claude fürs Schreiben und fürs Coaching, Kimi Code fürs Programmieren, Nano Banana für Bilder. Das ist genau die Stufe, die man vernünftigerweise zuerst baut, bevor man mit lernenden Verteilern experimentiert: jede Art von Aufgabe bekommt ihr Modell, und jeder kann sehen, welches.
Über einzelne Zuordnungen kann man streiten, und darin liegt der eigentliche Vorteil. Man kann es, weil sie sichtbar sind. Ein Verteiler, dessen Entscheidungen man nicht sieht, lädt nicht zum Streiten ein, sondern zum Vertrauen, und mit Vertrauen gehe ich bei Software inzwischen sparsamer um.
Lokal oder Cloud
Eine kurze Anmerkung noch, weil die Frage in fast jedem Gespräch mit KMU kommt: Offene Modelle, die man selbst betreibt, sind nicht automatisch günstiger. Sie verschieben die Rechnung vom Anbieter auf die eigene Hardware, den Strom und die Person, die das Ganze am Laufen hält. Dafür bekommt man Kontrolle, und die ist manchmal genau das, was die Schranken von weiter oben verlangen. Für seltene, schwierige Aufgaben bleibt die Cloud der vernünftige Normalfall, für grosse Mengen gleichartiger Aufgaben mit heiklen Daten lohnt sich der Blick auf den eigenen Rechner.
Eine Regel
Wenn ich den Bericht, die Arbeiten und die zwei Tage alten Router auf einen Satz eindampfen müsste, dann auf diesen: Nicht das beste Modell wählen, sondern zuerst festlegen, was nicht passieren darf, dann an den eigenen Fällen messen und jede Anfrage an das günstigste Modell schicken, das die nötige Qualität nachweislich schafft.
Das ist weniger aufregend als eine neue Rangliste. Dafür stimmt es auch nächsten Monat noch.