
Die meisten Unternehmen brauchen kein Frontier Model. Das ist meine Position, obwohl ich solche Modelle selbst einsetze. Am Anfang habe ich bei WirStartenKI überall das teuerste Modell genommen. Wir haben uns gegen ein Spitzenmodell für jede Aufgabe entschieden, weil eine E-Mail-Zuordnung andere Fähigkeiten verlangt als die Diagnose eines Systemausfalls. Heute ordne ich Modelle einzelnen Aufgaben zu. Für Ihre Entscheidung zählt, was eine fachlich gelöste Aufgabe einschließlich Nacharbeit kostet.
Wie groß der Preisunterschied sein kann, zeigt mein Vergleich von fünf Dollar mit fünf Cent pro Million Eingabe-Tokens, also verarbeiteten Texteinheiten. Das ist Faktor 100. Die fünf Cent gehören zum Granite-4.1-Beispiel meines Videos, dessen Quellenverzeichnis OpenRouter vom April 2026 nennt. Für Claude Opus 4.8 verlangt Anthropic laut Preisliste vom 30. September 2026 fünf Dollar pro Million Eingabe-Tokens. Wenn beide Modelle Ihren Auftrag gleich gut erledigen, bezahlen Sie den Aufpreis ohne Gegenleistung.
Ich würde deshalb keinen Modellnamen in die Budgetfreigabe schreiben, bevor das Team seine Aufgaben sortiert hat. Eine E-Mail zuzuordnen, einen strittigen Supportfall zu beantworten und einen Systemausfall zu untersuchen stellen unterschiedliche Anforderungen. Wer alles mit demselben teuren Modell erledigt, lässt die günstigeren Kandidaten ungeprüft.
Wann verdient ein kleines Modell den ersten Versuch?
Ein kleines Sprachmodell verdient den ersten Versuch bei Aufgaben mit klaren Kategorien und überprüfbaren Antworten. Ich denke an Dokumentenklassifikation, die Zuordnung eingehender E-Mails und Zusammenfassungen mit wiederkehrendem Muster.
Small Language Model (SLM) bezeichnet ein vergleichsweise kleines Sprachmodell. Bei einer eingehenden Nachricht können Sie die erlaubten Ergebnisse vorgeben, etwa die zuständige Abteilung oder eine Rückfrage. Die Fachseite prüft, ob die Zuordnung stimmt. Dafür muss das Modell weder einen langen Dialog führen noch ein unbekanntes Problem lösen.
Youngjin Chae und Thomas Davidson untersuchen in Large Language Models for Text Classification, online veröffentlicht am 24. April 2025 in Sociological Methods & Research, die Klassifikation von Texten. Ihr Befund stützt diesen Ansatz. Durch Feinabstimmung können kleinere Modelle bei relativ hoher Genauigkeit und geringen Kosten mit größeren Modellen konkurrieren. Die Untersuchung betrifft insbesondere das Erkennen von Einstellungen und Meinungen in Texten. Sie liefert einen Grund, kleine Modelle zu testen; eine Abnahme Ihrer E-Mail-Zuordnung müssen Sie selbst durchführen.
Ich würde den kleinen Kandidaten denselben schwierigen Fällen aussetzen wie den großen. Dazu gehören unvollständige Nachrichten und Anliegen, die in keine Kategorie passen. Eine falsche Zuordnung kann eine Kundenbeschwerde tagelang im falschen Postfach liegen lassen. Legen Sie deshalb fest, wann das Modell zurückfragen oder an einen Menschen übergeben soll. Wenn Sie für die Feinabstimmung eigene Beispiele benötigen, gehören deren Auswahl und Pflege ebenfalls in die Kostenrechnung.
Wann braucht der Kundenservice ein breiteres Modell?
Ein größeres Sprachmodell wird interessant, wenn eine Antwort mehrere Zusammenhänge verbinden muss. In meiner Beratung sehe ich etwa diesen Fall: Die Abrechnung stimmt nicht, eine Konfiguration wurde geändert, und drei frühere Tickets gehören dazu.
Large Language Model (LLM) heißt großes Sprachmodell. Für viele Aufgaben im Kundenservice halte ich ein solches Modell für die passende Wahl. Es muss die Vorgeschichte lesen, die Änderung zeitlich einordnen und erkennen, welche Aussage durch die Unterlagen gedeckt ist. Kunden beschreiben dasselbe Problem unterschiedlich. Ein Antwortentwurf muss trotzdem zum konkreten Fall passen.
Mein Prüfauftrag wäre ein Entwurf mit Belegen aus den vorhandenen Tickets. Die Fachseite bewertet, ob die Abrechnung richtig verstanden wurde und ob eine Rückfrage nötig ist. Fehlende Unterlagen bleiben als fehlend sichtbar. Eine erfundene Vorgeschichte ist ein Fehler, auch wenn sie sich flüssig liest.
Geben Sie beiden Modellkandidaten dieselben Unterlagen. Wenn nur das große Modell die alten Tickets erhält, vergleichen Sie unterschiedliche Arbeitsabläufe. Erfassen Sie außerdem, welche Aussagen Mitarbeitende korrigieren müssen und wie lange das dauert. Bei vertraulichen Kundendaten klären Sie vorab, welche Informationen der jeweilige Dienst erhalten darf. Der Test soll die spätere Arbeit abbilden, einschließlich dieser Einschränkungen.
Welche Aufgabe rechtfertigt ein Frontier Model?
Ein Frontier Model rechtfertigt einen Versuch bei schwierigen Aufträgen mit voneinander abhängigen Schritten und Werkzeugaufrufen. Für diese teuerste Modellkategorie sage ich weiterhin: Die meisten brauchen keins.
Gartner prognostizierte 2025, dass über 40 Prozent der Agentic-AI-Projekte bis Ende 2027 eingestellt werden. Als Gründe nennt Gartner unter anderem steigende Kosten und unklaren Geschäftswert. Es handelt sich um eine Prognose. Ich lese sie als Warnung an die Budgetverantwortlichen, den Nutzen eines Agenten vor seiner Ausweitung nachzuweisen. Daraus lässt sich keine Ausfallwahrscheinlichkeit für Ihr eigenes Projekt ableiten.
Mein Beispiel für einen passenden Einsatz ist ein kritischer Systemalarm nachts um zwei. Das Modell muss Betriebsdaten abfragen, Protokolle durchsuchen, eine Ursache eingrenzen und die passenden Programmierschnittstellen aufrufen. Die Antwort auf eine Abfrage bestimmt dabei, welcher Schritt folgt. Frontier Model bezeichnet hier ein Modell an der Leistungsgrenze des jeweiligen Anbieters, das solche anspruchsvollen Abläufe bearbeiten kann.
Ich würde zunächst eine Diagnose mit Belegen verlangen. Eine Änderung am laufenden System braucht eine benannte Freigabe und einen Rückweg, falls sie schadet. Im ersten Test prüft der Bereitschaftsdienst den Vorschlag und entscheidet über den Eingriff. Das kostet seine Zeit; die muss in den Vergleich mit der bisherigen Störungsbearbeitung eingehen. Erst wenn Diagnose und Übergabe funktionieren, lohnt sich die Diskussion über weitergehende Berechtigungen.
Wie vergleichen Sie die Kosten einer gelösten Aufgabe?
Zählen Sie sämtliche Modellaufrufe, Wiederholungen und menschliche Nacharbeit bis zur fachlichen Abnahme eines Falls. Diese Kosten pro gelöster Aufgabe sind die Kennzahl, nach der ich Modelle auswählen würde.
Die Anthropic-Preisliste, gelesen am 30. September 2026, nennt für Claude Opus 4.8 fünf Dollar pro Million Eingabe-Tokens und 25 Dollar pro Million Ausgabe-Tokens. Für Claude Sonnet 4.6 sind es drei beziehungsweise 15 Dollar. Ausgaben werden separat berechnet. Ein langer Antwortentwurf kann deshalb mehr kosten, als der Blick auf den Eingabepreis vermuten lässt.
Der Faktor 100 aus meinem Beispiel vergleicht nur Eingabepreise. Für Ihre Bestellung gelten die Preise der tatsächlich verfügbaren Version und des gewählten Anbieters. Halten Sie Modellversion, Preisstand und verarbeitete Textmenge im Versuch fest. Dann können Sie erklären, ob eine günstigere Rechnung vom Modell, von kürzeren Antworten oder von weniger Wiederholungen kommt.
Ich würde auch abgebrochene Fälle in der Rechnung lassen. Wenn nur erfolgreich gelöste Anfragen ausgewertet werden, verschwinden die Kosten der gescheiterten Versuche. Dasselbe gilt für die Minuten, die Mitarbeitende mit dem Lesen und Korrigieren verbringen. Ein teurerer Aufruf kann sich rechnen, wenn er diese Arbeit ausreichend senkt. Diesen Vorteil muss der Versuch zeigen.
Was muss vor dem Modellvergleich feststehen?
Auftrag, verfügbare Informationen und Abnahme müssen vor dem Versuch feststehen. Schreiben Sie auf, welches Ergebnis die Fachseite akzeptiert und bei welchen Fehlern der Fall zurückgeht.
Für die E-Mail-Zuordnung brauchen Sie erlaubte Kategorien und einen Rückfrageweg. Im Supportfall erhalten beide Kandidaten dieselben Tickets. Beim Systemalarm gelten dieselben Werkzeuge und Berechtigungen. Bewahren Sie die Prüffälle so auf, dass Sie einen späteren Modellwechsel daran messen können. Sonst verliert Ihr erster Vergleich mit dem nächsten Versionswechsel seinen Wert.
Ein lokaler Betrieb kleiner Modelle kann sinnvoll sein, wenn Daten im eigenen Netz bleiben sollen. Ich würde vorab prüfen lassen, wer das Modell betreibt, wer seine Protokolle lesen darf und wann diese gelöscht werden. Auch ein lokal betriebenes Modell braucht Zugriffsregeln. Der Betrieb bindet Arbeitszeit, die Sie beim Vergleich mit einem gehosteten Dienst berücksichtigen müssen.
Die fachliche Abnahme gehört zu dem Team, das später mit den Ergebnissen arbeitet. Lassen Sie eine falsche Zuordnung und einen erfundenen Supportbeleg getrennt zählen. Diese Fehler verlangen unterschiedliche Korrekturen. Als Geschäftsführung legen Sie fest, welcher Nachweis eine Ausweitung rechtfertigt und welches Budget der Versuch höchstens verbrauchen darf.
Welche Belege brauchen Sie für die Freigabe?
Für die Freigabe brauchen Sie einen bestandenen Vergleich am konkreten Auftrag. Ich würde dem verantwortlichen Team diese Unterlagen abverlangen:
| Aufgabe | Erster Kandidat | Beleg vor der Freigabe |
|---|---|---|
| Dokumente oder E-Mails zuordnen | Kleines Modell | Bewertete Zuordnungen samt Rückfragen bei unklaren Fällen |
| Abrechnung und alte Supporttickets verbinden | Breiteres Sprachmodell | Fachlich geprüfter Entwurf mit Belegen und gemessener Nacharbeit |
| Systemalarm untersuchen und Werkzeuge nutzen | Frontier-Kandidat | Nachvollziehbare Diagnose und getestete Freigabegrenzen |
Die Modellkategorie ist ein Ausgangspunkt. Wenn der kleine Kandidat auch die anspruchsvolleren Fälle besteht, verdient er den Zuschlag. Wenn selbst das größere Modell die Abnahme verfehlt, bleibt die Aufgabe bei den Mitarbeitenden, bis der Ablauf verbessert ist.
Für die Auswahl an Ihrem konkreten Ablauf können Sie ein Gespräch mit mir anfragen. Bringen Sie typische Fehlerfälle und den bisherigen Prüfaufwand mit.
Wir bei WirStartenKI geben das Budget für die nächste Modellstufe erst frei, wenn sie am selben Auftrag einen belegten Vorteil zeigt. Ein teureres Modell ohne diesen Beleg bleibt aus dem Ablauf heraus.
Welche Aufgaben eignen sich für kleine Modelle?
Dokumentenklassifikation, E-Mail-Zuordnung und Zusammenfassungen mit wiederkehrendem Muster sind passende Prüfkandidaten. Ich würde ihre Ergebnisse einschließlich unklarer Fälle von der Fachseite bewerten lassen.
Weshalb zählt die Vorgeschichte im Support?
Eine falsche Abrechnung kann mit einer Konfigurationsänderung und früheren Tickets zusammenhängen. Der Antwortentwurf muss diese Unterlagen verbinden und seine Aussagen belegen.
Was bedeutet Faktor 100 im Preisvergleich?
Mein Videobeispiel vergleicht fünf Cent pro Million Eingabe-Tokens für Granite 4.1 laut Skriptquelle OpenRouter, April 2026, mit fünf Dollar für Claude Opus 4.8 laut Anthropic, September 2026. Der Faktor beschreibt Eingabepreise, während die Gesamtrechnung auch Ausgaben und Nacharbeit enthält.
Warum brauchen viele Unternehmen kein Frontier Model?
Ich sehe für Aufgaben mit klaren Mustern und überprüfbaren Antworten zuerst günstigere Kandidaten. Ein Frontier Model muss seinen Mehrpreis durch bessere Ergebnisse oder weniger Nacharbeit am konkreten Auftrag rechtfertigen.
Was darf ein Modell bei einem Systemalarm tun?
In meinem ersten Test darf es Betriebsdaten und Protokolle auswerten und eine Diagnose vorschlagen. Der Bereitschaftsdienst prüft die Belege und gibt einen Eingriff gesondert frei.
Welche Kennzahl zählt bei der Modellwahl?
Ich vergleiche die Kosten pro fachlich gelöster Aufgabe. Dazu gehören alle Versuche und die menschliche Nacharbeit bis zur Abnahme.