Checkliste: Welches KI-Modell passt zu Ihrem Anwendungsfall?
Zwei große Modelle in drei Wochen: Wie Sie neue Releases bewerten, ohne bei jedem mitzuziehen. Eine Checkliste mit sechs Prüfpunkten.
KI-Grundlagen · 15. Januar 2026

Im Dezember 2025 haben OpenAI und Google kurz nacheinander neue Modelle vorgestellt. Die Angaben unten stammen von den Herstellern bzw. aus der Berichterstattung darüber. Sie sind keine eigene Messung.
OpenAI bietet GPT-5.2 als Instant, Thinking und Pro an. Instant ist für leichte Aufgaben wie Schreiben und Übersetzen gedacht, Thinking für komplexes Schlussfolgern, Pro für besonders hohe Genauigkeit. Der API-Preis beträgt 1,75 US-Dollar je Million Eingabe-Token und liegt damit 40 Prozent über GPT-5.1. Das Kontextfenster umfasst 400.000 Token. OpenAI gibt an, GPT-5.2 Thinking erreiche 92,4 Prozent im Benchmark GPQA Diamond. Das Vorgängermodell GPT-5.1 bleibt drei Monate verfügbar.
Google positioniert Gemini 3 Flash als schnelles, günstiges Modell. Der Preis liegt bei 0,50 US-Dollar je Million Eingabe-Token und 3 US-Dollar je Million Ausgabe-Token. Google nennt im Benchmark GPQA Diamond 90,4 Prozent und bei SWE-Bench Verified 78 Prozent. Das Modell ist Standard in der Gemini-App und im KI-Modus der Google-Suche. Entwickler erreichen es über AI Studio, Gemini CLI und Android Studio.
Der Preisunterschied je Token ist groß, aber die Rechnung bleibt unvollständig. Reasoning-Modelle verbrauchen bei schwierigen Aufgaben zusätzliche Token, und der Aufwand für Prüfung und Nacharbeit zählt mehr als der Token-Preis. Bei einfachen Massenaufgaben wie Klassifizieren oder Zusammenfassen sind schnelle Modelle meist ausreichend. Bei Entscheidungsvorlagen oder Recherchen lohnt sich ein stärkeres Modell eher.
Benchmarks wie GPQA Diamond testen Fachwissen auf Doktoratsniveau, SWE-Bench Verified die Lösung echter Programmierprobleme. Beides ist für die meisten Büroaufgaben nur mittelbar aussagekräftig. Ob ein Modell Ihre Angebote, Protokolle oder E-Mails in Ihrem Ton und mit Ihren Fachbegriffen zuverlässig bearbeitet, zeigt nur der eigene Test. Notieren Sie dabei auch, wie oft ein Ergebnis überarbeitet werden musste. Diese Zahl entscheidet über den tatsächlichen Nutzen.
Eine Entscheidung nach Benchmark-Rangliste ist bequem, bildet aber Ihre Aufgaben selten ab. Die eigene Testreihe kostet einen Nachmittag und spart Monate.