Zum Inhalt springen
Strategie-Call buchen

KI-Grundlagen · 17. März 2026

Eine Million Token: Kontext oder RAG?

Anthropic hat am 13. März das 1-Million-Token-Fenster für Claude Opus 4.6 und Sonnet 4.6 zum Standardpreis freigegeben. Was das für Wissensassistenten heißt.
Ring aus Blättern und weißer Keramik vor dunkelgrünem Grund

KI-Grundlagen 3 Min. Lesezeit Von Alexander Otto

Daten ragSprachmodelleEnergie & KostenWissensmanagement

Am 13. März 2026 hat Anthropic das Kontextfenster von einer Million Token für Claude Opus 4.6 und Sonnet 4.6 allgemein verfügbar gemacht, und zwar zum normalen Preis. Zuvor galt für Anfragen über 200.000 Token ein Aufschlag. Jetzt kostet Opus 4.6 5 US-Dollar pro Million Eingabetoken und 25 US-Dollar pro Million Ausgabetoken, Sonnet 4.6 kostet 3 und 15 US-Dollar. Laut Anthropic wird eine Anfrage mit 900.000 Token pro Token genauso abgerechnet wie eine mit 9.000. Außerdem sind pro Anfrage bis zu 600 Bilder oder PDF-Seiten erlaubt, vorher waren es 100.

Was das praktisch bedeutet

Ein Kontextfenster ist der Arbeitsspeicher des Modells für eine einzelne Anfrage. Grob gerechnet passen in eine Million Token mehrere tausend Seiten Text. Sie können also einen ganzen Vertragsordner, ein Handbuch oder ein Jahr Projektkorrespondenz in einem Schritt mitgeben, ohne die Inhalte vorher zu zerlegen.

Für punktuelle Aufgaben ist das bequem: einen Vertragsstapel vergleichen, ein langes Gutachten zusammenfassen, ein Lastenheft gegen ein Angebot prüfen. Der Aufwand für Vorbereitung sinkt deutlich.

Warum RAG nicht überflüssig wird

Beim Retrieval Augmented Generation (RAG) sucht ein System zuerst die passenden Textstellen aus einer Wissensbasis und gibt nur diese an das Modell. Das bleibt aus mehreren Gründen sinnvoll:

  • Kosten bei Dauerbetrieb: Wer jede Anfrage mit 500.000 Token Material füttert, zahlt jedes Mal dafür. Bei täglich vielen Fragen summiert sich das schnell gegenüber einer gezielten Suche.
  • Aktualität und Pflege: Eine Wissensdatenbank wird an einer Stelle aktualisiert. Mitgegebene Dokumente müssen bei jeder Anfrage neu zusammengestellt werden.
  • Zugriffsrechte: Eine Suche kann filtern, wer welche Dokumente sehen darf. Ein großer Kontext enthält alles, was Sie hineinlegen.
  • Nachvollziehbarkeit: RAG kann die verwendeten Quellen benennen. Das erleichtert die Prüfung.
  • Qualität bei sehr viel Material: Ein größerer Kontext garantiert nicht, dass das Modell jede Stelle gleich gut berücksichtigt. Prüfen Sie das an Ihren eigenen Dokumenten.

Eine einfache Entscheidungshilfe

Nehmen Sie den langen Kontext für einmalige oder seltene Analysen, bei denen Sie das Material selbst auswählen. Nehmen Sie RAG für Wissensassistenten, die täglich von vielen Personen genutzt werden, deren Inhalte sich ändern und bei denen Rechte und Quellenangaben zählen. Häufig ist die Mischung am besten: Eine Suche liefert die relevanten Dokumente vollständig statt als Schnipsel, und das Modell arbeitet im großen Fenster damit.

Ihr nächster Schritt

Zählen Sie, wie oft pro Woche eine Wissensfrage gestellt wird und wie groß das Material ist. Rechnen Sie einen Monat Betrieb in beiden Varianten durch. Die Zahlen entscheiden, nicht die Schlagzeile.

Quellen

Wissensassistent oder großer Kontext?

Wir rechnen mit Ihnen durch, welche Variante für Ihre Dokumente und Nutzerzahlen günstiger und sicherer ist.