Deine AI vergisst Dinge nicht, weil sie verwirrt ist - ihr geht der Platz aus. Jedes Modell hat ein festgelegtes „Kontextfenster“, also eine begrenzte Gesamtmenge an Text, die es gleichzeitig aufnehmen und darüber nachdenken kann. Sobald dieses Fenster voll ist, muss etwas weichen: Ältere Nachrichten werden von neueren verdrängt, unter ihnen begraben oder vollständig entfernt.
Zuletzt aktualisiert: Juli 2026 · Vom KissMySkills-Team
Was ein Kontextfenster tatsächlich ist
Jedes Mal, wenn du eine Nachricht an Claude, ChatGPT oder Gemini sendest, sieht das Modell nicht nur diese eine Nachricht. Es sieht die gesamte Unterhaltung bis dahin - alles, was du eingegeben hast, alles, worauf es geantwortet hat, sowie alle Dokumente, Bilder oder Dateien, die du angehängt hast - gebündelt als eine einzige Eingabe. Dieses gesamte Paket ist der „Kontext“. Das „Fenster“ bezeichnet die Obergrenze dafür, wie viel davon das Modell in einem einzigen Durchlauf verarbeiten kann.
Kontextfenster werden in Tokens gemessen, also in kleinen Textabschnitten - ungefähr ¾ eines Wortes. Ein Modell mit einem Fenster von 100.000 Tokens kann etwa 75.000 Wörter aus Unterhaltung, Dokumenten und Anweisungen zusammen aufnehmen, bevor es an seine Grenze stößt. Das klingt nach viel, bis man bedenkt, dass allein ein 40-seitiges PDF, ein Tabellenkalkulations-Export oder ein langes Sitzungsprotokoll Zehntausende Tokens verbrauchen kann - noch bevor du überhaupt deine eigentliche Frage gestellt hast.
Wichtig ist: Das Kontextfenster ist keine Datenbank, in der das Modell Dinge nachschlägt. Es ähnelt eher dem Kurzzeitgedächtnis. Für das Modell existiert überhaupt nichts außerhalb dieses Fensters, und alles darin konkurriert um seine begrenzte Aufmerksamkeit.
Warum es sich so anfühlt, als würde die AI „vergessen“
Menschen beschreiben das als „Vergessen“ des Anfangs eines langen Chats durch die AI oder als Verlust des Überblicks über Details aus einem hochgeladenen Dokument. Das ist eine nachvollziehbare Beschreibung dessen, was du beobachtest, aber es entspricht nicht ganz dem, was im Hintergrund passiert. Zwei verschiedene Dinge geschehen, und sie verstärken sich gegenseitig.
1. Weiches Vergessen: Verwässerung
Wenn eine Unterhaltung wächst, verschwindet älterer Inhalt nicht - er macht lediglich einen immer kleineren Anteil dessen aus, was das Modell betrachtet. Frühe Anweisungen, Entscheidungen oder Fakten erhalten im Verhältnis zu allem, was danach gesagt wurde, proportional weniger „Gewicht“. Das Modell hat technisch weiterhin Zugriff auf diesen Inhalt, muss jedoch härter arbeiten, um ihn zwischen allem anderen, was in das Fenster hineingepresst wurde, zu finden und zu priorisieren. In der Praxis nimmt die Qualität bei langen Gesprächsverläufen sichtbar ab: Das Modell widerspricht früheren Antworten, wiederholt Fragen, die du bereits beantwortet hast, oder verliert den Faden einer differenzierten Anweisung von vor zehn Nachrichten.
2. Hartes Vergessen: Abschneiden
Sobald die Unterhaltung das harte Limit des Fensters tatsächlich überschreitet, muss etwas entfernt werden, um Platz für neue Eingaben zu schaffen. Die meisten Chat-Produkte lösen das, indem sie die ältesten Nachrichten stillschweigend verwerfen oder zusammenfassen. Ab diesem Punkt ist der Inhalt nicht nur verwässert - er ist tatsächlich weg. Das Modell kann ihn buchstäblich nicht mehr sehen, ganz gleich, wie wichtig er war.
Keines von beidem ist genau genommen ein Fehler. Es ist die physische Folge davon, dass sich ein Fenster fester Größe füllt. Das bedeutet jedoch, dass zwei alltägliche Gewohnheiten - ein riesiges Dokument einzufügen und einen Chat lange und mäandernd laufen zu lassen - die beiden schnellsten Wege sind, die Ausgabequalität zu ruinieren, oft ohne dass du bemerkst, warum die Antworten schlechter geworden sind.
Die versteckten Kosten von „einfach das Dokument hochladen“
Eine große Datei hochzuladen, fühlt sich kostenlos an. Ist es aber nicht. Ein umfangreicher Vertrag, ein Forschungsbericht oder ein vollständiger Datensatz kann einen riesigen Anteil des verfügbaren Fensters beanspruchen, bevor das Modell auch nur ein Wort deiner eigentlichen Anfrage verarbeitet hat. Wenn dein Modell beispielsweise ein Fenster mit 150.000 Tokens hat und dein Dokument 90.000 davon belegt, bleiben dir 60.000 für die Systemanweisungen, den Gesprächsverlauf sowie die eigene Schlussfolgerung und Antwort des Modells - bei einer Aufgabe, die möglicherweise tatsächlich Informationen aus dem gesamten Dokument zusammenführen muss.
Genau diese Situation bringt Menschen bei anspruchsvollen Analyseaufgaben aus dem Takt: Marketingberichte voller Tabellen, Finanzmodelle, umfangreiche Forschungskorpora. Je größer und unübersichtlicher die Eingabe ist, desto weniger Raum bleibt der AI, tatsächlich gründlich darüber nachzudenken, was sie mit dieser Eingabe tun soll.
Rafa macht Claude für genau dieses Problem zu einem Senior-Spezialisten für Marketinganalysen - er analysiert umfangreiche Berichte, Dashboards und Kampagnendaten, ohne dass die allgemeinen Anweisungen den Platz beanspruchen, den dein Dokument benötigt.
Rafa - Spezialist für Marketinganalysen ansehen →Warum lange, mäandernde Chats die Sache ebenfalls verschlimmern
Die andere Falle ist der Marathon-Chat - der Thread, den du nie schließt, weil er „bereits den ganzen Kontext enthält“. Jede Hin-und-her-Nachricht, jeder aufgegebene Seitenstrang, jedes „eigentlich, versuchen wir es anders“ bleibt im Fenster, nimmt Platz ein und verwässert das, was tatsächlich zählt. Bei Nachricht fünfzig hält das Modell neben deiner aktuellen, konkreten Anfrage einen Haufen halbwegs relevanter Historie vor - und räumt allem ungefähr gleich viel Gewicht ein.
Die Lösung besteht nicht darin, „nie lange Gespräche zu führen“. Es geht darum, bewusst darauf zu achten, was tatsächlich Platz in diesem Fenster einnimmt, und sicherzustellen, dass die Dinge, die das Modell stark gewichten soll - deine aktuelle Aufgabe, dein aktuelles Dokument - nicht von Dingen überlagert werden, die nicht mehr wichtig sind.
Wo Skill-Dateien ins Spiel kommen
Das ist der praktische Grund, warum Skill-Dateien (oder System-Prompts, benutzerdefinierte Anweisungen, Projektanweisungen - je nach Plattform unterschiedliche Bezeichnungen für dieselbe Idee) existieren. Eine Skill-Datei trennt zwei sehr unterschiedliche Arten von Inhalten, die normalerweise im Kontextfenster miteinander vermischt werden:
- Dauerhafte Anweisungen - als wer die AI auftreten soll, welche Standards gelten sollen und in welchem Format die Ausgabe erfolgen soll. Das ändert sich nicht von Aufgabe zu Aufgabe.
- Aufgabeninhalt - das Dokument, das Sie analysieren, die Daten, mit denen Sie arbeiten, die eigentliche Unterhaltung über das eigentliche Problem. Das ändert sich jedes Mal.
Wenn Sie eine lange, frei formulierte Erklärung wie „Verhalte dich wie ein Senior-Analyst, befolge diese Struktur, verwende diesen Ton, tue immer X und niemals Y“ direkt in den Chat einfügen, nimmt diese Erklärung im Kontextfenster neben Ihrem Dokument und Ihren Fragen Platz und Aufmerksamkeit ein - jedes einzelne Mal, in jeder Unterhaltung. Eine Skill-Datei lädt dieselbe Anweisungssammlung einmal kompakt als festgelegte Rolle, in die das Modell schlüpft. Sie ist präziser formuliert als eine typische Erklärung im Hin und Her und wird nicht mitten in der Unterhaltung erneut verhandelt oder erklärt, wie es bei spontanen Anweisungen oft der Fall ist.
Das Ergebnis ist unkompliziert: Mehr vom Kontextfenster bleibt für das übrig, was sich tatsächlich verändert - den Bericht, den Sie hochgeladen haben, die Daten, nach denen Sie fragen, die zwanzig Anschlussfragen in dieser Sitzung. Die Qualität bleibt länger höher, weil das Modell seine begrenzte Aufmerksamkeit nicht zwischen dem „Erinnern daran, wie es sich verhalten soll“ und dem „Verstehen dessen, wonach Sie gerade tatsächlich fragen“ aufteilen muss.
Ryan konfiguriert Claude für genau die Art von fortlaufender Arbeit im Führungskontext mit viel Kontext - Vorstandsmappen, Briefings und Entscheidungsvorlagen -, bei der eine kompakte dauerhafte Rolle mit wachsender Unterhaltung immer wichtiger wird.
Ryan - Chief of Staff anzeigen →Praktische Gewohnheiten, die wirklich helfen
- Beginnen Sie für neue Aufgaben einen neuen Thread. Eine neue Unterhaltung bedeutet ein sauberes Kontextfenster - keine verwässerte Historie, die mit Ihrer aktuellen Frage konkurriert.
- Halten Sie dauerhafte Anweisungen getrennt und kurz. Eine einmal geladene Skill-Datei ist besser, als Ihre Erwartungen in jedem Chat erneut zu erklären.
- Laden Sie weniger hoch. Wenn Sie nur die Kapitel 3 und 4 benötigen, laden Sie nicht das ganze Buch hoch - jede unnötige Seite entspricht Tokens, die das Modell nicht für Ihre Frage verwenden kann.
- Fassen Sie zusammen, bevor Sie fortfahren. Bitten Sie das Modell bei einem länger laufenden Projekt regelmäßig (oder tun Sie es selbst), die wichtigsten bisherigen Entscheidungen in einer kurzen Zusammenfassung zu verdichten, und beginnen Sie dann einen neuen Thread mit dieser Zusammenfassung plus Ihrer Skill-Datei.
- Achten Sie auf die Warnsignale. Wiederholte Fragen, widersprüchliche frühere Antworten oder vage Antworten auf konkrete Fragen sind oft Symptome eines überfüllten oder gekürzten Kontextfensters - kein Problem mit dem prompt eines klüneren Modells.
Zusammengefasst:
Jedes AI-Modell hat ein festes Kontextfenster. Sobald es gefüllt ist, werden ältere Inhalte verwässert oder entfernt - das ist das „Vergessen“, das du bemerkst, nicht Verwirrung. Sowohl das Hochladen großer Dokumente als auch lange Chatverläufe beanspruchen denselben begrenzten Speicherplatz. Wenn du deine dauerhaften Anweisungen kompakt und getrennt hältst, etwa mit Rafa (Spezialist für Marketinganalysen) oder Ryan (Chief of Staff), bleibt mehr Platz für die Dokumente und Aufgabeninhalte, die tatsächlich benötigt werden - so bleiben die Antworten länger präzise.
Gib ein, wie du (oder dein Team) AI-Chats tatsächlich nutzt, und erhalte eine realistische monatliche Schätzung der verschwendeten Tokens und Kosten in Euro für erneutes Prompten im Vergleich zu einer dauerhaft verwendeten Skill-Datei. Keine Registrierung, keine E-Mail - nur die Berechnung aus diesem Beitrag, angewendet auf deine Zahlen.
Probier den Rechner aus →Häufig gestellte Fragen
Was genau wird auf das Kontextfenster angerechnet?
Alles in der aktuellen Unterhaltung: deine Nachrichten, die Antworten des Modells, alle Anweisungen aus System-Prompts oder Skill-Dateien sowie der vollständige aus angehängten Dateien oder Dokumenten extrahierte Text. Alles wird gemeinsam in Tokens gegen ein einziges gemeinsames Limit gemessen.
Behebt das Starten eines neuen Chats das Problem tatsächlich?
Ja, insofern es das Fenster vollständig leert - keine verwässerte Historie und kein Risiko, dass Inhalte aus einem früheren Gesprächsabschnitt abgeschnitten werden. Der Nachteil ist, dass du den Kontext aus dem alten Thread verlierst, den du nicht mitnimmst. Daher lohnt es sich, eine kurze Zusammenfassung zusammen mit deiner Skill-Datei in den neuen Chat zu übernehmen, statt bei null anzufangen.
Warum nicht einfach ein Modell mit einem größeren Kontextfenster verwenden?
Ein größeres Fenster hilft, beseitigt aber nicht die zugrunde liegenden Dynamiken - Verwässerung und Priorisierung treten auch bei größerem Umfang auf, und umfangreiche Eingaben kosten weiterhin echte Tokens, unabhängig davon, ob das Limit bei 100.000 oder 1.000.000 liegt. Ein größeres Fenster verschafft dir mehr Platz, aber kein Modell, das automatisch weiß, was es innerhalb dieses Platzes priorisieren soll.
Wie unterscheidet sich eine Skill-Datei davon, einfach gute Anweisungen in den Chat zu schreiben?
Beides kann funktionieren, aber direkt in einen Chat eingegebene Anweisungen stehen im selben überfüllten Fenster wie alles andere und werden oft wiederholt, widersprochen oder verwässert, wenn die Unterhaltung länger wird. Eine Skill-Datei wird einmal als klar definierte Rolle geladen - kompakt und getrennt vom Aufgabeninhalt - und konkurriert daher nicht mit dem Dokument oder den Daten, mit denen du tatsächlich arbeitest, um Platz.
Verwandt: Die besten Claude-Skills für Führungskräfte und Chief of Staffs · Die besten Marktplätze für Claude-Skills (im Vergleich)


