Tu IA no está olvidando cosas porque se esté confundiendo; se está quedando sin espacio. Cada modelo tiene una «ventana de contexto» fija: la cantidad total de texto que puede contener y sobre la que puede razonar a la vez. Cuando esa ventana se llena, algo tiene que ceder: los mensajes antiguos quedan desplazados por los nuevos, enterrados bajo ellos o se descartan por completo.
Última actualización: julio de 2026 · Por el equipo de KissMySkills
Qué es realmente una ventana de contexto
Cada vez que envías un mensaje a Claude, ChatGPT o Gemini, el modelo no ve únicamente ese mensaje. Ve toda la conversación hasta ese momento: todo lo que has escrito, todo lo que ha respondido, además de cualquier documento, imagen o archivo que hayas adjuntado, todo agrupado en una sola entrada. Ese conjunto completo es el «contexto». La «ventana» es el límite de cuánto puede procesar el modelo en una sola pasada.
Las ventanas de contexto se miden en tokens, que son pequeños fragmentos de texto: aproximadamente ¾ de palabra cada uno. Un modelo con una ventana de 100.000 tokens puede contener unos 75.000 palabras entre conversaciones, documentos e instrucciones antes de llegar al límite. Parece mucho, hasta que recuerdas que un solo PDF de 40 páginas, una exportación de una hoja de cálculo o una transcripción extensa de una reunión puede consumir por sí solo decenas de miles de tokens, incluso antes de que hayas formulado tu pregunta real.
Lo importante es entender que la ventana de contexto no es una base de datos en la que el modelo busca información. Se parece más a la memoria a corto plazo. Para el modelo, no existe nada fuera de esa ventana, y todo lo que hay dentro compite por su limitada atención.
Por qué parece que la IA «olvida»
La gente describe esto diciendo que la IA «olvida» el inicio de un chat largo o pierde el hilo de los detalles de un documento subido. Es una forma razonable de describir lo que observas, pero no es exactamente lo que ocurre internamente. Están sucediendo dos cosas distintas, y se agravan mutuamente.
1. Olvido gradual: dilución
A medida que crece una conversación, el contenido antiguo no desaparece; simplemente se convierte en una fracción cada vez menor de lo que el modelo está analizando. Las instrucciones, decisiones o hechos iniciales adquieren proporcionalmente menos «peso» frente a todo lo dicho desde entonces. Técnicamente, el modelo aún puede acceder a ese contenido, pero tiene que esforzarse más para localizarlo y priorizarlo entre todo lo demás que se ha acumulado en la ventana y, en la práctica, la calidad de los hilos largos se deteriora visiblemente: el modelo contradice respuestas anteriores, repite preguntas que ya respondiste o pierde el hilo de una instrucción matizada de hace diez intercambios.
2. Olvido absoluto: truncamiento
Una vez que la conversación supera realmente el límite estricto de la ventana, hay que eliminar algo para hacer espacio a nuevas entradas. La mayoría de los productos de chat lo resuelven descartando o resumiendo silenciosamente los turnos más antiguos. En ese momento, el contenido no solo se diluye: desaparece de verdad. El modelo literalmente ya no puede verlo, por muy importante que haya sido.
Ninguna de las dos cosas es exactamente un error. Es la consecuencia física de que una ventana de tamaño fijo se llene. Pero significa que dos hábitos cotidianos —pegar un documento enorme y dejar que un chat se alargue y divague— son las dos formas más rápidas de hundir la calidad de los resultados, a menudo sin que te des cuenta de por qué las respuestas empeoraron.
El costo oculto de «simplemente subir el documento»
Subir un archivo grande parece gratis. No lo es. Un contrato extenso, un informe de investigación o un conjunto de datos completo puede consumir una enorme parte de la ventana disponible antes de que el modelo haya procesado una sola palabra de tu solicitud real. Si tu modelo tiene, por ejemplo, una ventana de 150.000 tokens y tu documento consume 90.000 de esos tokens, te quedan 60.000 para las instrucciones del sistema, el historial de la conversación y el propio razonamiento y la respuesta del modelo, en una tarea que puede necesitar realmente sintetizar todo el documento.
Esta es exactamente la situación que suele causar problemas en los trabajos analíticos exigentes: informes de marketing llenos de tablas, modelos financieros y grandes corpus de investigación. Cuanto más grande y desordenada sea la entrada, menos espacio queda para que la AI piense realmente bien sobre lo que le estás pidiendo que haga con ella.
Rafa convierte Claude en un especialista sénior en analítica de marketing precisamente para este problema: analizar informes densos, paneles y datos de campañas sin que las instrucciones permanentes ocupen el espacio que necesita tu documento.
Ver a Rafa, especialista en analítica de marketing →Por qué los chats largos y divagantes también empeoran las cosas
La otra trampa es el chat maratoniano: el hilo que nunca cierras porque «ya tiene todo el contexto». Cada ida y vuelta, cada tangente abandonada, cada «en realidad, probemos de otra manera» permanece en la ventana, ocupa espacio y diluye lo que de verdad importa. Para el mensaje cincuenta, el modelo está manejando un montón de historial parcialmente relevante junto con tu solicitud actual y real, y le está dando a todo aproximadamente la misma importancia.
La solución no es «nunca tengas conversaciones largas». Se trata de ser consciente de qué está ocupando realmente espacio en esa ventana y de asegurarte de que aquello a lo que quieres que el modelo dé más peso —tu tarea actual, tu documento actual— no quede sepultado bajo cosas que ya no importan.
Aquí entran los archivos de Skill
Esta es la razón práctica por la que existen los archivos de Skill (o los prompts del sistema, las instrucciones personalizadas o las instrucciones del proyecto: la misma idea, con un nombre diferente según la plataforma). Un archivo de Skill separa dos tipos de contenido muy distintos que normalmente terminan mezclados en la ventana de contexto:
- Instrucciones permanentes: quién debe interpretar la AI, qué estándares debe aplicar y en qué formato debe presentar el resultado. Esto no cambia de una tarea a otra.
- Contenido de la tarea: el documento que estás analizando, los datos con los que trabajas y la conversación real sobre el problema real. Esto cambia cada vez.
Cuando pegas en el chat una explicación larga y libre de «actúa como un analista sénior, sigue esta estructura, usa este tono, haz siempre X y nunca hagas Y», esa explicación ocupa espacio en la ventana y compite por la atención junto con tu documento y tus preguntas, cada vez, en todas las conversaciones. Un archivo de Skill carga ese mismo conjunto de instrucciones una sola vez y de forma compacta, como un rol definido que el modelo adopta. Está redactado de manera más concisa que una explicación típica de ida y vuelta, y no se vuelve a debatir ni explicar a mitad de la conversación como suele ocurrir con las instrucciones improvisadas.
El resultado es sencillo: queda más espacio de la ventana para lo que realmente cambia —el informe que subiste, los datos sobre los que preguntas, las veinte preguntas de seguimiento de esta sesión—. La calidad se mantiene alta durante más tiempo porque el modelo no divide su limitada atención entre «recordar cómo debe comportarse» y «entender qué estás preguntando realmente ahora».
Ryan configura Claude para el tipo exacto de trabajo ejecutivo continuo y con mucho contexto —materiales para la junta directiva, informes y memorandos de decisión— en el que un rol permanente y compacto se vuelve más importante a medida que crece la conversación.
Ver a Ryan - Jefe de personal →Hábitos prácticos que realmente ayudan
- Inicia hilos nuevos para tareas nuevas. Una conversación nueva significa una ventana limpia, sin un historial diluido que compita con tu solicitud actual.
- Mantén separadas y breves las instrucciones permanentes. Un archivo de Skill cargado una vez es mejor que volver a explicar tus expectativas en cada chat.
- Reduce lo que subes. Si solo necesitas los capítulos 3 y 4, no subas el libro entero: cada página innecesaria son tokens que el modelo no puede dedicar a tu pregunta.
- Resume antes de continuar. En un proyecto de larga duración, pide periódicamente al modelo (o hazlo tú mismo) que comprima las decisiones clave tomadas hasta el momento en un breve resumen; después, inicia un nuevo hilo con ese resumen y tu archivo de Skill.
- Presta atención a las señales de advertencia. Las preguntas repetidas, las respuestas que contradicen respuestas anteriores o las respuestas vagas a solicitudes específicas suelen ser síntomas de una ventana saturada o truncada, no de un problema con el prompt.
En resumen:
Cada modelo de AI tiene una ventana de contexto fija y, una vez que se llena, el contenido más antiguo se diluye o se descarta: eso es el «olvido» que estás notando, no confusión. Tanto las cargas de documentos grandes como los historiales de chat extensos consumen ese mismo espacio finito. Mantener compactas y separadas tus instrucciones permanentes, como ocurre con Rafa (especialista en análisis de marketing) o Ryan (jefe de gabinete), deja espacio para el documento y el contenido de la tarea que realmente lo necesitan, de modo que las respuestas sigan siendo precisas durante más tiempo.
Introduce cómo utilizas realmente los chats de AI (tú o tu equipo) y obtén una estimación mensual real del desperdicio de tokens y del coste en dólares de volver a escribir prompts frente a usar un archivo de habilidades persistente. No necesitas registrarte ni proporcionar tu correo electrónico: solo se aplican a tus cifras las matemáticas de esta publicación.
Prueba la calculadora →Preguntas frecuentes
¿Qué cuenta exactamente para la ventana de contexto?
Todo lo que hay en la conversación actual: tus mensajes, las respuestas del modelo, cualquier prompt del sistema o las instrucciones del archivo de habilidades y el texto completo extraído de los archivos o documentos adjuntos. Todo se mide conjuntamente en tokens con respecto a un único límite compartido.
¿Empezar un chat nuevo realmente soluciona el problema?
Sí, en el sentido de que limpia por completo la ventana: no hay historial diluido ni riesgo de truncamiento desde un punto anterior de la conversación. La desventaja es que pierdes cualquier contexto del hilo antiguo que no hayas trasladado, así que conviene llevar un resumen breve junto con tu archivo de habilidades al nuevo chat en lugar de empezar desde cero.
¿Por qué no usar simplemente un modelo con una ventana de contexto más grande?
Una ventana más grande ayuda, pero no elimina la dinámica subyacente: la dilución y la priorización siguen ocurriendo a escala, y las entradas enormes siguen costando tokens reales, ya sea que el límite sea de 100.000 o de 1.000.000. Una ventana más grande te da más espacio; no te proporciona un modelo que sepa automáticamente qué priorizar dentro de ese espacio.
¿En qué se diferencia un archivo de habilidades de simplemente escribir buenas instrucciones en el chat?
Ambas opciones pueden funcionar, pero las instrucciones escritas directamente en un chat quedan en la misma ventana saturada que todo lo demás y, a menudo, se repiten, se contradicen o se diluyen a medida que crece la conversación. Un archivo de habilidades se carga una vez como un rol definido —compacto y separado del contenido de la tarea—, por lo que no compite por espacio con el documento o los datos con los que realmente estás trabajando.
Relacionado: Las mejores habilidades de Claude para ejecutivos y jefes de gabinete · Los mejores mercados de habilidades de Claude (comparativa)


