Cambiar tema

Optimización de costos de Codex en la práctica: cómo ahorrar tokens sin perder criterio

Easton editorial illustration: one raised charcoal terminal console with a small exec prompt, three compact output artifacts: changelog sheet, issue-tag stack, documentation checklist, one small lock gate leading to a separate patch or pull-request card

"La Codex rate card explica la relación entre input, cached input y output tokens; esa es la base del análisis de costos de este artículo."

Optimización de costos de Codex en la práctica: cómo ahorrar tokens sin perder criterio

La misma tarea, pero el cupo desaparece mucho más rápido de lo esperado. Un hilo largo relee el contexto todo el día. multi_agent está activado por defecto. AGENTS.md tiene miles de líneas. Incluso las tareas pequeñas corren con el modelo más caro. Si quieres saber en qué se va el dinero y cómo bajarlo de forma sistemática, aquí va la lectura clara.

1. Dónde se va el dinero: cómo funciona la facturación

Los costos de Codex vienen de cuatro sitios: releer contexto, sesiones largas, subtareas en paralelo y niveles altos de razonamiento. El mecanismo base es la facturación token/credit: cada bloque de input, cached input y output consume el crédito correspondiente. Los distintos tipos de token tienen tarifas distintas. cached input cuesta menos que input normal, y por eso el prompt cache puede ahorrar dinero. Las tarifas exactas están en la rate card oficial.

Codex no funciona con un simple límite mensual, sino con una ventana móvil. Cuando la ventana se llena, entran los rate limits. Plus y Pro tienen rate-limit reset banking, y la ventana se recupera al caducar. Las API keys se facturan aparte por token y no dependen del límite del plan de Codex.

Si quieres ver el uso, usa /status para la sesión actual o abre el usage dashboard en la configuración de Codex para ver el consumo del equipo.

Releer contexto es la fuente de gasto más fácil de pasar por alto. En cada tarea, Codex vuelve a leer AGENTS.md, la documentación del proyecto y el historial del hilo. Si AGENTS.md tiene miles de líneas, la documentación es enorme y un thread se alarga durante muchas rondas, los tokens se acumulan. Las sesiones largas son acumulativas: cuanto más largo es el hilo y más lee, más caro sale. Con multi_agent, cada agente activo consume su propio cupo, así que el costo sube con el paralelismo. Los modelos más potentes como GPT-5.5/5.4 cuestan más que GPT-5.4 mini, y los niveles de razonamiento Low/Medium/High/Extra High también cambian la factura.

Así se comparan las medidas de ahorro con su coste de oportunidad:

Medida de ahorroEfecto esperadoCompromiso
Elegir un modelo más baratoReduce el consumo entre 30-60%Menos razonamiento; peor en tareas complejas
Limpiar el contexto a tiempoReduce el consumo entre 20-40%Más threads nuevos; se pierde historial
Acortar AGENTS.mdReduce el consumo entre 10-20%Más fragmentación documental; mayor mantenimiento
Usar el prompt cacheReduce el consumo entre 15-30%El contexto debe permanecer estable
Reducir multi_agentReduce el consumo entre 20-50%Menos paralelismo; ejecución más lenta

Ahorrar no es volverse mezquino. Un modelo más barato puede recortar la factura entre 30-60%, pero las tareas complejas pueden resentirse. Limpiar el contexto a tiempo puede ahorrar 20-40%, pero obliga a abrir más threads. Acortar AGENTS.md puede ahorrar 10-20%, pero empuja trabajo a la estructura documental. El criterio real es la tarea. No sacrifiques la capacidad principal solo por un ahorro pequeño.

Supervisar el uso

Con /status en la consola puedes ver el estado del thread actual, incluida la tamaño del contexto y el cupo consumido. En el usage dashboard de Codex ves el consumo del equipo y el estado de la ventana de cuota. Lleva un control periódico para comparar el efecto real de las medidas de ahorro.

2. Niveles de modelo y razonamiento: no siempre el más caro

La elección del modelo impacta directamente en el costo. Codex ofrece cuatro niveles de razonamiento: Low, Medium, High y Extra High. Low es rápido y acotado, ideal para tareas simples. Medium y High encajan mejor con trabajo más complejo o cargado de debugging. Extra High está pensado para tareas agentic largas. En modelos, GPT-5.5 y GPT-5.4 son los frontier; GPT-5.4 mini es la variante ligera; 5.3-Codex y 5.2 ya están obsoletos.

La regla base es simple: frontier para pensar, mini para el trabajo rutinario. Elige el nivel de razonamiento según la dificultad real. No uses siempre la combinación más cara. Mantener por defecto el nivel más alto quema cupo sin aportar necesariamente más en tareas sencillas.

La distribución es esta:

Tipo de tareaNivel de razonamiento recomendadoEscenario típico
Búsqueda simple, cambio de formatoLowFormateo de documentos, pequeños arreglos
Refactor, desarrollo de funcionalidadMediumRefactor de un archivo, integración de API
Debugging, lógica complejaHighBugs repartidos en varios archivos, ajuste de rendimiento
Tareas agentic largasExtra HighAutomatización multi-etapa, desarrollo exploratorio

Para consultas simples y conversiones de formato, usa Low + mini. Para refactors y desarrollo de funcionalidades, Medium + mini o Medium + GPT-5.4. Para debugging y lógica compleja, High + GPT-5.4/5.5. Para tareas agentic largas, Extra High + GPT-5.5. Elige por dificultad real, no por sensación de seguridad. Ir demasiado alto “por si acaso” también es caro.

FAQ: cómo elegir un modelo que ahorre

Para tareas de pensamiento, modelos frontier (GPT-5.5/5.4); para trabajo pequeño, mini (GPT-5.4 mini). Ajusta el nivel de razonamiento a la dificultad. Búsqueda simple: Low. Debugging complejo: High. Tarea agentic larga: Extra High.

3. Gestión de sesiones: no dejes un hilo corriendo todo el día

Una sesión larga puede pasar todo el día releyendo contexto. Los tokens se van rápido. Codex relee el thread en cada ejecución, y cuanto más largo es el hilo y más lee, más sube el costo. La solución es simple: sesiones cortas. Un thread, una tarea.

En concreto: AGENTS.md tiene miles de líneas, la documentación del proyecto es enorme y los ida y vuelta se repiten muchas veces. Una sola relectura cuesta unos cuantos tokens, pero decenas de rondas terminan en decenas de miles. Cuanto más se alarga el thread, más fácil es que Codex se desordene y peor sale el resultado.

ComandoPara qué sirveCuándo usarlo
/compactComprimir el contexto inicialCuando un thread empieza a alargarse (Codex también lo hace automáticamente)
/clearBorrar el thread actualCuando la tarea ya está terminada
/resumeRetomar un thread anteriorCuando necesitas seguir una tarea pasada
/forkCrear una ramaCuando hace falta explorar caminos distintos
/agentCambiar a un agente paraleloCuando necesitas multi_agent
/statusRevisar el estado del threadCuando quieres vigilar el uso

Mejores prácticas de sesión

Cuando una tarea termina, usa /clear de inmediato o abre un thread nuevo para evitar acumulación de contexto. En sesiones largas, usa /compact para comprimir la parte inicial y ahorrar tokens. No uses /resume salvo que de verdad necesites continuar la tarea anterior. No mezcles bugfix, feature, refactor y deployment en un mismo thread. El contexto se vuelve confuso y se desperdician tokens. Para ramas de exploración está /fork, pero recuerda que cada rama consume su propio cupo.

FAQ: cómo gestionar sesiones largas

Cuando la tarea termina, usa /clear o abre un thread nuevo. En sesiones largas, usa /compact. Un thread, una tarea.

4. AGENTS.md ligero: evitar el corte de 32 KiB

AGENTS.md crece rápido y se come contexto. Además puede truncarse. project_doc_max_bytes viene por defecto en 32 KiB. En cuanto AGENTS.md llega a ese límite, el sistema deja de añadir contenido y corta lo que sobra. La truncación hace perder instrucciones y desperdicia contexto.

Así se puede leer el tamaño de AGENTS.md:

Tamaño de AGENTS.mdImpactoSolución
< 16 KiBSin efecto notable; poco consumo de contextoMantenerlo igual
16-32 KiBCarga media; vigilarSeparar lo que no sea esencial
> 32 KiBRiesgo de truncado; algunas instrucciones desaparecenDividir en carpetas anidadas

Pasos para aligerar AGENTS.md

Mantén un solo AGENTS.md ligero y estable por debajo de 32 KiB, y deja ahí solo las instrucciones centrales y las reglas comunes. Si te pasas del límite, mueve las reglas extra a carpetas anidadas como docs/.agents, y deja los detalles en archivos .md dedicados a la tarea. Usa el override por proximidad para que el AGENTS.md local de una subcarpeta tome prioridad.

Para una guía más detallada, mira AGENTS.md Best Practices.


5. Prompt cache: hacer más barato el contexto estable

cached input cuesta menos que input normal, y esa es la razón principal para usar prompt cache. Si el contexto se mantiene estable, Codex puede facturarlo como cached input. Mantén AGENTS.md y la documentación del proyecto estables para que la caché rinda de verdad.

El mecanismo es sencillo: Codex guarda bloques de contexto estables como AGENTS.md y la documentación del proyecto. En la siguiente ejecución, se cobran como cached input. Si los cambias todo el tiempo, la caché falla y vuelves a la tarifa de input normal. Una buena tasa de cache puede bajar el costo de una ejecución entre 15-30%.

La regla práctica: mantener AGENTS.md corto y estable, dejar las reglas duraderas en un lugar fijo y mover el contenido variable a una carpeta temporal o a documentación específica de la tarea. No metas todo en el prompt.

Coste y beneficio del cache:

Palanca de cacheEfecto esperadoCoste
AGENTS.md estableMás aciertos de cached inputRequiere planificación previa; menos cambios
Docs del proyecto establesMenos token repetidoLa cache caduca cuando cambia la doc
Evitar cambios frecuentesMás estabilidad en el hit rateMenos flexibilidad

FAQ: cómo ahorra dinero el prompt cache

Mantén AGENTS.md y la documentación del proyecto estables para que entre cached input. cached input cuesta menos que input normal, y la diferencia exacta está definida en la rate card oficial.

6. Paralelismo y plan mode: actívalos solo cuando haga falta

multi_agent v2 se factura por ejecución activa. Cada agente activo consume cupo, así que el paralelismo cuesta más que un agente solo. Por ahora, multi_agent sigue siendo experimental; la postura por defecto debe ser prudencia. Actívalo solo si realmente lo necesitas.

La cuenta es simple: un agente ejecuta una vez y consume X. Si multi_agent lanza tres agentes en paralelo, cada agente activo consume X y el total pasa a ser 3X. Cuantos más agentes, más caro. Además, cada agente relee contexto, razona y genera salida, y todo eso se suma.

Modo de paralelismoEfecto en el costoEscenario típico
Un solo agenteCosto baseUna tarea, ejecución secuencial
multi_agent (paralelismo ligero)+20-30%Exploración paralela real
multi_agent (paralelismo fuerte)+50-100%Tareas agentic largas

multi_agent tiene sentido cuando la tarea necesita una exploración realmente paralela, por ejemplo cambiar varios archivos a la vez, sincronizar varios documentos o ejecutar flujos agentic largos como tests automáticos, despliegue y monitorización. Para un bugfix puntual, un refactor paso a paso o trabajo individual con presupuesto ajustado, no es la mejor opción. Para entender mejor los costos del paralelismo, mira Codex Multi-Agent in Practice.

La regla para multi_agent es sencilla: apagado por defecto, encender solo cuando haga falta. Mantén pocos agentes activos y reduce el paralelismo si el costo se dispara.

FAQ: ¿el paralelismo multi-agent sale caro?

Sí. multi-agent v2 factura por ejecución activa, así que cada agente activo consume cupo. Déjalo apagado por defecto.


7. Plan mode: no abusar en tareas simples

Plan mode añade una ronda de planificación, así que consume tokens extra. En tareas complejas, esa ronda puede evitar rehacer trabajo. En tareas simples, muchas veces es solo overhead. Si la tarea está clara, ejecútala directamente.

Así se relacionan la complejidad y el plan mode:

Dificultad de la tarea¿Usar plan mode?Impacto en costo
Simple (un paso, claro)NoCosto base
Media (varios pasos, hace falta validación)Una ronda de planificación extra, pero menos rework
Compleja (cadena agentic larga)Una ronda de planificación extra, pero se evita un rework más caro

La regla: plan mode para tareas complejas, ejecución directa para las simples. Es la recomendación conservadora. La decisión final depende de la tarea.

FAQ: ¿plan mode cuesta más?

Sí, añade una ronda extra de tokens. No lo uses para tareas simples; guárdalo para tareas complejas y así evitar rework.

8. Monitoreo y presupuesto: no se ahorra lo que no se ve

Para saber si los ahorros funcionan, necesitas visibilidad. Codex ofrece dos entradas de monitoreo: el usage dashboard y /status. El usage dashboard vive en la configuración de Codex y muestra el consumo del equipo y el estado de la ventana de cuota. /status en la consola muestra el tamaño del contexto y el cupo consumido del thread actual.

Pasos para monitorear el uso

Abre el usage dashboard en la configuración de Codex para ver el uso del equipo. Usa /status para revisar el thread actual. Para planificar presupuesto, puedes usar un rango orientativo: Plus ronda los $20/mes, Pro ronda los $200/mes, Business ronda los $25-30 por persona y mes, y en equipos reales suelen verse valores cercanos a $100-200 por persona y mes (solo como referencia, no oficial). Estos números son orientativos para 2026-06; para decisiones reales, sigue el precio oficial.

FAQ: ¿cuánto cuesta al mes?

Plus ronda los $20/mes, Pro ronda los $200/mes. En la práctica, en equipos se ve con frecuencia un rango de $100-200 por persona y mes. El número real está en el usage dashboard.

9. FAQ

Q1: ¿En qué se va el dinero de Codex?

En releer contexto, sesiones largas, paralelismo multi-agent y niveles altos de razonamiento. Ver la sección 1.

Q2: ¿Cómo elegir un modelo más barato?

Frontier para pensar (GPT-5.5/5.4), mini para lo sencillo (GPT-5.4 mini). Ajusta el nivel de razonamiento a la dificultad. Ver la sección 2.

Q3: ¿Cómo manejo las sesiones largas?

Usa /clear cuando termines la tarea, o /compact en un thread largo. Un thread, una tarea. Ver la sección 3.

Q4: ¿Cómo ayuda el prompt cache a ahorrar?

Mantén estables AGENTS.md y la documentación del proyecto para que entre cached input. cached input cuesta menos que input normal. Ver la sección 5.

Q5: ¿AGENTS.md demasiado grande es un problema?

Sí, por encima de 32 KiB puede truncarse y además consume contexto. Mantén el archivo principal ligero y mueve el exceso a carpetas anidadas. Ver la sección 4.

Q6: ¿El paralelismo multi-agent sale caro?

Sí, porque se factura por ejecución activa. Déjalo apagado por defecto. Ver la sección 6.

Q7: ¿Plan mode cuesta más?

Sí, añade una ronda extra de tokens. No lo uses para tareas simples. Ver la sección 7.

Q8: ¿Cuánto cuesta aproximadamente al mes?

Plus alrededor de $20/mes, Pro alrededor de $200/mes. En equipos, a menudo se habla de $100-200 por persona y mes. Ver la sección 8.

10. Siguientes pasos y lecturas complementarias

Si quieres una guía sobre permisos y errores frecuentes, lee Codex Sandbox and Permission Boundaries. Si quieres profundizar en agentes paralelos, lee Codex Multi-Agent in Practice.

Hacer un check de costos de Codex

Revisa de forma rápida los cinco focos de gasto más comunes: facturación, modelo, sesiones, caché y paralelismo.

  1. 1

    Step 1: Revisar el uso

    Empieza con `/status` y el usage dashboard para ver la sesión actual y el consumo del equipo.
  2. 2

    Step 2: Bajar el razonamiento

    Usa Low o mini para tareas sencillas; reserva los niveles altos para debugging real.
  3. 3

    Step 3: Acortar sesiones

    Cuando termines, `/clear`; si el hilo se alarga, `/compact`; `/fork` solo si hace falta una rama.
  4. 4

    Step 4: Estabilizar el contexto

    Mueve las reglas duraderas a un AGENTS.md recortado o a documentación dedicada a la tarea.
  5. 5

    Step 5: Controlar el paralelismo

    Activa multi_agent y plan mode solo cuando realmente aporten valor.

FAQ

¿En qué se va el dinero de Codex?
Sobre todo en releer contexto, sesiones largas, subtareas paralelas y niveles de razonamiento altos.
¿Qué modelo conviene para pagar menos?
Los modelos frontier para pensar y depurar problemas complejos; mini para tareas rutinarias. El nivel de razonamiento debe seguir la dificultad.
¿Cómo manejo sesiones largas?
Usa `/clear` al terminar, `/compact` cuando el hilo crezca y evita dejar un mismo thread corriendo todo el día.
¿Cómo ayuda el prompt cache a ahorrar?
Un contexto estable y reutilizable tiene más probabilidades de usar cached input, y cached input cuesta menos que input normal.
¿multi_agent siempre sale más caro?
Sí, por lo general sí. Solo actívalo cuando la exploración paralela sea realmente necesaria.
¿Cuánto cuesta Codex al mes?
Aquí solo tiene sentido dar rangos y una referencia temporal; para números reales, usa la rate card oficial y el usage dashboard.

12 min de lectura · Publicado el: 13 ago 2026 · Actualizado el: 13 ago 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog