Cómo usar esta calculadora
- Introduce tokens fijos y de la consulta.
- Define cuántos fragmentos se recuperan y su tamaño.
- Reserva tokens para la respuesta.
- Añade ventana, precios y consultas mensuales.
Dimensiona el presupuesto de contexto de una aplicación de generación aumentada por recuperación (RAG). Suma tokens del sistema, pregunta, historial, fragmentos recuperados y respuesta reservada; después compara el total con la ventana del modelo y estima el coste por consulta y por volumen mensual.
El total permite verificar si la consulta cabe en la ventana de contexto y estimar el coste con precios de entrada y salida definidos por el usuario.
La tokenización real varía por modelo y contenido. Usa mediciones del tokenizador del proveedor para presupuestos de producción.
Con 800 tokens de sistema, 500 de pregunta, 6 fragmentos de 450 y 800 de salida, el presupuesto total es 4.800 tokens.
No. Los vectores se usan para recuperar contenido, pero solo el texto insertado en el prompt consume la ventana.
El proveedor puede rechazar la solicitud o truncar contenido; reduce contexto o respuesta reservada.
Sí, reserva un máximo razonable aunque la respuesta promedio sea menor.
Mide una muestra con el tokenizador del modelo y usa un percentil alto para evitar desbordamientos.
No. Solo estima inferencia de entrada y salida; añade esos costes por separado.
| Componente | Tipo |
|---|---|
| Sistema, pregunta, fragmentos | Entrada |
| Respuesta generada | Salida |
| Embeddings almacenados | Fuera de la ventana |