Кэш контекста
Как повторное использование длинного контекста отражается в usage и стоимости запроса.
Пошаговое объяснение без лишних деталей
Кэш простыми словами
Представьте длинную инструкцию и документ, которые отправляются в каждом сообщении. В первом запросе повторяемая часть может быть записана в кэш. В следующем запросе тот же фрагмент читается из кэша, а новым входом остаётся только добавленное сообщение.
- Первый запрос: длинный общий контекст + вопрос.
- Повторный запрос: тот же контекст + новый вопрос.
- В usage появляются cache_write_tokens или cache_read_tokens.
- Каждая часть умножается на свою цену за 1 миллион токенов из карточки модели.
Одинаковый большой контекст отправляется второй раз
80k совпадающих токенов записываются в кэш.
cache_write_tokens: 80000Повторившиеся 80k читаются по тарифу cache read.
cache_read_tokens: 80000Сначала повторяемая часть сохраняется для следующих запросов.
Смотрите cache write в карточке выбранной модели.
Как повысить повторное использование
- Ставьте неизменные инструкции и большой документ в начало контекста.
- Не меняйте пробелы, порядок блоков и служебный текст в уже отправленном префиксе.
- Добавляйте новые сообщения после стабильной части.
- Проверяйте cache_read_tokens в usage и Analytics на повторных запросах.
Формула списания
Сначала определяется обычный, отдельно не тарифицируемый вход. В OpenAI-формате cache-токены часто уже находятся внутри prompt_tokens, поэтому повторно прибавлять полный prompt_tokens нельзя. Elysium AI выполняет эту нормализацию автоматически.
1uncached_input = prompt_tokens - cache_read_tokens - cache_write_tokens2 3cost =4 uncached_input / 1 000 000 × input_price5+ cache_read_tokens / 1 000 000 × cache_read_price6+ cache_write_tokens / 1 000 000 × cache_write_price7+ output_tokens / 1 000 000 × output_priceВсе четыре цены задаются в долларах за 1 миллион токенов. Это абсолютные тарифы, а не множители x.
Термины на этой странице
Короткая расшифровка обозначений, которые встречаются в этом разделе.

