Elysium AI
Разделы wikiКэш контекста
WikiОсновыКэш контекста
Prompt cache

Кэш контекста

Как повторное использование длинного контекста отражается в usage и стоимости запроса.

Пошаговое объяснение без лишних деталей

Кэш простыми словами

Представьте длинную инструкцию и документ, которые отправляются в каждом сообщении. В первом запросе повторяемая часть может быть записана в кэш. В следующем запросе тот же фрагмент читается из кэша, а новым входом остаётся только добавленное сообщение.

  • Первый запрос: длинный общий контекст + вопрос.
  • Повторный запрос: тот же контекст + новый вопрос.
  • В usage появляются cache_write_tokens или cache_read_tokens.
  • Каждая часть умножается на свою цену за 1 миллион токенов из карточки модели.
Кэш на одном понятном примере

Одинаковый большой контекст отправляется второй раз

REQUEST 0120k new + 80k reusable

80k совпадающих токенов записываются в кэш.

cache_write_tokens: 80000
REQUEST 0220k new + 80k cached

Повторившиеся 80k читаются по тарифу cache read.

cache_read_tokens: 80000

Сначала повторяемая часть сохраняется для следующих запросов.

Смотрите cache write в карточке выбранной модели.

Как повысить повторное использование

  • Ставьте неизменные инструкции и большой документ в начало контекста.
  • Не меняйте пробелы, порядок блоков и служебный текст в уже отправленном префиксе.
  • Добавляйте новые сообщения после стабильной части.
  • Проверяйте cache_read_tokens в usage и Analytics на повторных запросах.

Формула списания

Сначала определяется обычный, отдельно не тарифицируемый вход. В OpenAI-формате cache-токены часто уже находятся внутри prompt_tokens, поэтому повторно прибавлять полный prompt_tokens нельзя. Elysium AI выполняет эту нормализацию автоматически.

text7 строк
1uncached_input = prompt_tokens - cache_read_tokens - cache_write_tokens2 3cost =4  uncached_input      / 1 000 000 × input_price5+ cache_read_tokens  / 1 000 000 × cache_read_price6+ cache_write_tokens / 1 000 000 × cache_write_price7+ output_tokens      / 1 000 000 × output_price

Все четыре цены задаются в долларах за 1 миллион токенов. Это абсолютные тарифы, а не множители x.

Термины на этой странице

Короткая расшифровка обозначений, которые встречаются в этом разделе.

ТерминBase URL
Что означаетБазовый адрес API, к которому клиент добавляет нужный маршрут.
ТерминAPI-ключ
Что означаетСекрет для авторизации и списания запросов с вашего баланса.
ТерминModel ID
Что означаетТочное системное имя модели из каталога Elysium AI.
ТерминТокен
Что означаетНебольшая часть текста, по количеству которой рассчитывается usage.
ТерминCache read
Что означаетПовторно использованные входные токены, прочитанные из кэша.
ТерминCache write
Что означаетТокены, сохранённые провайдером для возможного повторного использования.
ТерминЦена за 1M
Что означаетСтоимость одного миллиона токенов соответствующего типа.