Перейти к содержимому

· v2.7

Повторные запросы в диалоге стали дешевле — и видно, насколько

Включили кэширование промпта: в продолжающейся переписке входная часть запроса обходится в разы дешевле. Сэкономленные нейроны показываются прямо у ответа.

Когда вы продолжаете диалог, модель каждый раз получает всю предыдущую переписку заново — и вы за неё платите. Поставщики умеют кэшировать повторяющуюся часть и брать за неё меньше, но для этого запрос должен приходить побайтово одинаковым. Мы это наладили.

Что сделали

  • Убрали из системной части запроса всё, что менялось от секунды к секунде — время теперь округляется, ссылки переиспользуются.
  • Расставили точки кэширования для поставщиков, которым нужно указывать их явно.
  • Стали показывать выгоду: наведите курсор на ответ — если кэш сработал, плашка станет фиолетовой и покажет, сколько нейронов сэкономлено.
  • Свели три числа стоимости в одно: раньше рядом с ответом висели списание, экономия и итог отдельно.

Сколько экономится на практике

Замеры на живых моделях в конце июля: при попадании в кэш входная часть обходится примерно в десять раз дешевле у Claude Haiku и примерно вчетверо дешевле у Gemini Flash. Итоговая выгода по сообщению меньше, потому что ответ модели оплачивается полностью.

Экономия считается по числам самого поставщика и переводится в нейроны тем же способом, что и обычное списание, — это не оценка, а факт.