· v2.7
Повторные запросы в диалоге стали дешевле — и видно, насколько
Включили кэширование промпта: в продолжающейся переписке входная часть запроса обходится в разы дешевле. Сэкономленные нейроны показываются прямо у ответа.
Когда вы продолжаете диалог, модель каждый раз получает всю предыдущую переписку заново — и вы за неё платите. Поставщики умеют кэшировать повторяющуюся часть и брать за неё меньше, но для этого запрос должен приходить побайтово одинаковым. Мы это наладили.
Что сделали
- Убрали из системной части запроса всё, что менялось от секунды к секунде — время теперь округляется, ссылки переиспользуются.
- Расставили точки кэширования для поставщиков, которым нужно указывать их явно.
- Стали показывать выгоду: наведите курсор на ответ — если кэш сработал, плашка станет фиолетовой и покажет, сколько нейронов сэкономлено.
- Свели три числа стоимости в одно: раньше рядом с ответом висели списание, экономия и итог отдельно.
Сколько экономится на практике
Замеры на живых моделях в конце июля: при попадании в кэш входная часть обходится примерно в десять раз дешевле у Claude Haiku и примерно вчетверо дешевле у Gemini Flash. Итоговая выгода по сообщению меньше, потому что ответ модели оплачивается полностью.
Экономия считается по числам самого поставщика и переводится в нейроны тем же способом, что и обычное списание, — это не оценка, а факт.