OpenAI улучшила кэширование промптов в GPT-6: выше попадания, ниже задержки и стоимость
OpenAI объявила о значительном улучшении кэширования промптов для модели GPT-6. Новая система позволяет эффективнее распознавать повторяющиеся контексты, сокращая число полных вычислений и тем самым уменьшая как время ответа, так и стоимость вызовов API.
Ключевые нововведения включают повышенную частоту попаданий в кэш (cache hit rate), встроенную диагностику для анализа работы кэша и поддержку явных точек останова (explicit breakpoints). Последнее позволяет разработчикам точно указывать, какие части промпта должны кэшироваться, а какие — пересчитываться каждый раз.
Такие возможности особенно полезны для сценариев, где многократно используются длинные системные инструкции или повторяющиеся контексты, — например, в чат-ботах или ИИ-агентах. В результате пользователи получают более быстрые ответы и существенную экономию на токенах.