Prompt Architect
Конструируйте промпты с точностью
Список моделей проверен: 09.07.2026
Эта модель может генерировать скрытые reasoning-токены, которые тарифицируются как вывод, но никогда не показываются в ответе — реальная стоимость вывода может быть в несколько раз выше оценки выше. Этот инструмент не может их посчитать — они определяются в момент генерации.
Этот провайдер кэширует повторяющиеся префиксы автоматически на сервере — для указанной выше экономии метки в экспорте не нужны.
Вопросы
Про стоимость промпта, простыми словами
-
Как понять, во сколько обойдётся промпт, ещё до отправки?
Стоимость — это количество токенов на цену ввода модели плюс ответ по цене вывода, но деньги прячутся в деталях. Инструмент считает написанные вами блоки, обвязку чат-шаблона, которую API добавляет вокруг них, и токены самих определений инструментов, а потом оценивает всё это по текущей цене каждой модели в списке. Определения инструментов — это как раз тот оплачиваемый ввод, про который регулярно забывают, а платят за него в каждом запросе.
-
Что такое кеширование промпта и когда оно реально экономит?
Провайдер может удерживать неизменную голову вашего промпта — длинный системный промпт, фиксированный документ — и брать за повторное чтение сильно меньше. Загвоздка в пороге: у Anthropic блок должен дорасти до 4096 токенов, чтобы вообще попасть в кеш, у Google — до 1024. Запись в кеш к тому же дороже обычного чтения (1,25× у Anthropic) и только потом начинает отбиваться по 0,10×. Блок ниже порога не даёт ничего, поэтому инструмент показывает для него нулевую экономию, а не скидку, которой не будет.
-
Влияет ли порядок блоков в промпте?
Для кеширования это разница между «заплатить один раз» и «платить каждый запрос»: всё, что вы хотите закешировать, должно стоять в начале и оставаться байт в байт тем же между запросами. Поставьте отметку времени или имя пользователя выше длинного системного промпта — и кеш будет промахиваться каждый раз. Роли важны по другой причине: system — для постоянных правил, context — для найденного материала, user — для самого запроса, потому что модели взвешивают их по-разному, а инструкция, закопанная внутрь вставленного контекста, — это типовой способ сделать так, чтобы её проигнорировали.
-
Что такое Batch API и когда его стоит использовать?
Та же модель примерно за полцены в обмен на отказ от немедленного ответа: вы отправляете пакет и забираете результаты позже. Anthropic и OpenAI документируют скидку 50%, поэтому инструмент её применяет; у Google такой скидки в документации нет, поэтому там не применяется ничего — вместо угаданной цифры. Выгодно везде, где на том конце никто не ждёт: прогоны оценки, массовая классификация, офлайн-генерация.