Возможности
Уровни обслуживания
service_tier выбирает, как обработать запрос: дешевле и медленнее или быстрее и дороже. В ответе видно, какой уровень реально отработал. Списание — по нему.
По умолчанию уровень не задаётся: обычная ёмкость и обычная цена.
Значения
| Значение | Смысл |
|---|---|
flex | Дешевле, выше задержка |
priority | Быстрее, дороже |
fast — то же, что priority.
Как задать
Поле верхнего уровня в теле запроса. Работает в /chat/completions, /responses и /messages.
curl https://api.aitunnel.ru/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-aitunnel-xxx" \
-d '{
"model": "gpt-5.4",
"service_tier": "flex",
"messages": [
{ "role": "user", "content": "Скажи интересный факт" }
]
}'Есть не у всех моделей — в основном у части OpenAI и Google. Если у модели нет flex-ёмкости, flex уйдёт как обычный запрос и по обычной цене. priority сначала пробует быструю ёмкость; если не вышло — обычную, и тогда обычный тариф.
На прямых маршрутах отдельных провайдеров параметр игнорируется.
Ответ
Какой уровень сработал:
/chat/completionsи/responses— полеservice_tierна верхнем уровне/messages— внутриusage
Значения: default, flex, priority или null. В Messages базовый уровень — standard, не default.