Возможности

Уровни обслуживания

service_tier выбирает, как обработать запрос: дешевле и медленнее или быстрее и дороже. В ответе видно, какой уровень реально отработал. Списание — по нему.

По умолчанию уровень не задаётся: обычная ёмкость и обычная цена.

Значения

ЗначениеСмысл
flexДешевле, выше задержка
priorityБыстрее, дороже

fast — то же, что priority.

Как задать

Поле верхнего уровня в теле запроса. Работает в /chat/completions, /responses и /messages.

curl https://api.aitunnel.ru/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-aitunnel-xxx" \
  -d '{
    "model": "gpt-5.4",
    "service_tier": "flex",
    "messages": [
      { "role": "user", "content": "Скажи интересный факт" }
    ]
  }'

Есть не у всех моделей — в основном у части OpenAI и Google. Если у модели нет flex-ёмкости, flex уйдёт как обычный запрос и по обычной цене. priority сначала пробует быструю ёмкость; если не вышло — обычную, и тогда обычный тариф.

На прямых маршрутах отдельных провайдеров параметр игнорируется.

Ответ

Какой уровень сработал:

  • /chat/completions и /responses — поле service_tier на верхнем уровне
  • /messages — внутри usage

Значения: default, flex, priority или null. В Messages базовый уровень — standard, не default.