API
Параметры
Параметры выборки формируют процесс генерации токенов. Можно отправить любые поля из списка ниже — и другие, которые понимает модель.
Если параметра нет в запросе, AITUNNEL не подставляет своё значение: провайдер применяет свой дефолт. «По умолчанию» ниже — обычное значение у провайдеров, не то, что мы инжектим. Явно передать temperature: 1.0 и не передавать поле — не одно и то же: например, это может влиять на ключ кэша на стороне провайдера.
Нестандартные параметры
Поля, которые понимает модель, уходят провайдеру как есть. Если модель параметр не умеет (например top_k у OpenAI), он игнорируется. Остальное не ломает запрос.
Temperature
- Ключ:
temperature - Опционально, float, от 0.0 до 2.0
- По умолчанию: 1.0
Влияет на разнообразие ответов. Ниже — предсказуемее и типичнее. Выше — разнообразнее и реже. При 0 модель для одного и того же входа даёт один и тот же ответ.
Top P
- Ключ:
top_p - Опционально, float, от 0.0 до 1.0
- По умолчанию: 1.0
Ограничивает выбор процентом вероятных токенов: берутся только те, чьи вероятности в сумме дают P. Ниже — предсказуемее. По умолчанию доступен весь диапазон. Это динамический Top-K.
Top K
- Ключ:
top_k - Опционально, integer, 0 или выше
- По умолчанию: 0
На каждом шаге модель выбирает из K самых вероятных токенов. 1 — всегда самый вероятный следующий токен. 0 — настройка выключена, рассматриваются все варианты. У OpenAI поле игнорируется.
Frequency Penalty
- Ключ:
frequency_penalty - Опционально, float, от −2.0 до 2.0
- По умолчанию: 0.0
Штрафует токены пропорционально тому, как часто они уже встречались во входе. Чем чаще токен появлялся, тем сильнее штраф. Отрицательные значения поощряют повтор.
Presence Penalty
- Ключ:
presence_penalty - Опционально, float, от −2.0 до 2.0
- По умолчанию: 0.0
Штрафует токены, которые уже были во входе, независимо от числа повторов. Выше — меньше повторов. Отрицательные значения поощряют повтор.
Repetition Penalty
- Ключ:
repetition_penalty - Опционально, float, от 0.0 до 2.0
- По умолчанию: 1.0
Снижает повтор токенов из входа. Выше — меньше повторов, но слишком высокое значение ломает связность (длинные предложения без коротких слов). Штраф масштабируется от исходной вероятности токена.
Min P
- Ключ:
min_p - Опционально, float, от 0.0 до 1.0
- По умолчанию: 0.0
Минимальная вероятность токена относительно самого вероятного. При 0.1 остаются только токены не слабее 1/10 от лучшего варианта. Порог двигается вместе с уверенностью лидера.
Top A
- Ключ:
top_a - Опционально, float, от 0.0 до 1.0
- По умолчанию: 0.0
Оставляет токены с «достаточно высокой» вероятностью относительно лидера. Это динамический Top-P: ниже — уже фильтр вокруг самого вероятного токена. Выше не обязательно делает ответ креативнее — уточняет отсечку.
Seed
- Ключ:
seed - Опционально, integer
Если задан, выборка должна быть детерминированной: одинаковые seed и параметры — одинаковый результат. Для части моделей детерминизм не гарантируется.
Max Tokens
- Ключ:
max_tokens - Опционально, integer, 1 или выше
Верхняя граница числа токенов в ответе. Максимум — длина контекста минус длина промпта.
На прямом маршруте к новым моделям OpenAI max_tokens автоматически уходит как max_completion_tokens.
Max Completion Tokens
- Ключ:
max_completion_tokens - Опционально, integer, 1 или выше
То же ограничение длины ответа, что и max_tokens. Нужен новым моделям OpenAI, которые отклоняют устаревшее поле max_tokens.
Logit Bias
- Ключ:
logit_bias - Опционально, map
JSON-объект: id токена в токенизаторе → смещение от −100 до 100. Смещение прибавляется к логитам до выборки. Эффект зависит от модели: −1…1 слегка меняет вероятность, −100 / 100 обычно запрещает или принудительно выбирает токен.
Logprobs
- Ключ:
logprobs - Опционально, boolean
Вернуть логарифмические вероятности выходных токенов. Если true, в ответе будут logprobs каждого возвращённого токена.
Top Logprobs
- Ключ:
top_logprobs - Опционально, integer
Число от 0 до 20: сколько самых вероятных токенов вернуть на каждой позиции вместе с logprob. Требует logprobs: true.
Response Format
- Ключ:
response_format - Опционально, map
Заставляет модель ответить в заданном формате. { "type": "json_object" } включает JSON-режим: сообщение будет валидным JSON.
JSON-режим
Модель всё равно нужно попросить отвечать JSON — системным или пользовательским сообщением.
Строгая схема — { "type": "json_schema", "json_schema": { … } }. Подробнее — структурированный вывод.
Structured Outputs
- Ключ:
structured_outputs - Опционально, boolean
Может ли модель вернуть структурированный вывод через response_format с json_schema. Основной способ задать схему — само поле response_format.
Stop
- Ключ:
stop - Опционально, array (или строка)
Генерация останавливается, как только модель встречает любой токен из списка.
Tools
- Ключ:
tools - Опционально, array
Вызов инструментов в форме OpenAI. Для других провайдеров схема преобразуется. Сюда же кладётся серверный aitunnel:web_search. Подробнее — вызов инструментов и веб-поиск.
Tool Choice
- Ключ:
tool_choice - Опционально, string или object
Какой инструмент вызывать:
none— не вызывать, сразу ответить текстомauto— модель сама решает: текст или один/несколько инструментовrequired— обязан вызвать хотя бы один{"type": "function", "function": {"name": "my_function"}}— вызвать конкретный
Parallel Tool Calls
- Ключ:
parallel_tool_calls - Опционально, boolean
- По умолчанию: true
Разрешить несколько вызовов инструментов сразу. false — строго по одному. Имеет смысл, только если в запросе есть tools.
Include Reasoning
- Ключ:
include_reasoning - Опционально, boolean
Устаревший алиас. true = reasoning: {}, false = reasoning: { "exclude": true }. Лучше объект reasoning. Подробнее — токены рассуждений.
Reasoning
- Ключ:
reasoning - Опционально, map
Рассуждения у моделей с thinking-токенами: включить, задать effort / бюджет, скрыть цепочку из ответа. Подробнее — токены рассуждений.
Reasoning Effort
- Ключ:
reasoning_effort - Опционально, enum, xhigh, high, medium, low, minimal, none
Короткий вариант в стиле OpenAI. Выше — больше внутренних токенов рассуждения, если модель это умеет. Эквивалент reasoning.effort.
Web Search Options
- Ключ:
web_search_options - Опционально, map
Настройки встроенного поиска у моделей, которые ищут сами (без серверного инструмента). Для обычного поиска через AITUNNEL используйте tools: [{ "type": "aitunnel:web_search" }]. Подробнее — веб-поиск.
Verbosity
- Ключ:
verbosity - Опционально, enum, low, medium, high, xhigh, max
- По умолчанию: medium
Краткость ответа. Ниже — короче, выше — подробнее. Появилось у OpenAI в Responses API; провайдер, который поле не понимает, его игнорирует.
Другие поля AITUNNEL
Это не сэмплинг, но часто рядом в том же теле запроса:
models— запасные модели при сбоеprovider.sort— цена, скорость или задержкаplugins— сжатие слишком длинного промптаcache_control,session_id— кеш промптаservice_tier— flex или priority- Пресеты — имя вместо модели, сразу с параметрами