API

Параметры

Параметры выборки формируют процесс генерации токенов. Можно отправить любые поля из списка ниже — и другие, которые понимает модель.

Если параметра нет в запросе, AITUNNEL не подставляет своё значение: провайдер применяет свой дефолт. «По умолчанию» ниже — обычное значение у провайдеров, не то, что мы инжектим. Явно передать temperature: 1.0 и не передавать поле — не одно и то же: например, это может влиять на ключ кэша на стороне провайдера.

Нестандартные параметры

Поля, которые понимает модель, уходят провайдеру как есть. Если модель параметр не умеет (например top_k у OpenAI), он игнорируется. Остальное не ломает запрос.

Temperature

  • Ключ: temperature
  • Опционально, float, от 0.0 до 2.0
  • По умолчанию: 1.0

Влияет на разнообразие ответов. Ниже — предсказуемее и типичнее. Выше — разнообразнее и реже. При 0 модель для одного и того же входа даёт один и тот же ответ.

Top P

  • Ключ: top_p
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 1.0

Ограничивает выбор процентом вероятных токенов: берутся только те, чьи вероятности в сумме дают P. Ниже — предсказуемее. По умолчанию доступен весь диапазон. Это динамический Top-K.

Top K

  • Ключ: top_k
  • Опционально, integer, 0 или выше
  • По умолчанию: 0

На каждом шаге модель выбирает из K самых вероятных токенов. 1 — всегда самый вероятный следующий токен. 0 — настройка выключена, рассматриваются все варианты. У OpenAI поле игнорируется.

Frequency Penalty

  • Ключ: frequency_penalty
  • Опционально, float, от −2.0 до 2.0
  • По умолчанию: 0.0

Штрафует токены пропорционально тому, как часто они уже встречались во входе. Чем чаще токен появлялся, тем сильнее штраф. Отрицательные значения поощряют повтор.

Presence Penalty

  • Ключ: presence_penalty
  • Опционально, float, от −2.0 до 2.0
  • По умолчанию: 0.0

Штрафует токены, которые уже были во входе, независимо от числа повторов. Выше — меньше повторов. Отрицательные значения поощряют повтор.

Repetition Penalty

  • Ключ: repetition_penalty
  • Опционально, float, от 0.0 до 2.0
  • По умолчанию: 1.0

Снижает повтор токенов из входа. Выше — меньше повторов, но слишком высокое значение ломает связность (длинные предложения без коротких слов). Штраф масштабируется от исходной вероятности токена.

Min P

  • Ключ: min_p
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 0.0

Минимальная вероятность токена относительно самого вероятного. При 0.1 остаются только токены не слабее 1/10 от лучшего варианта. Порог двигается вместе с уверенностью лидера.

Top A

  • Ключ: top_a
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 0.0

Оставляет токены с «достаточно высокой» вероятностью относительно лидера. Это динамический Top-P: ниже — уже фильтр вокруг самого вероятного токена. Выше не обязательно делает ответ креативнее — уточняет отсечку.

Seed

  • Ключ: seed
  • Опционально, integer

Если задан, выборка должна быть детерминированной: одинаковые seed и параметры — одинаковый результат. Для части моделей детерминизм не гарантируется.

Max Tokens

  • Ключ: max_tokens
  • Опционально, integer, 1 или выше

Верхняя граница числа токенов в ответе. Максимум — длина контекста минус длина промпта.

На прямом маршруте к новым моделям OpenAI max_tokens автоматически уходит как max_completion_tokens.

Max Completion Tokens

  • Ключ: max_completion_tokens
  • Опционально, integer, 1 или выше

То же ограничение длины ответа, что и max_tokens. Нужен новым моделям OpenAI, которые отклоняют устаревшее поле max_tokens.

Logit Bias

  • Ключ: logit_bias
  • Опционально, map

JSON-объект: id токена в токенизаторе → смещение от −100 до 100. Смещение прибавляется к логитам до выборки. Эффект зависит от модели: −1…1 слегка меняет вероятность, −100 / 100 обычно запрещает или принудительно выбирает токен.

Logprobs

  • Ключ: logprobs
  • Опционально, boolean

Вернуть логарифмические вероятности выходных токенов. Если true, в ответе будут logprobs каждого возвращённого токена.

Top Logprobs

  • Ключ: top_logprobs
  • Опционально, integer

Число от 0 до 20: сколько самых вероятных токенов вернуть на каждой позиции вместе с logprob. Требует logprobs: true.

Response Format

  • Ключ: response_format
  • Опционально, map

Заставляет модель ответить в заданном формате. { "type": "json_object" } включает JSON-режим: сообщение будет валидным JSON.

JSON-режим

Модель всё равно нужно попросить отвечать JSON — системным или пользовательским сообщением.

Строгая схема — { "type": "json_schema", "json_schema": { … } }. Подробнее — структурированный вывод.

Structured Outputs

  • Ключ: structured_outputs
  • Опционально, boolean

Может ли модель вернуть структурированный вывод через response_format с json_schema. Основной способ задать схему — само поле response_format.

Stop

  • Ключ: stop
  • Опционально, array (или строка)

Генерация останавливается, как только модель встречает любой токен из списка.

Tools

  • Ключ: tools
  • Опционально, array

Вызов инструментов в форме OpenAI. Для других провайдеров схема преобразуется. Сюда же кладётся серверный aitunnel:web_search. Подробнее — вызов инструментов и веб-поиск.

Tool Choice

  • Ключ: tool_choice
  • Опционально, string или object

Какой инструмент вызывать:

  • none — не вызывать, сразу ответить текстом
  • auto — модель сама решает: текст или один/несколько инструментов
  • required — обязан вызвать хотя бы один
  • {"type": "function", "function": {"name": "my_function"}} — вызвать конкретный

Parallel Tool Calls

  • Ключ: parallel_tool_calls
  • Опционально, boolean
  • По умолчанию: true

Разрешить несколько вызовов инструментов сразу. false — строго по одному. Имеет смысл, только если в запросе есть tools.

Include Reasoning

  • Ключ: include_reasoning
  • Опционально, boolean

Устаревший алиас. true = reasoning: {}, false = reasoning: { "exclude": true }. Лучше объект reasoning. Подробнее — токены рассуждений.

Reasoning

  • Ключ: reasoning
  • Опционально, map

Рассуждения у моделей с thinking-токенами: включить, задать effort / бюджет, скрыть цепочку из ответа. Подробнее — токены рассуждений.

Reasoning Effort

  • Ключ: reasoning_effort
  • Опционально, enum, xhigh, high, medium, low, minimal, none

Короткий вариант в стиле OpenAI. Выше — больше внутренних токенов рассуждения, если модель это умеет. Эквивалент reasoning.effort.

Web Search Options

  • Ключ: web_search_options
  • Опционально, map

Настройки встроенного поиска у моделей, которые ищут сами (без серверного инструмента). Для обычного поиска через AITUNNEL используйте tools: [{ "type": "aitunnel:web_search" }]. Подробнее — веб-поиск.

Verbosity

  • Ключ: verbosity
  • Опционально, enum, low, medium, high, xhigh, max
  • По умолчанию: medium

Краткость ответа. Ниже — короче, выше — подробнее. Появилось у OpenAI в Responses API; провайдер, который поле не понимает, его игнорирует.

Другие поля AITUNNEL

Это не сэмплинг, но часто рядом в том же теле запроса: