Возможности

Оптимизация сообщений

Если промпт не влезает в контекст модели, AITUNNEL укорачивает середину диалога — запрос всё равно уходит. Включено по умолчанию. Если нужна полная история без потерь — выключите.

Как работает

Когда сумма токенов больше окна модели, из середины промпта убираются или обрезаются сообщения, пока всё не влезет. Начало и конец диалога остаются: модели хуже помнят середину.

Иногда упираются не в токены, а в число сообщений. У Claude лимит — 1000. Тогда остаётся половина с начала и половина с конца.

Если сжатие выключено и промпт всё равно длиннее контекста — запрос вернёт ошибку.

Работает в /chat/completions, /responses и /messages для моделей из каталога. На прямых маршрутах отдельных провайдеров сжатие не применяется.

Как выключить

В теле запроса:

JSON
{
  "plugins": [{ "id": "context-compression", "enabled": false }]
}
curl https://api.aitunnel.ru/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-aitunnel-xxx" \
  -d '{
    "model": "claude-sonnet-4.5",
    "plugins": [{ "id": "context-compression", "enabled": false }],
    "messages": [
      { "role": "user", "content": "Скажи интересный факт" }
    ]
  }'

Официальные SDK не знают про plugins

Поле plugins не входит в стандарт OpenAI: в Python передавайте через extra_body, в TypeScript — с @ts-expect-error. На cURL и любых «сырых» HTTP-клиентах ограничений нет.

Выключайте, если важна полная история: длинный агентный прогон, точный разбор прошлого хода, любой случай, где потеря середины диалога недопустима.

Другой плагин в том же массиве plugins file-parser для PDF.