Возможности
Оптимизация сообщений
Если промпт не влезает в контекст модели, AITUNNEL укорачивает середину диалога — запрос всё равно уходит. Включено по умолчанию. Если нужна полная история без потерь — выключите.
Как работает
Когда сумма токенов больше окна модели, из середины промпта убираются или обрезаются сообщения, пока всё не влезет. Начало и конец диалога остаются: модели хуже помнят середину.
Иногда упираются не в токены, а в число сообщений. У Claude лимит — 1000. Тогда остаётся половина с начала и половина с конца.
Если сжатие выключено и промпт всё равно длиннее контекста — запрос вернёт ошибку.
Работает в /chat/completions, /responses и /messages для моделей из каталога. На прямых маршрутах отдельных провайдеров сжатие не применяется.
Как выключить
В теле запроса:
{
"plugins": [{ "id": "context-compression", "enabled": false }]
}curl https://api.aitunnel.ru/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-aitunnel-xxx" \
-d '{
"model": "claude-sonnet-4.5",
"plugins": [{ "id": "context-compression", "enabled": false }],
"messages": [
{ "role": "user", "content": "Скажи интересный факт" }
]
}'Официальные SDK не знают про plugins
Поле plugins не входит в стандарт OpenAI: в Python передавайте через extra_body, в TypeScript — с @ts-expect-error. На cURL и любых «сырых» HTTP-клиентах ограничений нет.
Выключайте, если важна полная история: длинный агентный прогон, точный разбор прошлого хода, любой случай, где потеря середины диалога недопустима.
Другой плагин в том же массиве plugins — file-parser для PDF.