Оптимизация сообщений
Плагин context-compression укорачивает середину диалога, если промпт не влезает в контекст модели — запрос всё равно уходит. По умолчанию выключен.
Как работает
Когда сумма токенов больше окна модели, из середины промпта убираются или обрезаются сообщения, пока всё не влезет. Начало и конец диалога остаются: модели хуже помнят середину.
Иногда упираются не в токены, а в число сообщений. У Claude лимит — 1000. Тогда остаётся половина с начала и половина с конца.
Без плагина промпт длиннее контекста вернёт ошибку.
Работает в /chat/completions, /responses и /messages для моделей из каталога. На прямых маршрутах отдельных провайдеров плагин не применяется.
Как включить
В теле запроса:
{
"plugins": [{ "id": "context-compression" }]
}curl https://api.aitunnel.ru/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-aitunnel-xxx" \
-d '{
"model": "claude-sonnet-4.6",
"plugins": [{ "id": "context-compression" }],
"messages": [
{ "role": "user", "content": "Скажи интересный факт" }
]
}'Включайте для длинных диалогов, где можно укоротить середину истории. Чтобы явно выключить плагин в запросе, где он уже указан, передайте "enabled": false.
Другой плагин в том же массиве plugins — file-parser для PDF.