Оптимизация сообщений

Плагин context-compression укорачивает середину диалога, если промпт не влезает в контекст модели — запрос всё равно уходит. По умолчанию выключен.

Как работает

Когда сумма токенов больше окна модели, из середины промпта убираются или обрезаются сообщения, пока всё не влезет. Начало и конец диалога остаются: модели хуже помнят середину.

Иногда упираются не в токены, а в число сообщений. У Claude лимит — 1000. Тогда остаётся половина с начала и половина с конца.

Без плагина промпт длиннее контекста вернёт ошибку.

Работает в /chat/completions, /responses и /messages для моделей из каталога. На прямых маршрутах отдельных провайдеров плагин не применяется.

Как включить

В теле запроса:

JSON
{
  "plugins": [{ "id": "context-compression" }]
}
curl https://api.aitunnel.ru/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-aitunnel-xxx" \
  -d '{
    "model": "claude-sonnet-4.6",
    "plugins": [{ "id": "context-compression" }],
    "messages": [
      { "role": "user", "content": "Скажи интересный факт" }
    ]
  }'

Включайте для длинных диалогов, где можно укоротить середину истории. Чтобы явно выключить плагин в запросе, где он уже указан, передайте "enabled": false.

Другой плагин в том же массиве plugins — file-parser для PDF.