Skip to main content
Version: 1.15.0

Компактизация контекста

У каждого нексуса есть контекстное окно – ограничение на объем текста, который он может держать в памяти в рамках одной сессии. Ограничение задается как порог, который постоянно отслеживается во время диалога. Когда в длинном диалоге сообщения превышают лимит этого окна, ассистент выполняет компактизацию беседы, чтобы она могла продолжаться дальше без потери смысла.

Компактизация происходит автоматически. Во время этого процесса в чате отображается соответствующее сообщение.

Настройка компактизации


Настройка выполняется на вкладке Компактизация формы ассистента.

tip

При создании нового ассистента все поля вкладки уже будут заполнены значениями по умолчанию, которые подходят для большинства ассистентов. Обычно достаточно проверить Нексус компактизации и оставить остальное без изменений.

Рекомендуем изменять расширенные параметры, только если вы знаете, на что они влияют.

Основные параметры

ПолеОбязательноОписание
Нексус компактизацииДаУкажите нексус, который составляет краткое содержание при сворачивании диалога.
Порог компактизацииДаУкажите, насколько заполненным должно стать контекстное окно, чтобы запустить компактизацию. Например, значение 0,80 соответствует заполнению на 80 %.
Отключить ИИ-саммаризациюНетУстановите флажок, чтобы составлять краткое содержание упрощенным способом без использования ИИ. В этом случае система продолжает учитывать пользовательские запросы, действия ассистента, результаты инструментов и ошибки, но формирование краткого содержания происходит алгоритмически по шаблонной структуре. По умолчанию флажок снят.

Установите флажок, чтобы отключить создание краткого содержания с помощью нексуса и использовать упрощенный способ. По умолчанию каждое сообщение сокращается до 700 символов, а итоговое краткое содержание — до 8000 символов.

Расширенные параметры

Установите флажок Дополнительно, чтобы открыть поля дополнительной настройки компактизации. Используя эти параметры вы сможете определить, какую часть диалога сохранять дословно, какую сворачивать, а также насколько объемным делать краткое содержание.

ПолеОбязательноеОписание
Размер контекста (токены)ДаУкажите размер контекстного окна в токенах для выбранного нексуса. На основании этого значения будет определен порог.
Мин. длина контекста (токены)ДаУкажите значение в токенах, до превышения которого компактизация не производится.
Резерв токенов на ответДаУкажите количество токенов, может быть отведено для ответа ассистента.
Служебные токены платформыДаУкажите количество токенов, которые могут быть потрачены на служебные нужды платформы.
Минимум сообщений в хвостеДаУкажите минимальное число последних сообщений, которые всегда сохраняются дословно.
Верхний предел минимального хвостаДаУкажите максимальное число последних сообщений, которые всегда сохраняются дословно.
Доля бюджета на хвостДаОпределите доступный объем для последних сообщений.
Защитить первые NДаУкажите, сколько первых сообщений диалога всегда должны быть развернуты.
Макс. доля токенов резюмеДаУкажите максимальную долю объема, которую может занять краткое содержание.
Мин. токенов резюмеДаУкажите минимальный размер краткого содержания в токенах.
Потолок токенов резюмеДаУкажите максимальный размер краткого содержания.
Макс. символов фоллбэк-резюмеДаУстановите ограничение на максимальное количество символов в упрощенном кратком содержании, то есть созданном без обращения к нексусу.
Макс. символов на сообщение в фоллбэк-резюмеДаУстановите ограничение на длину одного сообщения в упрощенном кратком содержании.
Начало аргументов инструментаДаУкажите, какую часть аргументов вызова инструмента сохранять.
Длина усечения результата инструментаДаЗадайте длину старых результатов работы инструментов, которая будет сохранена.

Принцип работы


  1. Ассистент отслеживает объем диалога и сравнивает его с установленным порогом.
  2. При превышении порога старые сообщения (кроме защищенных первых и последних) сворачиваются в краткое содержание.
  3. Последние сообщения сохраняются дословно, чтобы беседа продолжалась без разрывов.
  4. Краткое содержание подставляется в начало диалога вместо свернутых сообщений.

Таким образом беседа продолжается сколько необходимо, а ассистент помнит ее смысл.