Перейти к содержимому

Глоссарий

Термины, которые встречаются в документации, с объяснением по делу: что это, зачем нужно и что из этого следует на практике. Подробный разбор каждой темы по ссылке.

Waibee Router это шлюз к языковым моделям. Вы отправляете запрос на один адрес, в знакомом формате OpenAI или Anthropic, и получаете доступ ко всем моделям каталога по одному ключу. Не нужно заводить аккаунты у каждого вендора, следить за их лимитами и переписывать код под разные SDK. См. обзор роутера.

Waibee Code это наш агент для разработки. Работает в терминале, подключается к IDE и запускается из скриптов, читает и правит файлы, выполняет команды. Написан на Rust, модели получает через роутер. См. обзор агента.

Провайдер это компания, которая обучила и обслуживает модель: Anthropic, OpenAI, Google и другие. В идентификаторе модели провайдер стоит первым: anthropic/claude-sonnet-4.6.

Каталог это список моделей, доступных вашему ключу, с окнами контекста, ценами и возможностями каждой. Отдаётся запросом GET /v1/models и меняется со временем, поэтому идентификаторы стоит брать оттуда, а не выписывать в код навсегда. См. Модели.

Токен это единица, которой модель измеряет текст: примерно от одного символа до слова целиком. Разбиение зависит от модели, и русский текст обычно даёт больше токенов, чем английский такой же длины. Всё, что связано с ценой и лимитами, считается в токенах, а не в символах. См. Токены и usage.

Окно контекста (context_length в каталоге) это максимум токенов, который модель принимает за один запрос. В него входит всё: системная инструкция, вся история диалога, определения инструментов и вложенные файлы. Превышение это ошибка, а не молчаливое обрезание: запрос отклоняется.

Лимит вывода (max_completion_tokens в каталоге, поле max_tokens в запросе) это максимум токенов в одном ответе. Когда модель упирается в него, ответ обрывается на середине, а finish_reason приходит со значением length. Для структурированных ответов это особенно заметно: JSON остаётся незакрытым.

Usage это блок счётчиков в ответе: сколько токенов ушло на ввод, сколько на вывод, сколько прочитано из кэша. По нему считается стоимость запроса и по нему же видно, работает ли кэширование.

Компакт это сжатие истории диалога, когда окно контекста заканчивается. Агент делает это сам, а вручную запускается командой /compact. Смысл в том, чтобы сохранить суть разговора и освободить место, вместо того чтобы упереться в предел. См. Окно контекста.

Идентификатор модели записывается как <провайдер>/<модель>, например anthropic/claude-sonnet-4.6. На /v1/chat/completions короткое имя без провайдера отклоняется с 422, на /v1/messages короткие имена моделей Claude принимаются, потому что так их присылают SDK Anthropic.

Семейство моделей это линейка одного провайдера с общей архитектурой, внутри которой есть уровни: флагман для сложных задач, средняя модель на каждый день и быстрая для механической работы. Выбирать практичнее уровень, а не конкретную версию: версии сменяются часто. См. Выбор модели.

Autorouting это режим waibee/auto: вместо конкретной модели вы передаёте этот идентификатор, и роутер сам подбирает подходящую под запрос. В ответе поле model содержит ту модель, которая реально отработала, поэтому её стоит логировать. См. Autorouting.

Reasoning-модель обдумывает задачу перед тем, как начать отвечать. Эти размышления не попадают в текст ответа, но занимают время и тарифицируются как вывод. На сложной логике они заметно повышают точность, на простых задачах только удорожают запрос.

Effort (reasoning_effort в API, /effort в агенте) это уровень усилий на размышления: от none до xhigh, а на /v1/messages доступен ещё и max. Набор уровней зависит от модели. Правило простое: поднимать под конкретную сложную задачу, а не держать высоким постоянно. См. Reasoning.

Chat Completions это эндпоинт POST /v1/chat/completions в формате OpenAI. Самый распространённый вариант: под него написаны почти все SDK и инструменты.

Messages это эндпоинт POST /v1/messages в формате Anthropic. Его используют SDK Anthropic и Claude Code, и только здесь доступны специфичные для Claude вещи вроде уровня усилий max.

Responses это эндпоинт POST /v1/responses в формате Open Responses. Его понимает Codex CLI и OpenAI Agents SDK, а ответ там собирается не из сообщений, а из элементов: текст, вызов инструмента, рассуждение.

Промпт это то, что вы отправляете модели: инструкции, история диалога и данные. Системный промпт это отдельная инструкция про роль и правила поведения, которая идёт впереди диалога и обычно не меняется между запросами, поэтому её выгодно кэшировать.

Роль сообщения говорит модели, кто это сказал: user это человек, assistant это сама модель, system это инструкция, tool это результат вызова инструмента. Роутер не хранит историю: каждый запрос отправляется целиком, со всеми предыдущими сообщениями.

Стриминг это доставка ответа частями по мере генерации, через Server-Sent Events. Нужен там, где человек ждёт ответ на экране: первые слова появляются через секунду вместо ожидания всего текста. Счётчики токенов приходят в последнем кадре потока. См. Стриминг.

Tool calling (вызов инструментов, function calling) это способ дать модели доступ к вашему коду. Вы описываете функции, модель возвращает намерение вызвать одну из них с аргументами, выполняете её вы, а результат отправляете следующим запросом. Сама модель ничего не выполняет и в вашу систему не ходит. См. Вызов инструментов.

Structured outputs это ответ строго по JSON Schema вместо свободного текста. Убирает разбор текста регулярками, но гарантирует только форму: обязательные поля модель заполнит и там, где данных нет, поэтому смысловые проверки остаются на вашей стороне. См. Structured outputs.

Кэш префикса (prompt caching) это переиспользование неизменного начала запроса. Первый запрос платит за запись кэша, следующие с тем же началом читают его дешевле и быстрее. Работает, только если префикс совпадает полностью, поэтому всё меняющееся ставится после кэшируемого блока. См. Кэширование промптов.

finish_reason (на Messages stop_reason) объясняет, почему модель остановилась: stop это законченный ответ, tool_calls это просьба вызвать инструмент, length значит, что ответ упёрся в лимит вывода. Проверять его нужно всегда: без этого обрезанный ответ выглядит как нормальный.

Идемпотентность это свойство повтора не приводить ко второму результату. В публичном API роутера повторный запрос это новая генерация, за которую вы платите ещё раз, поэтому дедупликацию нужно вести на своей стороне.

DLP (data loss prevention) это проверка запроса на чувствительные данные: секреты, персональные данные. Умеет предупреждать, маскировать найденное или блокировать запрос целиком (403, код dlp_violation). Включается на конкретный запрос полем plugins.dlp, а если у API-ключа есть политика от администратора группы, работает и без него: настройки ключа задают минимальную строгость, а конфиг запроса может её только повысить. См. Плагины.

TUI это интерактивный интерфейс агента в терминале: диалог, слэш-команды, подсказки, панель с ходом работы.

Headless это запуск агента одной командой без интерфейса: waibee run "...". На вход промпт, на выход результат в stdout, поэтому агента можно вызывать из скриптов, git-хуков, CI и другого софта. См. Headless-режим.

Ход (turn) это один цикл работы: запрос к модели, вызовы инструментов, ответ. Ход заканчивается, когда управление возвращается вам.

Goal mode это условие завершения, которое вы задаёте командой /goal. Пока условие не выполнено, агент продолжает работать ход за ходом сам, а отдельная модель после каждого хода проверяет по разговору, достигнута ли цель. Полезно для длинной работы с проверяемым результатом, например «тесты и линтер проходят». См. Goal mode.

Режим подтверждений определяет, о чём агент спрашивает перед действием: от подтверждения каждой правки до полного доверия. Переключается на ходу. В headless-режиме агент работает в режиме доверия, потому что спрашивать некого. См. Права доступа.

Субагент это отдельный агент под узкую задачу, со своим контекстом и своей моделью. Полезен, чтобы не засорять основной разговор и чтобы рутина шла на дешёвой модели.

Навык (skill) это переиспользуемая инструкция в отдельном файле, которую агент подгружает, когда она нужна. Так знания про проект живут в репозитории, а не в чьей-то голове или в одноразовом промпте. См. Навыки и команды.

MCP (Model Context Protocol) это открытый протокол подключения внешних инструментов: базы, трекеры, браузер, внутренние сервисы. Агент получает их инструменты так же, как встроенные. См. MCP.

ACP (Agent Client Protocol) это протокол, по которому агент общается с клиентами: редакторами вроде Zed и JetBrains и терминальными клиентами. Благодаря ему один и тот же агент работает в разных интерфейсах. См. IDE (ACP).

Хук это ваш скрипт, который агент запускает на событии: перед вызовом инструмента, после правки файла, в конце сессии. Способ навязать агенту правила проекта автоматически, а не просьбой в промпте. См. Хуки.

LSP (Language Server Protocol) это то, чем IDE понимает код: точный переход к определению, список использований, ошибки компилятора. Агент пользуется теми же языковыми серверами, поэтому не угадывает по тексту, а спрашивает. См. Языковые серверы.