Cognitive Autopilot
Независимая от модели среда исполнения для проверяемых действий
00 / АННОТАЦИЯ
Единица успеха — проверенное изменение мира.
Cognitive Autopilot рассматривает интеллект как результат управляемой системы, а не свойство одной модели. Он принимает цель, поддерживает явное состояние задачи, собирает рабочий контекст для роли, ограничивает действие и проверяет свидетельства перед продолжением. Базовые модели остаются заменяемыми компонентами внутри устойчивого контракта «цель → результат».
Рабочая статья описывает контур управления, границы контекста и полномочий, семантику восстановления и дизайн оценки выигрыша от оркестрации. Внутренние проверки без вызовов провайдера поддерживают отдельные механические контракты. Они не устанавливают улучшения рассуждений, успеха реальных задач или равенства более сильной модели. Основной вклад — проверяемый дизайн системы.
Вклад этой редакции
- Контракт «цель → результат» с явным состоянием и обязательствами приёмки.
- Ограниченный вызов, разделяющий контекст, решение модели, полномочия и наблюдаемый эффект.
- Парный протокол оценки, отличающий реальный успех от ложного принятия.
- 01
Зафиксировать критерии, бюджет и права.
- 02
Выбрать следующий проверяемый шаг.
- 03
Собрать капсулу под конкретную роль.
- 04
Выполнить и записать изменение мира.
- 05
Принять, исправить, перепланировать или остановить.
01 / ПРОБЛЕМА
Сильная модель может получить слабую рабочую среду.
В длинной задаче цель, свидетельства, полномочия и оставшаяся работа меняются с разной скоростью. Переписка смешивает их с гипотезами, устаревшими наблюдениями и промежуточными результатами. Если каждый вызов восстанавливает всю задачу заново, ошибка состояния выглядит как ошибка рассуждения.
Например, агент разработки сообщает об успехе после нормального завершения команды, хотя нужный артефакт не появился. Или полезный артефакт уже существует, но итоговое резюме заявляет неудачу. Среде исполнения нужен явный ответ: что требовалось, что изменилось и какие наблюдения подтверждают завершение.
02 / ГИПОТЕЗА
Измерить вклад окружающей системы.
Экспериментальная гипотеза: явное управление, скомпилированный контекст и независимые проверки улучшают принимаемые результаты фиксированной модели в общем ресурсном бюджете. Контрфактический контроль — та же модель, задача, инструменты и бюджет без предлагаемой оркестрации.
ΔQ = (1 / N) Σᵢ [Yᵢ(Autopilot) − Yᵢ(direct)](1)03 / АРХИТЕКТУРА
Одно каноническое состояние. Временные роли.
TaskState хранит интерпретированную цель, критерии приёмки, план, вехи, ссылки на свидетельства, бюджеты и статус. Детерминированный редуктор — единственный компонент, фиксирующий переход. Модели предлагают структурированные действия и оценки, а не незаметно переписывают каноническое состояние.
Роли задают обязанности, а не постоянные процессы. Простая задача может потребовать один вызов Thinker, один Doer и проверку. Дополнительные роли оправданы конкретной неоднозначностью или пробелом в свидетельствах.
| Компонент | Обязанность | Граница |
|---|---|---|
| Thinker / Navigator | Интерпретировать цель, выбрать шаг, пересмотреть план после вехи. | Предлагает KEEP, PATCH, REPLAN или решение пользователя, но не создаёт полномочия. |
| Context Engine | Найти кандидатов, точно прочитать источники, собрать представление для роли. | Результат поиска — указатель, не каноническое свидетельство. |
| Doer + Harness | Выполнить ограниченное действие и зафиксировать эффект. | Инструменты ограничены явным разрешением и возможностями среды. |
| Verifier | Оценить критерии по свидетельствам и классифицировать ошибку. | Самоотчёт не заменяет независимого наблюдения. |
| Reducer / Goal Gate | Фиксировать допустимые переходы и завершение всей цели. | Выполненный шаг не означает выполнения всех обязательств. |
04 / МОДЕЛЬ
Капсула — контракт одного вызова.
Kₜ = (gₜ, rₜ, cₜ, mₜ, Aₜ, bₜ, oₜ, vₜ)(2)Sₜ₊₁ = Reduce(Sₜ, eventₜ, receiptₜ)(3)Каждый обязательный критерий получает pass, fail или unknown. Unknown — не смягчённый успех, а недостаток наблюдения. Нарушенный критерий отклоняет шаг; неизвестный не позволяет завершить его. Приёмка также требует действительных полномочий и целостности свидетельств.
Это различие важно при частичных данных. Модульный тест может пройти, когда реальная проверка сервиса недоступна. Артефакт сохраняется, но незакрытое обязательство остаётся видимым, а не превращается в уверенность.
Когда шаг можно принять?
Переключайте критерии. «Неизвестно» сохраняет вопрос открытым. Это демонстрация логики принятия, не оценка реальной модели.
05 / КОМПИЛЯЦИЯ КОНТЕКСТА
Минимальное представление должно оставаться достаточным.
Компилятор начинает со следующего критерия приёмки и роли, затем получает нужные наблюдения из разрешённых источников. Он фиксирует источник, редакцию или время, область извлечения и причину включения. Резюме и индексы помогают найти материал; критические утверждения требуют точного чтения.
Капсула содержит цель, ограничения, состояние, факты с источниками, инструменты, одну директиву и контракт вывода. Противоречивые источники сохраняются как конфликт до разрешения. Сжатие, удаляющее конфликт, — семантическая ошибка независимо от экономии токенов.
| Роль | Минимально полезное представление | Обычно исключается |
|---|---|---|
| Thinker | Цель, критерии, текущий план, препятствия и возможности. | Полные логи инструментов, не влияющие на решение. |
| Doer | Одно действие, точные объекты, исходники и разрешение. | Спекулятивные планы других ролей, не влияющие на действие. |
| Verifier | Исходные критерии, артефакт, квитанции и наблюдаемое изменение. | Убедительные заявления об успехе без подтверждения. |
Минимальность — цель оптимизации, а не вывод из короткого запроса. Нужна абляция: удалить или добавить контекст в фиксированном бюджете и проверить изменение независимо оценённых результатов.
06 / ИСПОЛНЕНИЕ И ВОССТАНОВЛЕНИЕ
Сначала наблюдать эффект, затем решать о повторе.
Harness вычисляет действующие полномочия как пересечение пользовательского разрешения, политики задачи и возможностей среды. Сгенерированный план не расширяет это пересечение. Результат действия — квитанция, связанная с вызовом и наблюдаемым изменением, а не произвольный рассказ об успехе.
До внешнего побочного эффекта фиксируется намерение. После действия записываются доступные квитанции и переход. При сбое между эффектом и контрольной точкой восстановление сначала проверяет, было ли действие выполнено. Слепой повтор опасен для неидемпотентной операции.
Журнал может обеспечивать детерминированное воспроизведение переходов. Это слабее однократного исполнения во внешней системе: сервису нужен ключ идемпотентности или надёжная сверка. Если внешнее состояние не удаётся установить, система останавливается с явным unknown.
08 / ГРАНИЦЫ СВИДЕТЕЛЬСТВ
Проверки механики уже, чем качество модели.
| Свидетельство | Поддерживаемая область | Открытая область |
|---|---|---|
| Проверки без провайдера | Редуктор, контрольные точки, воспроизведение и отдельные окна восстановления. | Качество планов и реальные внешние эффекты. |
| Контекст и полномочия | Представления ролей, точное чтение, разрешения и квитанции. | Оптимальный поиск, противодействие атакам и полнота реальных инструментов. |
| Граница хоста | Структурированный вывод, сессии, запрет по умолчанию и проверка после вызова. | Реальное качество провайдера, итоговый успех и выгода маршрутизации. |
Это датированные внутренние проверки, а не новый аудит работающей системы. Исходный репозиторий приватный. Поэтому перед нами рабочая статья, а не публично воспроизводимый технический отчёт. Исправленный сквозной запуск Autopilot и сравнительные вызовы реальных моделей оставались открыты в этой фиксации свидетельств.
09 / СЛЕДУЮЩИЙ ЭКСПЕРИМЕНТ
Парное сравнение с независимым оценщиком.
Сначала одна замороженная задача разработки проверяет протокол, затем отложенный набор достаточного размера позволяет оценить полезный эффект. Условия получают изолированные копии одной рабочей среды, одинаковые критерии, инструменты и общий ресурсный лимит. Все вызовы Thinker, Doer, проверки и исправления входят в стоимость Autopilot.
Порядок условий рандомизируется; фиксируются версии моделей, доступные seed, остановки и исключения. Оценщик изучает артефакты без знания условия. Где возможно, используются исполняемые критерии; в остальном — заранее написанная рубрика.
| Метрика | Определение |
|---|---|
| Успех задачи | Независимо принятые задачи / все назначенные задачи. Unknown публикуется отдельно. |
| Ложное принятие | Неверные задачи, объявленные завершёнными / все объявленные завершёнными. При нуле завершений не определено; публикуется также число случаев. |
| Исправления человека | Дополнительные вмешательства и время доведения результата. |
| Накладные расходы | Полная стоимость, время и ресурсы, включая проверки и неудачные попытки. |
| Парный выигрыш | Разница успеха внутри одной задачи с интервалом неопределённости на уровне задач. |
Компиляция контекста, планирование вех и независимая проверка удаляются по отдельности. Повторные запуски одной задачи не считаются независимыми задачами. Порог практически полезного эффекта фиксируется до оценки: одной точечной оценки недостаточно для допуска.
10 / ОГРАНИЧЕНИЯ
Центральное утверждение ещё требует проверки.
- Эта редакция не устанавливает реальный выигрыш от оркестрации.
- Одна модель может давать коррелированные ошибки в ролях Doer и Verifier; разделение ролей не гарантирует статистической независимости.
- Неполная наблюдаемость и слабые критерии ограничивают Goal Gate.
- Управление добавляет задержку, стоимость и новые способы отказа.
- Инъекции инструкций, враждебные инструменты и распределённые эффекты требуют отдельных испытаний.
- ≥90% качества frontier-моделей — цель для определённой системы и распределения задач, не измеренный результат.
Свежие знания, полномочия, проверки и восстановление остаются внешними функциями даже после обучения лучшей политики действий. Полезная среда должна работать без роя и модели-учителя.
ИСТОЧНИКИ
Библиография и научный контекст
Эти работы задают научный контекст и методы сравнения. Их результаты не являются экспериментальным подтверждением гипотез IO Lab.
- Yao, S. et al.ReAct: Synergizing Reasoning and Acting in Language Models 2023 · ICLR
- Shinn, N. et al.Reflexion: Language Agents with Verbal Reinforcement Learning 2023 · arXiv preprint
- Lewis, P. et al.Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks 2020 · NeurIPS
СОСЛАТЬСЯ НА РАБОТУ
Цитирование и редакция
Версия 0.2 расширяет архитектуру, обозначения, семантику ошибок и протокол оценки. Границы свидетельств июля 2026 сохранены; новый результат качества реальных моделей не заявлен.
IO Lab. “Cognitive Autopilot: A Model-Agnostic Runtime for Verified Action.” IO Lab Working Paper 001, version 0.2, September 8, 2026. https://io-lab.nglain.com/ru/works/cognitive-autopilot
BibTeX
@techreport{iolab2026autopilot,
author = {{IO Lab}},
title = {Cognitive Autopilot: A Model-Agnostic Runtime for Verified Action},
institution = {IO Lab},
type = {Working Paper},
number = {001},
year = {2026},
month = {September},
note = {Version 0.2; not peer reviewed},
url = {https://io-lab.nglain.com/ru/works/cognitive-autopilot}
}Доступность: полный текст этой редакции открыт. Внутренний репозиторий, исходные трассы и наборы данных не опубликованы. DOI не присвоен.