IO LABИсследовательская программа
ENRU
← Все направленияWORKING PAPER / 001
IO / SYSTEMv0.2 · 08 SEP 2026Рабочая редакция · без рецензирования

Cognitive Autopilot

Независимая от модели среда исполнения для проверяемых действий

00 / АННОТАЦИЯ

Единица успеха — проверенное изменение мира.

Cognitive Autopilot рассматривает интеллект как результат управляемой системы, а не свойство одной модели. Он принимает цель, поддерживает явное состояние задачи, собирает рабочий контекст для роли, ограничивает действие и проверяет свидетельства перед продолжением. Базовые модели остаются заменяемыми компонентами внутри устойчивого контракта «цель → результат».

Рабочая статья описывает контур управления, границы контекста и полномочий, семантику восстановления и дизайн оценки выигрыша от оркестрации. Внутренние проверки без вызовов провайдера поддерживают отдельные механические контракты. Они не устанавливают улучшения рассуждений, успеха реальных задач или равенства более сильной модели. Основной вклад — проверяемый дизайн системы.

Вклад этой редакции

  1. Контракт «цель → результат» с явным состоянием и обязательствами приёмки.
  2. Ограниченный вызов, разделяющий контекст, решение модели, полномочия и наблюдаемый эффект.
  3. Парный протокол оценки, отличающий реальный успех от ложного принятия.
СХЕМА 01 · МЕХАНИЗМКонцептуальная схема
Цикл исполнения и проверки Cognitive AutopilotЦель интерпретируется, собирается контекстная капсула, действие выполняется в разрешённых границах, а свидетельства возвращаются в редуктор состояния. Продолжением управляет проверка; сообщение модели о завершении само по себе не является приёмкой. 01Цель02Мышление03Контекст04Действие05Проверка
Цель интерпретируется, собирается контекстная капсула, действие выполняется в разрешённых границах, а свидетельства возвращаются в редуктор состояния. Продолжением управляет проверка; сообщение модели о завершении само по себе не является приёмкой.
  1. 01

    Зафиксировать критерии, бюджет и права.

  2. 02

    Выбрать следующий проверяемый шаг.

  3. 03

    Собрать капсулу под конкретную роль.

  4. 04

    Выполнить и записать изменение мира.

  5. 05

    Принять, исправить, перепланировать или остановить.

01 / ПРОБЛЕМА

Сильная модель может получить слабую рабочую среду.

В длинной задаче цель, свидетельства, полномочия и оставшаяся работа меняются с разной скоростью. Переписка смешивает их с гипотезами, устаревшими наблюдениями и промежуточными результатами. Если каждый вызов восстанавливает всю задачу заново, ошибка состояния выглядит как ошибка рассуждения.

Например, агент разработки сообщает об успехе после нормального завершения команды, хотя нужный артефакт не появился. Или полезный артефакт уже существует, но итоговое резюме заявляет неудачу. Среде исполнения нужен явный ответ: что требовалось, что изменилось и какие наблюдения подтверждают завершение.

02 / ГИПОТЕЗА

Измерить вклад окружающей системы.

Экспериментальная гипотеза: явное управление, скомпилированный контекст и независимые проверки улучшают принимаемые результаты фиксированной модели в общем ресурсном бюджете. Контрфактический контроль — та же модель, задача, инструменты и бюджет без предлагаемой оркестрации.

ΔQ = (1 / N) Σᵢ [Yᵢ(Autopilot) − Yᵢ(direct)](1)
Парная разница результатов. Y — независимо оценённый успех задачи, не собственный вердикт среды. Набор задач, бюджеты, настройки модели и правила остановки фиксируются до оценки.

03 / АРХИТЕКТУРА

Одно каноническое состояние. Временные роли.

TaskState хранит интерпретированную цель, критерии приёмки, план, вехи, ссылки на свидетельства, бюджеты и статус. Детерминированный редуктор — единственный компонент, фиксирующий переход. Модели предлагают структурированные действия и оценки, а не незаметно переписывают каноническое состояние.

Роли задают обязанности, а не постоянные процессы. Простая задача может потребовать один вызов Thinker, один Doer и проверку. Дополнительные роли оправданы конкретной неоднозначностью или пробелом в свидетельствах.

Таблица 1. Ответственность и полномочия
КомпонентОбязанностьГраница
Thinker / NavigatorИнтерпретировать цель, выбрать шаг, пересмотреть план после вехи.Предлагает KEEP, PATCH, REPLAN или решение пользователя, но не создаёт полномочия.
Context EngineНайти кандидатов, точно прочитать источники, собрать представление для роли.Результат поиска — указатель, не каноническое свидетельство.
Doer + HarnessВыполнить ограниченное действие и зафиксировать эффект.Инструменты ограничены явным разрешением и возможностями среды.
VerifierОценить критерии по свидетельствам и классифицировать ошибку.Самоотчёт не заменяет независимого наблюдения.
Reducer / Goal GateФиксировать допустимые переходы и завершение всей цели.Выполненный шаг не означает выполнения всех обязательств.

04 / МОДЕЛЬ

Капсула — контракт одного вызова.

Kₜ = (gₜ, rₜ, cₜ, mₜ, Aₜ, bₜ, oₜ, vₜ)(2)
Поля капсулы: часть цели g, роль r, контекст c, модель/сессия m, разрешённые действия A, бюджет b, схема вывода o и правило проверки v. Кортеж описывает систему.
Sₜ₊₁ = Reduce(Sₜ, eventₜ, receiptₜ)(3)
Переход принимается при выполненных предусловиях, проверенных ссылках и полномочиях. Недопустимое или неполное событие оставляет обязательство завершения открытым.

Каждый обязательный критерий получает pass, fail или unknown. Unknown — не смягчённый успех, а недостаток наблюдения. Нарушенный критерий отклоняет шаг; неизвестный не позволяет завершить его. Приёмка также требует действительных полномочий и целостности свидетельств.

Это различие важно при частичных данных. Модульный тест может пройти, когда реальная проверка сервиса недоступна. Артефакт сохраняется, но незакрытое обязательство остаётся видимым, а не превращается в уверенность.

СХЕМА 02 · ПРОВЕРКАУчебный пример

Когда шаг можно принять?

Переключайте критерии. «Неизвестно» сохраняет вопрос открытым. Это демонстрация логики принятия, не оценка реальной модели.

НЕ ЗАВЕРШЕНО · нужен результат проверки

05 / КОМПИЛЯЦИЯ КОНТЕКСТА

Минимальное представление должно оставаться достаточным.

Компилятор начинает со следующего критерия приёмки и роли, затем получает нужные наблюдения из разрешённых источников. Он фиксирует источник, редакцию или время, область извлечения и причину включения. Резюме и индексы помогают найти материал; критические утверждения требуют точного чтения.

Капсула содержит цель, ограничения, состояние, факты с источниками, инструменты, одну директиву и контракт вывода. Противоречивые источники сохраняются как конфликт до разрешения. Сжатие, удаляющее конфликт, — семантическая ошибка независимо от экономии токенов.

Таблица 2. Контекст для разных ролей
РольМинимально полезное представлениеОбычно исключается
ThinkerЦель, критерии, текущий план, препятствия и возможности.Полные логи инструментов, не влияющие на решение.
DoerОдно действие, точные объекты, исходники и разрешение.Спекулятивные планы других ролей, не влияющие на действие.
VerifierИсходные критерии, артефакт, квитанции и наблюдаемое изменение.Убедительные заявления об успехе без подтверждения.

Минимальность — цель оптимизации, а не вывод из короткого запроса. Нужна абляция: удалить или добавить контекст в фиксированном бюджете и проверить изменение независимо оценённых результатов.

06 / ИСПОЛНЕНИЕ И ВОССТАНОВЛЕНИЕ

Сначала наблюдать эффект, затем решать о повторе.

Harness вычисляет действующие полномочия как пересечение пользовательского разрешения, политики задачи и возможностей среды. Сгенерированный план не расширяет это пересечение. Результат действия — квитанция, связанная с вызовом и наблюдаемым изменением, а не произвольный рассказ об успехе.

До внешнего побочного эффекта фиксируется намерение. После действия записываются доступные квитанции и переход. При сбое между эффектом и контрольной точкой восстановление сначала проверяет, было ли действие выполнено. Слепой повтор опасен для неидемпотентной операции.

Журнал может обеспечивать детерминированное воспроизведение переходов. Это слабее однократного исполнения во внешней системе: сервису нужен ключ идемпотентности или надёжная сверка. Если внешнее состояние не удаётся установить, система останавливается с явным unknown.

08 / ГРАНИЦЫ СВИДЕТЕЛЬСТВ

Проверки механики уже, чем качество модели.

Таблица 3. Внутренние свидетельства из рабочей редакции июля 2026
СвидетельствоПоддерживаемая областьОткрытая область
Проверки без провайдераРедуктор, контрольные точки, воспроизведение и отдельные окна восстановления.Качество планов и реальные внешние эффекты.
Контекст и полномочияПредставления ролей, точное чтение, разрешения и квитанции.Оптимальный поиск, противодействие атакам и полнота реальных инструментов.
Граница хостаСтруктурированный вывод, сессии, запрет по умолчанию и проверка после вызова.Реальное качество провайдера, итоговый успех и выгода маршрутизации.

Это датированные внутренние проверки, а не новый аудит работающей системы. Исходный репозиторий приватный. Поэтому перед нами рабочая статья, а не публично воспроизводимый технический отчёт. Исправленный сквозной запуск Autopilot и сравнительные вызовы реальных моделей оставались открыты в этой фиксации свидетельств.

09 / СЛЕДУЮЩИЙ ЭКСПЕРИМЕНТ

Парное сравнение с независимым оценщиком.

Сначала одна замороженная задача разработки проверяет протокол, затем отложенный набор достаточного размера позволяет оценить полезный эффект. Условия получают изолированные копии одной рабочей среды, одинаковые критерии, инструменты и общий ресурсный лимит. Все вызовы Thinker, Doer, проверки и исправления входят в стоимость Autopilot.

Порядок условий рандомизируется; фиксируются версии моделей, доступные seed, остановки и исключения. Оценщик изучает артефакты без знания условия. Где возможно, используются исполняемые критерии; в остальном — заранее написанная рубрика.

Таблица 4. Метрики с явным знаменателем
МетрикаОпределение
Успех задачиНезависимо принятые задачи / все назначенные задачи. Unknown публикуется отдельно.
Ложное принятиеНеверные задачи, объявленные завершёнными / все объявленные завершёнными. При нуле завершений не определено; публикуется также число случаев.
Исправления человекаДополнительные вмешательства и время доведения результата.
Накладные расходыПолная стоимость, время и ресурсы, включая проверки и неудачные попытки.
Парный выигрышРазница успеха внутри одной задачи с интервалом неопределённости на уровне задач.

Компиляция контекста, планирование вех и независимая проверка удаляются по отдельности. Повторные запуски одной задачи не считаются независимыми задачами. Порог практически полезного эффекта фиксируется до оценки: одной точечной оценки недостаточно для допуска.

10 / ОГРАНИЧЕНИЯ

Центральное утверждение ещё требует проверки.

  • Эта редакция не устанавливает реальный выигрыш от оркестрации.
  • Одна модель может давать коррелированные ошибки в ролях Doer и Verifier; разделение ролей не гарантирует статистической независимости.
  • Неполная наблюдаемость и слабые критерии ограничивают Goal Gate.
  • Управление добавляет задержку, стоимость и новые способы отказа.
  • Инъекции инструкций, враждебные инструменты и распределённые эффекты требуют отдельных испытаний.
  • ≥90% качества frontier-моделей — цель для определённой системы и распределения задач, не измеренный результат.

Свежие знания, полномочия, проверки и восстановление остаются внешними функциями даже после обучения лучшей политики действий. Полезная среда должна работать без роя и модели-учителя.

ИСТОЧНИКИ

Библиография и научный контекст

Эти работы задают научный контекст и методы сравнения. Их результаты не являются экспериментальным подтверждением гипотез IO Lab.

  1. Yao, S. et al.ReAct: Synergizing Reasoning and Acting in Language Models 2023 · ICLR
  2. Shinn, N. et al.Reflexion: Language Agents with Verbal Reinforcement Learning 2023 · arXiv preprint
  3. Lewis, P. et al.Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks 2020 · NeurIPS

СОСЛАТЬСЯ НА РАБОТУ

Цитирование и редакция

Версия 0.2 расширяет архитектуру, обозначения, семантику ошибок и протокол оценки. Границы свидетельств июля 2026 сохранены; новый результат качества реальных моделей не заявлен.

IO Lab. “Cognitive Autopilot: A Model-Agnostic Runtime for Verified Action.” IO Lab Working Paper 001, version 0.2, September 8, 2026. https://io-lab.nglain.com/ru/works/cognitive-autopilot
BibTeX
@techreport{iolab2026autopilot,
  author = {{IO Lab}},
  title = {Cognitive Autopilot: A Model-Agnostic Runtime for Verified Action},
  institution = {IO Lab},
  type = {Working Paper},
  number = {001},
  year = {2026},
  month = {September},
  note = {Version 0.2; not peer reviewed},
  url = {https://io-lab.nglain.com/ru/works/cognitive-autopilot}
}

Доступность: полный текст этой редакции открыт. Внутренний репозиторий, исходные трассы и наборы данных не опубликованы. DOI не присвоен.