IO LABИсследовательская программа
ENRU
← Все направленияWORKING PAPER / 003
IO / LEARNINGv0.1 · 08 SEP 2026Рабочая редакция · без рецензирования

Distillation & Local Models

Обучение на проверенных действиях с сохранением внешнего управления

00 / АННОТАЦИЯ

Единица обучения — эпизод с установленным вкладом.

Долгосрочная программа IO Lab исследует, какие повторяемые способы поведения эффективной агентной системы можно перенести в локально обслуживаемую модель. Предлагаемая единица обучения связывает состояние задачи, контекст, решение, действие, наблюдаемый результат и оценку. Сырая переписка смешивает полезные политики со случайным успехом, непроверенными заявлениями и чувствительными данными.

Работа задаёт контракт эпизода, границы отбора, целевую функцию обучения и протокол допуска. Поведение, которое способны усвоить веса, отделяется от свежих знаний, полномочий, инструментов и восстановления, остающихся вне модели. Обученная модель IO Lab, открытый набор данных и результат равенства frontier-моделям здесь не представлены.

Вклад этой редакции

  1. Схема эпизода, связывающая поведение модели с наблюдаемым результатом и происхождением данных.
  2. Отбор, отличающий допустимость обучения от успеха задачи.
  3. Допуск по отложенному качеству, ложному принятию, приватности и ограничениям обслуживания.
СХЕМА 01 · МЕХАНИЗМКонцептуальная схема
Конвейер дистилляции проверенных эпизодовНаблюдаемые эпизоды проходят отбор перед обучением. Замороженная отложенная оценка решает вопрос допуска кандидата к локальному обслуживанию. Отклонённый кандидат не меняет активную модель; управляющая среда сохраняется. 01Эпизод02Отбор03Обучение04Оценка05Допуск
Наблюдаемые эпизоды проходят отбор перед обучением. Замороженная отложенная оценка решает вопрос допуска кандидата к локальному обслуживанию. Отклонённый кандидат не меняет активную модель; управляющая среда сохраняется.
  1. 01

    Записать состояние, действие и свидетельства.

  2. 02

    Проверить права, происхождение и качество.

  3. 03

    Обучить объявленному поведению.

  4. 04

    Проверить на изолированных задачах.

  5. 05

    Выпустить в пределах пройденных условий.

01 / ПРОБЛЕМА

Успешная переписка может преподать неверный урок.

Задача может завершиться, потому что инструмент исправил ошибку модели, человек отредактировал результат или среда случайно соответствовала необоснованному предположению. Подражание всей переписке кодирует эти ошибки вместе с полезным поведением. Эпизод должен различать решение модели, помощь среды и свидетельства результата.

Вопрос внедрения также конкретен. Локальная модель может сократить внешние вызовы на повторяемых задачах, но её полезность определяется сквозным качеством и ограничениями обслуживания. Одно число параметров этого не устанавливает.

02 / ГИПОТЕЗА

Усвоить повторяемые решения, сохранить внешнюю проверку.

Кандидаты: выбор релевантного контекста, корректная схема действия, существенное уточнение и исправление конкретного отказа. Свежие факты, изменяющиеся права и внешнее состояние остаются входами среды. Модель не обучается обходить проверку или выводить полномочия из успешного прецедента.

03 / КОНТРАКТ ЭПИЗОДА

Чему именно обучается модель?

Таблица 1. Минимальные поля эпизода
ПолеНазначение
Задача и критерийЗафиксировать успех до действия.
Состояние и контекстНаблюдения, редакции источников и разрешённая область.
Решение и действиеНаблюдаемый выбор плана, вызов инструмента или структурированный ответ.
Квитанция и изменениеФактический эффект, связанный с вызовом.
ОценкаPass, fail или unknown для каждого критерия с оценщиком и правилом.
АтрибуцияВмешательство учителя, исправление человека и помощь среды.
ДопустимостьПрава на данные, приватность, очистка и разрешённые способы использования.

Используются наблюдаемые трассы действий, краткие объяснения решений и свидетельства оценки. Скрытые рассуждения модели не требуются и не предполагаются доступными. Неудачные и неопределённые эпизоды сохраняются с метками: они полезны для оценки или отдельной задачи предпочтений, но не становятся автоматически положительными примерами.

04 / МОДЕЛЬ

Сначала цель обучения, затем рецепт.

D₊ = {e : eligible(e) ∧ verified(e) ∧ attributable(e)}(1)
Предлагаемое множество положительных примеров. Каждый предикат требует документированного правила. Успех задачи сам по себе не делает каждое действие эпизода допустимым для обучения.
L(θ) = − Σₑ∈D₊ wₑ · log πθ(aₑ | sₑ, cₑ)(2)
Учебная целевая функция подражания выбранному наблюдаемому действию. Веса w задаются объявленным правилом отбора. Формула не предполагает доступа к логитам или скрытым рассуждениям учителя.

Подражание действиям отличается от классической дистилляции распределений вероятностей. Если доступны только ответы API, целевой сигнал — выбранный ответ или действие, а не полное распределение учителя. Происхождение и типы ошибок важны, чтобы многословие и уверенность не стали заменой свидетельствам.

СХЕМА 02 · ДОПУСКУчебный шлюз

Что нужно для допуска локальной модели?

Четыре независимых условия. Качество само по себе не разрешает внедрение. Переключатели показывают логику процесса, не реальную готовность модели.

УДЕРЖАТЬ · выполнено 2 из 4 условий

05 / ОТБОР ДАННЫХ

Качество, разрешение и утечка — разные фильтры.

  • Подтвердить происхождение и разрешённое использование источника для обучения: успешная работа не означает наличия прав.
  • Удалить секреты и ненужные персональные данные, сохранив структуру решения; повторно оценить изменённые примеры.
  • Убирать дубликаты по происхождению задачи, репозиторию и шаблону, а не только по строкам.
  • Разделить связанные задачи до генерации вариантов и исправлений учителя.
  • Изолировать противоречивые оценки и хранить причины исключений.
  • Заморозить оценочный набор до итеративного обучения; не возвращать его исправления в обучающую выборку.

Разбиение делается по проекту, семейству задач и при необходимости времени. Случайное разбиение строк способно разместить почти одинаковые инциденты по обе стороны. Эффективный размер выборки ближе к числу независимых ситуаций, чем к числу сообщений.

06 / ГРАНИЦА СРЕДЫ

Лучшей политике всё равно нужен внешний мир.

Таблица 2. Возможное обучение и внешние обязательства
Может быть усвоеноОстаётся снаружи
Выбор запроса контекстаАктуальные источники, правила доступа и проверка происхождения.
Разложение повторяемой задачиКаноническое состояние, бюджеты и условия остановки.
Выбор инструмента или исправленияИсполнение, разрешения и сверка побочных эффектов.
Калиброванный ответНезависимая проверка критериев и итоговая приёмка.

При сравнении моделей внешние контракты оценки и полномочий сохраняются. Иначе «выигрыш» может возникнуть из ослабленной проверки. Обученная политика должна поддерживать отказ или эскалацию вне продемонстрированной области.

08 / СЛЕДУЮЩИЙ ЭКСПЕРИМЕНТ

Сравнить ученика в той же управляющей среде.

Таблица 3. Предлагаемые условия
УсловиеВопрос
Базовая модель, прежняя средаКаково исходное сквозное качество?
Обучение на отобранных эпизодахУлучшается ли качество или уменьшается стоимость?
Обучение только финальным ответамДаёт ли структура эпизода дополнительную пользу?
Обучение без атрибуцииВажен ли учёт помощи и случайных успехов?
Ученик с ограниченной эскалациейКаково качество при измеренной частоте вызовов учителя?

Явно фиксируются базовые веса, разбиение, параметры вывода и доступ к инструментам. Стоимость учителя, обучения и оценки отделяется от обслуживания. Проверяются новые семейства задач, устаревший контекст и восстановление после внесённой ошибки. Помимо общего балла публикуются способы отказа.

Допуск требует заранее заданных порога качества, верхней границы ложного принятия и ресурсных ограничений. Неопределённость оценивается на уровне задач. Модель, прошедшая один процесс, допускается для него, а не объявляется общей заменой учителю.

09 / ЛОКАЛЬНЫЙ ВЫВОД

Оценивать всю конфигурацию обслуживания.

Фиксируются редакция модели, точность весов, длина контекста, кеш, параллельность, оборудование и движок. Измеряются время до первого полезного результата, итоговая задержка, пиковая память и качество на целевом контексте и инструментах. Квантованная и полная точность оцениваются отдельно.

Локальное размещение сохраняет данные на машине, когда инструменты, логи и интеграции также соблюдают эту границу. Само выражение «локальная модель» не гарантирует приватность, если коннектор или телеметрия передаёт те же данные наружу. Выбор оборудования следует из измеренной нагрузки, а не целевого числа параметров статьи.

10 / ГРАНИЦЫ СВИДЕТЕЛЬСТВ

Это предлагаемый путь обучения.

В редакции нет завершённой дистилляции, открытого набора эпизодов или обученной локальной модели IO Lab. ≥90% качества frontier-моделей — цель для определённой системы на собственных задачах, а не текущий балл, универсальный результат или рекомендация оборудования.

Интерактивный шлюз показывает сочетание критериев допуска. Его переключатели выбирает читатель; они не описывают готовность реальной модели.

11 / ОГРАНИЧЕНИЯ

Перенос может не сработать и на аккуратных данных.

  • Учитель и оценщик могут разделять систематические слепые зоны.
  • Отбор только успехов убирает важное восстановление и смещает распределение.
  • Подражание ухудшается в состояниях, отсутствовавших в обучении.
  • Очистка может удалить нужный контекст или сохранить идентифицирующие детали.
  • Точность обслуживания и ограничение контекста меняют поведение после обучения.
  • Выигрыш нельзя приписывать дистилляции без сопоставимого базового контроля и отложенной оценки.

ИСТОЧНИКИ

Библиография и научный контекст

Эти работы задают научный контекст и методы сравнения. Их результаты не являются экспериментальным подтверждением гипотез IO Lab.

  1. Hinton, G., Vinyals, O. & Dean, J.Distilling the Knowledge in a Neural Network 2015 · arXiv preprint
  2. Zelikman, E., Wu, Y., Mu, J. & Goodman, N. D.STaR: Bootstrapping Reasoning With Reasoning 2022 · arXiv preprint
  3. Ross, S., Gordon, G. J. & Bagnell, J. A.A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning 2011 · AISTATS

СОСЛАТЬСЯ НА РАБОТУ

Цитирование и редакция

Версия 0.1 задаёт предлагаемый конвейер обучения и оценки. Набор данных, обученные веса, измеренный выигрыш и рекомендации обслуживания с этой работой не выпускаются.

IO Lab. “Distillation and Local Models: Learning from Verified Action Without Discarding the Control System.” IO Lab Working Paper 003, version 0.1, September 8, 2026. https://io-lab.nglain.com/ru/works/distillation-local-models
BibTeX
@techreport{iolab2026distillation,
  author = {{IO Lab}},
  title = {Distillation and Local Models: Learning from Verified Action Without Discarding the Control System},
  institution = {IO Lab},
  type = {Working Paper},
  number = {003},
  year = {2026},
  month = {September},
  note = {Version 0.1; not peer reviewed},
  url = {https://io-lab.nglain.com/ru/works/distillation-local-models}
}

Доступность: полный текст этой редакции открыт. Внутренний репозиторий, исходные трассы и наборы данных не опубликованы. DOI не присвоен.