Distillation & Local Models
Обучение на проверенных действиях с сохранением внешнего управления
00 / АННОТАЦИЯ
Единица обучения — эпизод с установленным вкладом.
Долгосрочная программа IO Lab исследует, какие повторяемые способы поведения эффективной агентной системы можно перенести в локально обслуживаемую модель. Предлагаемая единица обучения связывает состояние задачи, контекст, решение, действие, наблюдаемый результат и оценку. Сырая переписка смешивает полезные политики со случайным успехом, непроверенными заявлениями и чувствительными данными.
Работа задаёт контракт эпизода, границы отбора, целевую функцию обучения и протокол допуска. Поведение, которое способны усвоить веса, отделяется от свежих знаний, полномочий, инструментов и восстановления, остающихся вне модели. Обученная модель IO Lab, открытый набор данных и результат равенства frontier-моделям здесь не представлены.
Вклад этой редакции
- Схема эпизода, связывающая поведение модели с наблюдаемым результатом и происхождением данных.
- Отбор, отличающий допустимость обучения от успеха задачи.
- Допуск по отложенному качеству, ложному принятию, приватности и ограничениям обслуживания.
- 01
Записать состояние, действие и свидетельства.
- 02
Проверить права, происхождение и качество.
- 03
Обучить объявленному поведению.
- 04
Проверить на изолированных задачах.
- 05
Выпустить в пределах пройденных условий.
01 / ПРОБЛЕМА
Успешная переписка может преподать неверный урок.
Задача может завершиться, потому что инструмент исправил ошибку модели, человек отредактировал результат или среда случайно соответствовала необоснованному предположению. Подражание всей переписке кодирует эти ошибки вместе с полезным поведением. Эпизод должен различать решение модели, помощь среды и свидетельства результата.
Вопрос внедрения также конкретен. Локальная модель может сократить внешние вызовы на повторяемых задачах, но её полезность определяется сквозным качеством и ограничениями обслуживания. Одно число параметров этого не устанавливает.
02 / ГИПОТЕЗА
Усвоить повторяемые решения, сохранить внешнюю проверку.
Кандидаты: выбор релевантного контекста, корректная схема действия, существенное уточнение и исправление конкретного отказа. Свежие факты, изменяющиеся права и внешнее состояние остаются входами среды. Модель не обучается обходить проверку или выводить полномочия из успешного прецедента.
03 / КОНТРАКТ ЭПИЗОДА
Чему именно обучается модель?
| Поле | Назначение |
|---|---|
| Задача и критерий | Зафиксировать успех до действия. |
| Состояние и контекст | Наблюдения, редакции источников и разрешённая область. |
| Решение и действие | Наблюдаемый выбор плана, вызов инструмента или структурированный ответ. |
| Квитанция и изменение | Фактический эффект, связанный с вызовом. |
| Оценка | Pass, fail или unknown для каждого критерия с оценщиком и правилом. |
| Атрибуция | Вмешательство учителя, исправление человека и помощь среды. |
| Допустимость | Права на данные, приватность, очистка и разрешённые способы использования. |
Используются наблюдаемые трассы действий, краткие объяснения решений и свидетельства оценки. Скрытые рассуждения модели не требуются и не предполагаются доступными. Неудачные и неопределённые эпизоды сохраняются с метками: они полезны для оценки или отдельной задачи предпочтений, но не становятся автоматически положительными примерами.
04 / МОДЕЛЬ
Сначала цель обучения, затем рецепт.
D₊ = {e : eligible(e) ∧ verified(e) ∧ attributable(e)}(1)L(θ) = − Σₑ∈D₊ wₑ · log πθ(aₑ | sₑ, cₑ)(2)Подражание действиям отличается от классической дистилляции распределений вероятностей. Если доступны только ответы API, целевой сигнал — выбранный ответ или действие, а не полное распределение учителя. Происхождение и типы ошибок важны, чтобы многословие и уверенность не стали заменой свидетельствам.
Что нужно для допуска локальной модели?
Четыре независимых условия. Качество само по себе не разрешает внедрение. Переключатели показывают логику процесса, не реальную готовность модели.
05 / ОТБОР ДАННЫХ
Качество, разрешение и утечка — разные фильтры.
- Подтвердить происхождение и разрешённое использование источника для обучения: успешная работа не означает наличия прав.
- Удалить секреты и ненужные персональные данные, сохранив структуру решения; повторно оценить изменённые примеры.
- Убирать дубликаты по происхождению задачи, репозиторию и шаблону, а не только по строкам.
- Разделить связанные задачи до генерации вариантов и исправлений учителя.
- Изолировать противоречивые оценки и хранить причины исключений.
- Заморозить оценочный набор до итеративного обучения; не возвращать его исправления в обучающую выборку.
Разбиение делается по проекту, семейству задач и при необходимости времени. Случайное разбиение строк способно разместить почти одинаковые инциденты по обе стороны. Эффективный размер выборки ближе к числу независимых ситуаций, чем к числу сообщений.
06 / ГРАНИЦА СРЕДЫ
Лучшей политике всё равно нужен внешний мир.
| Может быть усвоено | Остаётся снаружи |
|---|---|
| Выбор запроса контекста | Актуальные источники, правила доступа и проверка происхождения. |
| Разложение повторяемой задачи | Каноническое состояние, бюджеты и условия остановки. |
| Выбор инструмента или исправления | Исполнение, разрешения и сверка побочных эффектов. |
| Калиброванный ответ | Независимая проверка критериев и итоговая приёмка. |
При сравнении моделей внешние контракты оценки и полномочий сохраняются. Иначе «выигрыш» может возникнуть из ослабленной проверки. Обученная политика должна поддерживать отказ или эскалацию вне продемонстрированной области.
08 / СЛЕДУЮЩИЙ ЭКСПЕРИМЕНТ
Сравнить ученика в той же управляющей среде.
| Условие | Вопрос |
|---|---|
| Базовая модель, прежняя среда | Каково исходное сквозное качество? |
| Обучение на отобранных эпизодах | Улучшается ли качество или уменьшается стоимость? |
| Обучение только финальным ответам | Даёт ли структура эпизода дополнительную пользу? |
| Обучение без атрибуции | Важен ли учёт помощи и случайных успехов? |
| Ученик с ограниченной эскалацией | Каково качество при измеренной частоте вызовов учителя? |
Явно фиксируются базовые веса, разбиение, параметры вывода и доступ к инструментам. Стоимость учителя, обучения и оценки отделяется от обслуживания. Проверяются новые семейства задач, устаревший контекст и восстановление после внесённой ошибки. Помимо общего балла публикуются способы отказа.
Допуск требует заранее заданных порога качества, верхней границы ложного принятия и ресурсных ограничений. Неопределённость оценивается на уровне задач. Модель, прошедшая один процесс, допускается для него, а не объявляется общей заменой учителю.
09 / ЛОКАЛЬНЫЙ ВЫВОД
Оценивать всю конфигурацию обслуживания.
Фиксируются редакция модели, точность весов, длина контекста, кеш, параллельность, оборудование и движок. Измеряются время до первого полезного результата, итоговая задержка, пиковая память и качество на целевом контексте и инструментах. Квантованная и полная точность оцениваются отдельно.
Локальное размещение сохраняет данные на машине, когда инструменты, логи и интеграции также соблюдают эту границу. Само выражение «локальная модель» не гарантирует приватность, если коннектор или телеметрия передаёт те же данные наружу. Выбор оборудования следует из измеренной нагрузки, а не целевого числа параметров статьи.
10 / ГРАНИЦЫ СВИДЕТЕЛЬСТВ
Это предлагаемый путь обучения.
В редакции нет завершённой дистилляции, открытого набора эпизодов или обученной локальной модели IO Lab. ≥90% качества frontier-моделей — цель для определённой системы на собственных задачах, а не текущий балл, универсальный результат или рекомендация оборудования.
Интерактивный шлюз показывает сочетание критериев допуска. Его переключатели выбирает читатель; они не описывают готовность реальной модели.
11 / ОГРАНИЧЕНИЯ
Перенос может не сработать и на аккуратных данных.
- Учитель и оценщик могут разделять систематические слепые зоны.
- Отбор только успехов убирает важное восстановление и смещает распределение.
- Подражание ухудшается в состояниях, отсутствовавших в обучении.
- Очистка может удалить нужный контекст или сохранить идентифицирующие детали.
- Точность обслуживания и ограничение контекста меняют поведение после обучения.
- Выигрыш нельзя приписывать дистилляции без сопоставимого базового контроля и отложенной оценки.
ИСТОЧНИКИ
Библиография и научный контекст
Эти работы задают научный контекст и методы сравнения. Их результаты не являются экспериментальным подтверждением гипотез IO Lab.
- Hinton, G., Vinyals, O. & Dean, J.Distilling the Knowledge in a Neural Network 2015 · arXiv preprint
- Zelikman, E., Wu, Y., Mu, J. & Goodman, N. D.STaR: Bootstrapping Reasoning With Reasoning 2022 · arXiv preprint
- Ross, S., Gordon, G. J. & Bagnell, J. A.A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning 2011 · AISTATS
СОСЛАТЬСЯ НА РАБОТУ
Цитирование и редакция
Версия 0.1 задаёт предлагаемый конвейер обучения и оценки. Набор данных, обученные веса, измеренный выигрыш и рекомендации обслуживания с этой работой не выпускаются.
IO Lab. “Distillation and Local Models: Learning from Verified Action Without Discarding the Control System.” IO Lab Working Paper 003, version 0.1, September 8, 2026. https://io-lab.nglain.com/ru/works/distillation-local-models
BibTeX
@techreport{iolab2026distillation,
author = {{IO Lab}},
title = {Distillation and Local Models: Learning from Verified Action Without Discarding the Control System},
institution = {IO Lab},
type = {Working Paper},
number = {003},
year = {2026},
month = {September},
note = {Version 0.1; not peer reviewed},
url = {https://io-lab.nglain.com/ru/works/distillation-local-models}
}Доступность: полный текст этой редакции открыт. Внутренний репозиторий, исходные трассы и наборы данных не опубликованы. DOI не присвоен.