Обучение ИИ-агентов на ошибках: что показал препринт Google

Модель на 9 млрд параметров обошла модель на 27 млрд. Не потому, что её дообучили или сделали умнее: она просто вела записи о собственных провалах. Так устроен WikiSkill — фреймворк, который исследователи Google Research описали в препринте на arXiv 27 августа 2026 года. Его суть — обучение ИИ-агентов без переобучения самой модели, то есть без изменения её весов. Агент разбирает свои запуски, складывает выводы в собственную «вики» и затем превращает их в переиспользуемые инструкции. Прежде всего разберём, что показали цифры и где у метода дыры. А заодно посмотрим, почему та же схема ложится на отдел продаж: опыт там тоже есть, хотя знания нет.

Обучение ИИ-агентов на своих ошибках: агент накапливает разборы в базе знаний

Что произошло: ИИ-агент, который ведёт вики о своих провалах

Работа называется «WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution». Её подали на arXiv 27 августа 2026 года, если точнее — в статусе препринта первой версии. Авторы — Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan и Tu Vu. Все они, если смотреть по аффилиациям, — исследователи Google Research.

Главное техническое отличие метода — навыки фиксируются без обновления параметров модели. Веса не трогают вообще, так что агент получает к следующему запуску инструкцию, склеенную из разборов его прошлых попыток. Модель остаётся прежней, хотя то, с чем она приходит в задачу, меняется.

Итак, цифры. Например, у Gemini-3.5-Flash средний результат по пяти бенчмаркам вырос с 49,5% до 68,1%. А вот у Qwen-3.6-27B — с 39,4% до 63,3%. Стоит отметить: оба числа — именно средние по пяти тестам, а не результат одного удачного замера.

Пять бенчмарков покрывают разные типы работы. В частности, это математическое рассуждение, веб-поиск, таблицы, вопросы по длинным документам и интерактивные задачи. Список такой, если приводить полностью: LiveMath, SealQA, SpreadsheetBench, OfficeQA, ALFWorld. То есть обучение ИИ-агентов проверяли не на одном узком сценарии, а на наборе непохожих друг на друга задач.

Важно о статусе: это не релиз и не продукт. WikiSkill описан в препринте, то есть в работе, которая ещё не прошла рецензирование. Ни скачать, ни подключить его нельзя, а результаты живут на лабораторных бенчмарках, но не на выручке компаний. Ценность здесь не в инструменте, а в проверенном на цифрах принципе.

Модель на 9 млрд обошла модель на 27 млрд

Небольшая модель с накопленным опытом обходит более крупную модель без навыков

Самый контринтуитивный результат препринта звучит так. Qwen-3.5-9B с WikiSkill достигает 47,4% средней точности и превосходит Qwen-3.6-27B без навыков — 39,4%. То есть небольшая модель с накопленным опытом обыграла более крупную модель без него.

Рамку тут стоит поставить честно. Это не «втрое более крупная модель проиграла втрое меньшей». По числу параметров разница действительно тройная, однако модели относятся к разным поколениям — 3.6 против 3.5. Сравнение всё равно показательное, хотя и не такое эффектное, как в пересказах.

Для экономики внедрения вывод получается неприятный и полезный одновременно. Привычная логика звучит так: нужно качество — берите модель помощнее. На счёте это означает только одно: платите больше за каждый запрос. В итоге исследование показывает, что обучение ИИ-агентов на собственном опыте частично закрывает разницу в размере инструмента.

Сами авторы от громких выводов воздерживаются. По их формулировке, эволюция навыков дополняет масштабирование модели, но не отменяет его. Более того, крупные модели выигрывают от накопленного опыта даже сильнее, чем маленькие. Речь не о том, что размер не важен, а о том, что он не единственный рычаг. Обучение ИИ-агентов на накопленном опыте работает параллельно с масштабом модели.

Руководителю эта логика знакома до боли, например: «продажи просели — наймём звезду» или «купим CRM подороже». Апгрейд инструмента — самый понятный путь к качеству, хотя и самый дорогой. Так что здесь у него впервые появляется измеренная альтернатива.

Как устроено обучение ИИ-агентов: три слоя

Три слоя WikiSkill: сырые записи, слой знания и слой инструкций

Вся конструкция держится на разделении рабочего пространства агента на три слоя. Разберём каждый по очереди, так как это ядро статьи и та часть, которую можно унести к себе.

Raw Layer — сырой слой

Здесь лежат полные трейсы выполнения, то есть подробные протоколы запуска. В них видно, что агент делал шаг за шагом, какие инструменты вызывал и чем всё закончилось. Слой ничего не объясняет и не обобщает — он только фиксирует. Это сырьё, а не знание.

Ключевое свойство слоя — неизменяемость. Записи не переписываются задним числом, так что исходную картину можно поднять всегда. Это выручает, если выводы на верхних слоях окажутся ошибочными.

Wiki Layer — слой знания

Здесь сырые трейсы превращаются в структурированное знание. Например, в повторяющиеся паттерны провалов и удачные стратегии. Это редакторский слой, а не свалка логов. Знание тут не просто складывается — оно к тому же консолидируется и переписывается по мере накопления.

Именно постоянство этого слоя вытягивает обучение ИИ-агентов. Проверяли это абляциями, то есть экспериментами с отключением отдельного компонента. Абляции подтверждают: постоянное накопление знаний в вики критично для эффективной эволюции навыков.

Skill Layer — слой инструкций

На выходе получаются исполняемые Agent Skills, то есть компактные инструкции для следующей задачи. Навык здесь — не память о ситуации, а готовое правило действия. Ближайший бизнес-аналог, если искать его в компании, — должностная инструкция или пункт скрипта.

Формула, которую стоит запомнить: сырьё → разбор → инструкция. Всё дальнейшее в статье — про то, что происходит, если одного из трёх слоёв в компании нет.

Хранить опыт мало — его нужно консолидировать

Соблазнительно прочитать новость как «агенту просто дали память». Но WikiSkill сравнивали не с пустотой. В эксперименте участвовали и другие методы накопления навыков: Trace2Skill, EvoSkill, SkillOpt. Они тоже сохраняют опыт, только иначе.

Сильнейший из конкурентов, EvoSkill, дошёл до 56,1%. Для сравнения: у WikiSkill вышло 68,1%, тогда как у той же модели без навыков — 49,5%. Разрыв в двенадцать пунктов возник не между «помнит» и «не помнит», а между «складывает» и «переосмысляет». Стало быть, обучение ИИ-агентов упирается не в сам факт памяти, а в её редактуру.

Для отдела продаж вывод переводится, если коротко, в одну фразу. Записывать звонки — совсем не то же самое, что их разбирать. Архив записей в телефонии данные хранит, но знания из них не производит. Обучение ИИ-агентов упирается ровно в ту же развилку.

Тот же диагноз бизнесу поставили годом раньше

Осенью 2025 года MIT Project NANDA выпустил отчёт «The GenAI Divide: State of AI in Business 2025». По данным отчёта, 95% корпоративных пилотов генеративного ИИ не дают измеримого эффекта на P&L. Причину исследователи назвали learning gap, то есть разрывом в обучении. Системы не сохраняют обратную связь, не адаптируются и не улучшаются со временем.

Так вот, WikiSkill бьёт ровно в этот диагноз. Не «модель поумнела», а «появился слой, где обратная связь оседает и накапливается». Разница между провальным пилотом и работающим, как правило, лежит именно здесь, а не в выборе модели.

У людей всё устроено похоже. По данным Sales Performance International, которые приводит компания SBI, около половины тренинга забывается менее чем за пять недель. За 90 дней теряется уже до 84%. Обратная связь была, хотя слоя, где она осела бы, не было.

Ещё один фоновый штрих. Stanford Digital Economy Lab, кстати, отмечает важную деталь в августовской ревизии работы «Canaries in the Coal Mine?». Например, там, где ИИ дополняет работника, занятость стабильна или даже растёт. А вот в наиболее затронутых ИИ профессиях занятость молодых работников 22–25 лет примерно на 19% ниже расчётного уровня. Речь о том уровне, на котором она была бы, если бы росла теми же темпами, что у сверстников в менее затронутых профессиях.

Переносим три слоя на отдел продаж

Дальше — интерпретация, а не вывод исследования. Препринт описывает обучение ИИ-агентов на бенчмарках, тогда как перенос схемы на отдел продаж — только аналогия. Она помогает думать, хотя ничего не доказывает. И всё же с этой оговоркой аналогия работает на удивление точно.

Слой WikiSkillУ ИИ-агентаУ отдела продаж
Raw Layer — сырьёполные трейсы выполнения задачи с вызовами инструментовзаписи звонков в телефонии и их расшифровки
Wiki Layer — знаниеповторяющиеся паттерны провалов и удачные стратегиирезультаты чек-листа по каждому звонку и накопленная статистика типовых ошибок отдела
Skill Layer — инструкцияисполняемые Agent Skillsобновлённый скрипт, чек-лист, регламент, библиотека эталонных звонков
Схема переноса: слои ИИ-агента и их аналоги в отделе продаж

Raw Layer есть у всех, Wiki Layer — почти ни у кого

У подавляющего большинства компаний первый слой есть, хотя второго нет. Отдел на десять человек делает 50–100 звонков в день, то есть накапливает гигантский массив опыта. А выборочное прослушивание звонков покрывает только 5–10% этого массива. Остальное лежит мёртвым архивом, который никто не откроет.

Разборы, если они вообще происходят, живут в устной форме: «ты сегодня плохо отработал возражение». Через неделю формулировка забыта. Затем новичок наступает на те же грабли, о которые год назад споткнулся его предшественник. В итоге компания платит за один и тот же урок по десять раз. Обучение ИИ-агентов устроено наоборот: каждый разбор попадает в вики и остаётся там навсегда.

Типичная ошибка: считать разбор событием, а не слоем. Разовая планёрка с разносом — ещё не Wiki Layer, потому что после неё не остаётся ничего. Слой начинается только там, где появляется единый формат фиксации и накопление.

Что видно только на массиве звонков

Вот два примера того, что видно только на массиве. Первый: менеджер называет цену раньше, чем выяснил, зачем клиенту продукт. В одном звонке это выглядит как стиль общения, тогда как на сотне превращается в системный паттерн провала. Второй: в разговоре не прозвучала договорённость о следующем шаге. В отдельном звонке это мелочь, хотя на дистанции — дыра в воронке.

Средний слой — единственный, который в отделе продаж не появляется сам собой. Именно его закрывают сервисы речевой аналитики. В частности, Rechka расшифровывает разговор за 5–7 минут и разделяет реплики менеджера и клиента. Затем сервис проверяет разговор по настраиваемому чек-листу: поздоровался, представился, выявил потребность, назвал цену, отработал возражение, договорился о следующем шаге. За месяц из этого складывается картина, которую выборочным прослушиванием не собрать, потому что объём не тот. В итоге формулировка меняется: не «Петров плохо звонит», а, скажем, «в 60% разговоров возражение про цену остаётся без ответа».

Третий слой, впрочем, остаётся за человеком. Речевая аналитика не пишет скрипты и не обучает менеджеров. Она только даёт данные и рекомендации. А решение, что менять в скрипте и кого доучивать, принимает руководитель.

Что об этом говорит практика

Rechka.ai
Искусственный интеллект для анализа звонков
Задать вопрос
Мы видим этот разрыв в каждой второй компании, которая приходит на пилот. Записи звонков есть у всех — телефония пишет их годами. Но когда спрашиваешь, какие три ошибки чаще всего повторяются в отделе, ответ звучит как впечатление, а не как цифра. Это и есть отсутствующий средний слой: сырьё лежит, знания из него никто не извлёк. Практическая разница между «слушать выборочно» и «разбирать системно» проявляется не в первый день. Один звонок ничего не доказывает: менеджер мог попасть на сложного клиента. А вот когда одна и та же ошибка всплывает в шестидесяти звонках из ста, спорить уже не с чем — это не характер менеджера, а дыра в скрипте. Решение всё равно остаётся за руководителем. Система показывает, скажем, что в 70% разговоров не прозвучала договорённость о следующем шаге. Что с этим делать — менять скрипт, доучивать конкретных людей или пересобирать этап воронки — определяет человек, а не алгоритм.

Хорошая новость, кстати, в том, что средний слой не требует ни бюджета, ни ИИ. Нужен только единый список параметров, по которому вы проверяете каждый разобранный звонок. Иначе разборы снова окажутся устными, разными и несопоставимыми между собой.

📋
Чек-лист оценки звонка
20 критериев · бесплатно
Минимальный Wiki Layer
Соберите слой разбора вручную — за 5 минут

Чек-лист из 20 критериев — от приветствия до договорённости о следующем шаге. Прогоните по нему один вчерашний звонок и увидите, какие пункты проваливаются системно.

Открыть чек-лист →

Что мешает построить свой Wiki Layer

Но у любого накопленного знания — хоть у вики агента, хоть у папки с разборами — есть свои болезни. Стоит отметить, что обучение ИИ-агентов упирается в четыре ограничения, и авторы препринта назвали их сами. На бизнес эти ограничения переносятся почти дословно.

  • Нет механизма доставки знания. Прежде всего, у WikiSkill не оценивался механизм, который достаёт нужный навык в нужный момент. У компании то же самое: регламент существует, но менеджер во время звонка его не открывает. Так что база знаний без доставки мертва.
  • Вики разрастается, и никто её не чистит. Автоматической чистки у метода нет, хотя объём растёт. У отдела продаж, между тем, та же болезнь. Скрипт обрастает правками за три года, так что половина пунктов противоречит другой половине. Однако удалять никто не решается.
  • Жёсткая валидация отсекает нейтральные правки. В исследовании, например, изменение без прироста отбрасывают. Тогда как в компании всё наоборот, и это хуже. Не отбрасывают ничего, так что в чек-листе годами живут пункты, которые ни на что не влияют.
  • Сверхдлинные задачи не покрыты. Метод, например, не тестировали на задачах в сотни шагов. Ближайший аналог, если искать его в продажах, — B2B-сделка на пятнадцать касаний. Разобрать один звонок легко, тогда как увидеть паттерн через всю цепочку — совсем другая работа.

Коротко: плюсы и минусы подхода

Плюсы
Не требует переобучения модели: у агента не трогают веса, у отдела — не меняют людей
Работает на дешёвом сырье, которое уже есть: логи у агента, записи звонков у компании
Опыт перестаёт зависеть от носителя — знание остаётся, когда уходит сильный сотрудник
Даёт измеримый прирост в большинстве проверенных сценариев: 49,5% → 68,1% в среднем по пяти бенчмаркам
Минусы
Нужен механизм доставки знания в момент действия, иначе база мертва
База разрастается и устаревает: автоматической чистки нет ни у метода, ни у большинства компаний
Прирост не универсален: там, где процесс уже отлажен, эффекта может не быть вовсе
Требует постоянства: разовый разбор раз в квартал не даёт накопления
Результаты живут на бенчмарках, а не на бизнес-метриках

Ограничения: это препринт, и прирост есть не везде

Повторим главное: перед нами только препринт arXiv первой версии, а не рецензированная публикация. Обучение ИИ-агентов здесь измерено на бенчмарках, но не на бизнес-метриках. Никто не измерял ни выручку, ни сроки, ни экономию.

Второе ограничение авторы формулируют сами. Метод улучшает результат относительно базового уровня только в большинстве связок модель-бенчмарк, хотя и не во всех. Контрпример, кстати, лежит прямо в таблице препринта.

Контрпример: на бенчмарке ALFWorld у Gemini-3.5-Flash результат одинаковый и без навыков, и с ними — 85,9%. Например, там, где процесс уже отлажен, накопление разборов не добавляет ничего. Практический перенос: если ваши менеджеры стабильно проходят все этапы разговора, разбор 100% звонков даст немного. Проблема в том, что уверенность в «отлаженности» у большинства руководителей не опирается на данные.

Третье: перенос навыков между моделями работает не всегда. Навыки, выращенные одной моделью, могут оказаться полезнее самостоятельно накопленных, хотя и не всегда. Например, на ALFWorld у Qwen-3.5-9B это 70,2% с перенесёнными навыками против 63,4% со своими. Но авторы прямо рекомендуют проверять переносимость для каждой пары моделей. Бизнес-аналог тут очевиден, если подумать: чужая книга возражений и скрипт из соседней отрасли без адаптации заходят редко.

И четвёртое, уже из области оценок. Обозреватель The Decoder Matthias Bastian называет подход неэлегантным, но рабочим обходным путём. По его словам, модель в строгом смысле не учится непрерывно, так что проблема остаётся нерешённой. Спорить трудно, потому что обучение ИИ-агентов здесь вынесено во внешнюю базу знаний, а не встроено в модель.

Что забрать из этого руководителю уже сегодня

  1. Перестаньте выбрасывать сырьё. Записи звонков, переписки, комментарии в CRM — это ваш Raw Layer. Он уже существует и, между прочим, ничего не стоит. Вопрос только в том, доходит ли до него хоть кто-нибудь.
  2. Заведите слой между записью и выводом. Например, один документ с повторяющимися ошибками и привязкой к конкретным звонкам — это уже Wiki Layer. Начните хотя бы с десяти звонков в неделю, так как минимальная версия работает лучше отсутствующей. Опереться можно, к примеру, на готовый чек-лист контроля качества звонков.
  3. Превращайте разбор в инструкцию, а не в замечание. Например, «ты плохо отработал возражение» умирает за неделю. А вот «в скрипте появился блок ответов на возражение про цену» живёт, пока живёт скрипт.
  4. Не начинайте с покупки инструмента. Собственно говоря, исследование про обучение ИИ-агентов именно об этом: накопленный опыт частично заменяет апгрейд. Сначала слой разбора, затем его масштабирование, а не наоборот.

У ручного подхода есть потолок, и он невысокий. Обучение ИИ-агентов масштабируется само, тогда как ручной разбор упирается в часы руководителя. Хотя десять звонков в неделю — это уже что-то, системный паттерн на такой выборке проступит в лучшем случае через квартал.

Ваш архив звонков — это опыт, который никто не разобрал

Отправьте 30 минут записей: ИИ расшифрует разговоры, проверит по чек-листу и покажет, на каких этапах менеджеры теряют клиентов.

Получить разбор бесплатно → Бесплатно · 30 минут анализа · Результат за 24 часа

Частые вопросы об обучении ИИ-агентов

Могут ли ИИ-агенты учиться на своих ошибках без переобучения модели?
Правда ли, что маленькая модель может обойти большую?
Что такое WikiSkill и можно ли им пользоваться?

Что из этого применимо к людям

Можно ли применить принципы обучения ИИ-агентов к обучению сотрудников?
Почему менеджеры повторяют одни и те же ошибки?

Выводы

Обучение ИИ-агентов через постоянно накапливаемую вики даёт измеримый прирост без переобучения модели. К тому же небольшая модель с накопленным опытом способна обойти более крупную без него. Итак, управленческий принцип отсюда следует простой. Качество растёт не от апгрейда инструмента. Растёт оно только там, где опыт превращается в знание, а знание — в инструкцию.

Рамку держим честной. Это препринт, эффект есть не везде, а перенос схемы на отдел продаж — только аналогия. Но аналогия рабочая. К тому же инструменты, которые автоматизируют средний слой, стоят сегодня дешевле тренинга, который забудется за 90 дней.

Так что остаётся один вопрос, на который стоит ответить себе до конца недели. Raw Layer у вас точно есть — записи звонков копятся сами. А Wiki Layer?

Блог Речки