Как Ozon встроил AI‑агентов в поддержку и покрыл 6 млн обращений в месяц
Ozon — один из крупнейших маркетплейсов России. Контактный центр Ozon принимает более 6 млн обращений в месяц от покупателей, продавцов и агентов пунктов выдачи заказов. Обращения распределяются по 120 с лишним темам, от доставки в ПВЗ и курьером до Ozon Fresh и Ozon Global.
Контекст: какой была поддержка Ozon до AI‑агентов
Команда автоматизации контактного центра Ozon отвечает за все обращения: от покупателей, продавцов маркетплейса, агентов ПВЗ и других направлений. Работает это так:
Пользователь обращается в поддержку
Создается тикет
Первым его встречает бот, который автоматически решает большинство обращений
Если бот не помог, подключается оператор
Ключевая метрика команды: доля тикетов, которые бот решил без оператора.
Автоматизация на старте: сценарии и интенты, которые дают 77,5%
Летом 2025 года бот работал на предзаписанных сценариях и определении интентов. Пользователь либо нажимал кнопки и попадал на свою проблему, либо писал текст, и классификатор определял тему. К июню 2025 года такой стек давал 77,5% автоматизации.
Спустя время: RAG поднимает автоматизацию до 85%
В конце лета команда внедрила RAG: пользователь в любом месте бота пишет вопрос на естественном языке и получает персональную консультацию на основе базы знаний. Автоматизация выросла до 85%. A/B-тест показал минус 4% операторской контактности и минус 2% общей доли негативных тикетов: пользователи поменяли паттерн, начали чаще писать текстом, и это дало эффект на бизнес.
Схема уровней автоматизации в контактном центре Ozon
Задача: повышать качество и персонализацию, удерживая планку в 85% автоматизации
После того, как автоматизация контактного центра достигла отметки в 85%, команда оказалась перед выбором. Бизнес просил продолжать наращивать автоматизацию. Пользователи просили персонализацию: более точные и релевантные ответы.
Требования к качеству были высокие: бот отвечает от лица Ozon и не может давать нерелевантные или юридически рискованные консультации. Тем в поддержке больше 120, и их состав постоянно меняется: что-то добавляется, что-то разбивается на части.
Автоматизацией в 85% жертвовать было нельзя, поэтому стратегию выбрали такую: новые решения встраиваются в текущего бота и дополняют его. На рынке в этот момент активно развивались LLM-агенты. Флагманом сделали поддержку покупателей: здесь тестируются ключевые решения, которые потом масштабируются на селлеров, агентов ПВЗ и другие направления.
Решение: AI‑агенты поверх работающего бота на каждом этапе поддержки
Чтобы составить стратегию, команда сделала шаг назад и посмотрела на то, как вообще устроена работа поддержки и этапы, через которые проходит пользователь. В итоге собрали путь клиента и продумали, как применить технологии на каждом шаге:
|
Этап поддержки |
Агентное решение |
|
Понять запрос |
Агент-интервьюер: в диалоге определяет тему обращения |
|
Составить план действий |
Маппинг «найденная тема → решение в боте»: сценарий, RAG или агент |
|
Сделать |
Агент по конкретной теме |
|
Проверить, что действие корректное |
LLM as a Judge |
|
Исправить, если что-то пошло не так |
Обратная связь от пользователя: кнопки, текст |
Логика второго шага такая: когда тема определена, бот выбирает, каким инструментом ее решать — предзаписанным сценарием, ответом по базе знаний через RAG или агентом. Одну и ту же тему в разных бизнес-юнитах, например в Ozon Fresh и Ozon Global, можно закрывать по-разному. Эту схему команда проверяла на живых агентах.
Агент Фреш: первый эксперимент в кейсе с испорченными продуктами
Начали с агента по теме и выбрали Ozon Fresh — сервис доставки продуктов на дом. Частотная проблема сервиса: продукты доезжают испорченными. Курьер положил яйца или бананы вниз, их придавили. Агент должен определить причину брака и по инструкциям решить, делать ли возврат денег или начислять баллы.
Первого бота сделали быстро и развернули во внутреннем мессенджере, где с ним могла пообщаться команда. Агент прошел проверку по заложенным требованиям качества, его выложили и начали собирать обратную связь.
Главных инсайта из эксперимента два:
- Агентов можно быстро создавать и тестировать
- Качество ответов нужно контролировать системно
Так команда пришла к идее бенчмарка, о котором будет чуть позже.
Пример диалога агента Фреш
Агент‑интервьюер: выяснение темы обращения за три вопроса
Дальше команда начала экспериментировать с агентом-интервьюером, который встречает пользователя в самом начале и определяет тему. Гипотеза про интервью вместо классификации родилась из двух наблюдений:
- Пользователи не всегда приходят с конкретным запросом: с человеком нужно поговорить, чтобы понять, как ему помочь.
- Классификаторы на интентах ошибаются, и покрытия тем не хватает. А их поддержка скорее постоянная операционная нагрузка на разработку, ML-команду и бизнес-заказчиков: фразы добавляются, темы меняются.
Сам интервьюер проблему не решает: его работа — понять запрос и передать человека нужному решению, сценарию, RAG или агенту по теме. И на это у него жесткий лимит: максимум три вопроса, за которые он должен определить тему обращения.
Как это выглядит: пользователь пишет, что в списке потерялся заказ, его уже трижды переносили. Обычный интент решил бы, что человека интересует статус, и бот рассказал бы, успеет ли привезти товар. Интервьюер вместо этого уточняет, что нужно: узнать статус или провести отмену заказа, который трижды переносился. Оказывается, человек хотел отменить заказ.
Проактивный подход AI-агента кардинально меняет поддержку: мы вступаем в диалог и делаем бота умнее для пользователя. Он перестает додумывать и угадывать и дает более релевантную консультацию.
Системный промпт интервьюера команда выстраивала все время развития агента. Его структура: роль, информация об Ozon, инструменты, критически важные аспекты, ловушка контекста, алгоритм работы, правила коммуникации, ограничения.
Скриншот диалога интервьюера и структура системного промпта
Обратную связь собирают через «вечный тест»: агент постоянно раскатан на 2% пользователей. Это позволяет сразу снимать сигналы и параллельно проводить полноценные A/B-тесты.
Эффект на продукт и бизнес был виден, но для полноценного релиза было рано. Команда продолжила эксперименты и параллельно начала строить собственную платформу агентов внутри Ozon, чтобы дальше развиваться быстрее.
Читайте также: как Т-Банк научил AI-агента работать в топ-3 операторов и автоматизировал 60% обращений через computer use
Агент по топ‑теме «где мой заказ»: ответы по инструкциям оператора
Первым агентом, который закрывает этап решения проблемы, стал агент по самой частотной теме поддержки — «Где мой заказ». Здесь команда заметила парадокс: если срок доставки не просрочен, бот отвечает шаблонно и говорит, что доставка ожидается с такого-то по такое число. Людям этого недостаточно, они добираются до оператора, но в итоге получают примерно такой же ответ.
Доработанный AI-агент самостоятельно размышляет, выбирает инструменты и использует базу знаний. Схема работы: проверка темы → получение метаданных заказа → размышление и поиск по базе знаний → формирование финального ответа → фильтр с проверкой на правила ответа → отправка. Все это живет в контексте диалога: агент помнит предыдущие сообщения.
Заодно такой агент вытаскивает нестандартные запросы, под которые не предусмотреть сценарий и интенты. На вопрос, может ли оператор вручную обновить статус заказа, он объясняет по инструкциям: статусы приходят от службы доставки, актуальный виден по трек-номеру.
Пример корнер-кейса
Итоги улучшений интервьюера и топ-темы: +30% точности и ответ в 10 раз быстрее оператора
С февраля по май 2026 года команда итеративно улучшала агентов. Результаты:
+30%
К точности определения темы по сравнению с классификатором. Заодно это решает проблему оркестрации: какого агента, сценарий или RAG подключать.
13 секунд
Среднее время ответа агента-интервьюера вместо стартовых 30 секунд. Этого достаточно, чтобы пользователи перестали уходить, не дождавшись ответа.
50 секунд
Среднее время ответа агента по топ-теме. Внутри большие размышления и вызовы инструментов, задача сложная.
Контроль качества как продукт: LLM as a Judge и золотые датасеты
Качество растущего числа агентов нужно контролировать, и перед командой встал вопрос, как выстроить этот процесс. Критерии выбора метода оценки определили так:
- Юридические риски
- Баланс инструкций и эмпатичности
- Человек в цепочке оценки
- Возможность быстро сравнивать новые модели
Команда создала бенчмарк — LLM as a Judge с критериальной оценкой. Для каждого кейса, единичного или частотного, в формате диалога формируются критерии: что должно быть в ответе, чего быть не должно и каковы критерии успеха. Дальше считается доля критериев, прошедших порог. Так команда понимает, насколько агент соответствует заложенным в него инструкциям.
Структура бенчмарка
Бенчмарк вырос в отдельный продукт: внутри системы появились автотесты, которые проверяют, что агент продолжает отвечать так, как задумано. Круг замкнулся. На агентской платформе можно создать агента, настроить промпт, подключить инструменты из инфраструктуры Ozon и контролировать качество его работы.
Интерфейс автотестов агента
Выводы команды Ozon
Выводы, которые команда сформулировала по итогам года работы с агентами:
- Делить релизы на мелкие итерации и проверять гипотезы на проде. История непредсказуемая: были инсайты, которых никто не ждал, и прогнозы, которые не выстрелили.
- Агенты — это дорого, и не везде они дадут эффект. Хорошо работает комбинация с текущими сценариями и интентами.
- Уделять внимание качеству: оценку генеративных моделей стоит закладывать как отдельную задачу.
- Соблюдать баланс инструкций и эмпатичности. Команда пошла в сторону инструкций, чтобы уменьшить риски.
- Эффект от агентов в поддержке виден. Команда планирует масштабирование на другие вертикали контактного центра.
- Стоит делать помощника селлера умнее и добавлять новые юзкейсы.
- Нужно развивать контроль качества как отдельный продукт.
Ключевые результаты проекта
85%
Обращений закрывается без оператора после внедрения RAG — база, поверх которой встали агенты.
+30%
Точность определения темы обращения по сравнению с классификатором на интентах.
13 секунд
Среднее время ответа агента-интервьюера — вместо стартовых 30 секунд, на которых пользователи уходили.
50 секунд
Среднее время ответа агента по топ-теме «Где мой заказ», это в 10 раз быстрее оператора.
6 млн+
Обращений в месяц проходит через поддержку Ozon.
120+
Тем обращений, состав которых постоянно меняется.
Главное
Ozon подошел к внедрению LLM-агентов с уже выстроенной автоматизацией, достигающей 85% на 6 млн обращений в месяц. Агентные пайплайны встроили поверх работающего стека: сценариев, интентов и RAG. Интервьюер определяет тему на 30% точнее классификатора и отвечает за 13 секунд. Агент по топ-теме дает персональный ответ по инструкциям оператора в 10 раз быстрее него. Контроль качества вырос в отдельный продукт: бенчмарк на LLM as a Judge, асессоры и постоянный прогон голден-датасетов.
Если вы планируете внедрить GenAI в процессы, команда Just AI поможет пройти путь от задачи до пилота