Как Ozon встроил AI-агентов в поддержку и покрыл 6 млн обращений в месяц

Зимняя Conversations – первые спикеры уже на сайте:
Wildberries & Russ, Альфа-Банк, Magnit OMNI. 2 декабря, Москва

КУПИТЬ БИЛЕТ

Поделиться кейсом

Generation AI Awards

Даниил Харламов

Руководитель группы продукта Ozon

Ритейл

Как Ozon встроил AI‑агентов в поддержку и покрыл 6 млн обращений в месяц

Ozon — один из крупнейших маркетплейсов России. Контактный центр Ozon принимает более 6 млн обращений в месяц от покупателей, продавцов и агентов пунктов выдачи заказов. Обращения распределяются по 120 с лишним темам, от доставки в ПВЗ и курьером до Ozon Fresh и Ozon Global.

Контекст: какой была поддержка Ozon до AI‑агентов

Команда автоматизации контактного центра Ozon отвечает за все обращения: от покупателей, продавцов маркетплейса, агентов ПВЗ и других направлений. Работает это так:

Пользователь обращается в поддержку

Создается тикет

Первым его встречает бот, который автоматически решает большинство обращений

Если бот не помог, подключается оператор

Ключевая метрика команды: доля тикетов, которые бот решил без оператора.

Автоматизация на старте: сценарии и интенты, которые дают 77,5%

 

Летом 2025 года бот работал на предзаписанных сценариях и определении интентов. Пользователь либо нажимал кнопки и попадал на свою проблему, либо писал текст, и классификатор определял тему. К июню 2025 года такой стек давал 77,5% автоматизации.

 

 

Спустя время: RAG поднимает автоматизацию до 85%

 

В конце лета команда внедрила RAG: пользователь в любом месте бота пишет вопрос на естественном языке и получает персональную консультацию на основе базы знаний. Автоматизация выросла до 85%. A/B-тест показал минус 4% операторской контактности и минус 2% общей доли негативных тикетов: пользователи поменяли паттерн, начали чаще писать текстом, и это дало эффект на бизнес.

Схема уровней автоматизации в контактном центре Ozon

Задача: повышать качество и персонализацию, удерживая планку в 85% автоматизации

После того, как автоматизация контактного центра достигла отметки в 85%, команда оказалась перед выбором. Бизнес просил продолжать наращивать автоматизацию. Пользователи просили персонализацию: более точные и релевантные ответы.

 

Требования к качеству были высокие: бот отвечает от лица Ozon и не может давать нерелевантные или юридически рискованные консультации. Тем в поддержке больше 120, и их состав постоянно меняется: что-то добавляется, что-то разбивается на части.

 

Автоматизацией в 85% жертвовать было нельзя, поэтому стратегию выбрали такую: новые решения встраиваются в текущего бота и дополняют его. На рынке в этот момент активно развивались LLM-агенты. Флагманом сделали поддержку покупателей: здесь тестируются ключевые решения, которые потом масштабируются на селлеров, агентов ПВЗ и другие направления.

Решение: AI‑агенты поверх работающего бота на каждом этапе поддержки

Чтобы составить стратегию, команда сделала шаг назад и посмотрела на то, как вообще устроена работа поддержки и этапы, через которые проходит пользователь. В итоге собрали путь клиента и продумали, как применить технологии на каждом шаге:

 

Этап поддержки

Агентное решение

Понять запрос

Агент-интервьюер: в диалоге определяет тему обращения

Составить план действий

Маппинг «найденная тема → решение в боте»: сценарий, RAG или агент

Сделать

Агент по конкретной теме

Проверить, что действие корректное

LLM as a Judge

Исправить, если что-то пошло не так

Обратная связь от пользователя: кнопки, текст

 

Логика второго шага такая: когда тема определена, бот выбирает, каким инструментом ее решать — предзаписанным сценарием, ответом по базе знаний через RAG или агентом. Одну и ту же тему в разных бизнес-юнитах, например в Ozon Fresh и Ozon Global, можно закрывать по-разному. Эту схему команда проверяла на живых агентах.

Агент Фреш: первый эксперимент в кейсе с испорченными продуктами

Начали с агента по теме и выбрали Ozon Fresh — сервис доставки продуктов на дом. Частотная проблема сервиса: продукты доезжают испорченными. Курьер положил яйца или бананы вниз, их придавили. Агент должен определить причину брака и по инструкциям решить, делать ли возврат денег или начислять баллы.

 

Первого бота сделали быстро и развернули во внутреннем мессенджере, где с ним могла пообщаться команда. Агент прошел проверку по заложенным требованиям качества, его выложили и начали собирать обратную связь.

 

Главных инсайта из эксперимента два:

  • Агентов можно быстро создавать и тестировать
  • Качество ответов нужно контролировать системно

 

Так команда пришла к идее бенчмарка, о котором будет чуть позже.

Пример диалога агента Фреш

Агент‑интервьюер: выяснение темы обращения за три вопроса

Дальше команда начала экспериментировать с агентом-интервьюером, который встречает пользователя в самом начале и определяет тему. Гипотеза про интервью вместо классификации родилась из двух наблюдений:

 

  1. Пользователи не всегда приходят с конкретным запросом: с человеком нужно поговорить, чтобы понять, как ему помочь.
  2. Классификаторы на интентах ошибаются, и покрытия тем не хватает. А их поддержка скорее постоянная операционная нагрузка на разработку, ML-команду и бизнес-заказчиков: фразы добавляются, темы меняются.

 

Сам интервьюер проблему не решает: его работа — понять запрос и передать человека нужному решению, сценарию, RAG или агенту по теме. И на это у него жесткий лимит: максимум три вопроса, за которые он должен определить тему обращения.

 

Как это выглядит: пользователь пишет, что в списке потерялся заказ, его уже трижды переносили. Обычный интент решил бы, что человека интересует статус, и бот рассказал бы, успеет ли привезти товар. Интервьюер вместо этого уточняет, что нужно: узнать статус или провести отмену заказа, который трижды переносился. Оказывается, человек хотел отменить заказ.

Системный промпт интервьюера команда выстраивала все время развития агента. Его структура: роль, информация об Ozon, инструменты, критически важные аспекты, ловушка контекста, алгоритм работы, правила коммуникации, ограничения.

Скриншот диалога интервьюера и структура системного промпта

Обратную связь собирают через «вечный тест»: агент постоянно раскатан на 2% пользователей. Это позволяет сразу снимать сигналы и параллельно проводить полноценные A/B-тесты.

 

Эффект на продукт и бизнес был виден, но для полноценного релиза было рано. Команда продолжила эксперименты и параллельно начала строить собственную платформу агентов внутри Ozon, чтобы дальше развиваться быстрее.

Читайте также: как Т-Банк научил AI-агента работать в топ-3 операторов и автоматизировал 60% обращений через computer use

Агент по топ‑теме «где мой заказ»: ответы по инструкциям оператора

Первым агентом, который закрывает этап решения проблемы, стал агент по самой частотной теме поддержки — «Где мой заказ». Здесь команда заметила парадокс: если срок доставки не просрочен, бот отвечает шаблонно и говорит, что доставка ожидается с такого-то по такое число. Людям этого недостаточно, они добираются до оператора, но в итоге получают примерно такой же ответ.

 

Доработанный AI-агент самостоятельно размышляет, выбирает инструменты и использует базу знаний. Схема работы: проверка темы → получение метаданных заказа → размышление и поиск по базе знаний → формирование финального ответа → фильтр с проверкой на правила ответа → отправка. Все это живет в контексте диалога: агент помнит предыдущие сообщения.

 

Заодно такой агент вытаскивает нестандартные запросы, под которые не предусмотреть сценарий и интенты. На вопрос, может ли оператор вручную обновить статус заказа, он объясняет по инструкциям: статусы приходят от службы доставки, актуальный виден по трек-номеру.

Пример корнер-кейса

Итоги улучшений интервьюера и топ-темы: +30% точности и ответ в 10 раз быстрее оператора

С февраля по май 2026 года команда итеративно улучшала агентов. Результаты:

+30%

К точности определения темы по сравнению с классификатором. Заодно это решает проблему оркестрации: какого агента, сценарий или RAG подключать.

13 секунд

Среднее время ответа агента-интервьюера вместо стартовых 30 секунд. Этого достаточно, чтобы пользователи перестали уходить, не дождавшись ответа.

50 секунд

Среднее время ответа агента по топ-теме. Внутри большие размышления и вызовы инструментов, задача сложная.

Контроль качества как продукт: LLM as a Judge и золотые датасеты

Качество растущего числа агентов нужно контролировать, и перед командой встал вопрос, как выстроить этот процесс. Критерии выбора метода оценки определили так:

 

  • Юридические риски
  • Баланс инструкций и эмпатичности
  • Человек в цепочке оценки
  • Возможность быстро сравнивать новые модели

 

Команда создала бенчмарк — LLM as a Judge с критериальной оценкой. Для каждого кейса, единичного или частотного, в формате диалога формируются критерии: что должно быть в ответе, чего быть не должно и каковы критерии успеха. Дальше считается доля критериев, прошедших порог. Так команда понимает, насколько агент соответствует заложенным в него инструкциям.

Структура бенчмарка

Бенчмарк вырос в отдельный продукт: внутри системы появились автотесты, которые проверяют, что агент продолжает отвечать так, как задумано. Круг замкнулся. На агентской платформе можно создать агента, настроить промпт, подключить инструменты из инфраструктуры Ozon и контролировать качество его работы.

Интерфейс автотестов агента

Выводы команды Ozon

Выводы, которые команда сформулировала по итогам года работы с агентами:

 

  1. Делить релизы на мелкие итерации и проверять гипотезы на проде. История непредсказуемая: были инсайты, которых никто не ждал, и прогнозы, которые не выстрелили.
  2. Агенты — это дорого, и не везде они дадут эффект. Хорошо работает комбинация с текущими сценариями и интентами.
  3. Уделять внимание качеству: оценку генеративных моделей стоит закладывать как отдельную задачу.
  4. Соблюдать баланс инструкций и эмпатичности. Команда пошла в сторону инструкций, чтобы уменьшить риски.
  5. Эффект от агентов в поддержке виден. Команда планирует масштабирование на другие вертикали контактного центра.
  6. Стоит делать помощника селлера умнее и добавлять новые юзкейсы.
  7. Нужно развивать контроль качества как отдельный продукт.

Ключевые результаты проекта

85%

Обращений закрывается без оператора после внедрения RAG — база, поверх которой встали агенты.

+30%

Точность определения темы обращения по сравнению с классификатором на интентах.

13 секунд

Среднее время ответа агента-интервьюера — вместо стартовых 30 секунд, на которых пользователи уходили.

50 секунд

Среднее время ответа агента по топ-теме «Где мой заказ», это в 10 раз быстрее оператора.

6 млн+

Обращений в месяц проходит через поддержку Ozon.

120+

Тем обращений, состав которых постоянно меняется.

Главное

Ozon подошел к внедрению LLM-агентов с уже выстроенной автоматизацией, достигающей 85% на 6 млн обращений в месяц. Агентные пайплайны встроили поверх работающего стека: сценариев, интентов и RAG. Интервьюер определяет тему на 30% точнее классификатора и отвечает за 13 секунд. Агент по топ-теме дает персональный ответ по инструкциям оператора в 10 раз быстрее него. Контроль качества вырос в отдельный продукт: бенчмарк на LLM as a Judge, асессоры и постоянный прогон голден-датасетов.

Если вы планируете внедрить GenAI в процессы, команда Just AI поможет пройти путь от задачи до пилота

Оставить заявку