474 712 строк за 35 лет: как ИИ разбирает то, что понимал только опытный сотрудник
«НАР РУЧКУ ДВЕРЬ РАСПАШ З ПР С/У» — это не сбой кодировки и не ошибка миграции. Это настоящее название работы из справочника автосервиса. За 35 лет в нём накопилось 474 712 строк. Команда рассказала на Habr, как приводит этот массив в порядок с помощью LLM и экспертов — и в этой истории есть вывод для любого бизнеса, у которого копились данные годами.
Почему это проблема, а не просто «некрасивая база»
Внутри справочника — сокращения, дубли, опечатки, разные языки и несколько вариантов написания одной и той же операции. Опытный мастер-консультант многое понимает по контексту: он видит «НАР РУЧКУ ДВЕРЬ РАСПАШ» и знает, о чём речь.
Но как только за справочник берётся кто-то другой, начинаются сложности:
— специалист по записи клиентов зависит от знаний более опытных коллег;
— аналитику приходится вручную сводить разные названия одной операции.
Получается, что бизнес-процесс держится не на системе, а на конкретных людях с опытом. Это риск: знания не формализованы, их сложно передать и невозможно масштабировать.
Что сделала команда
При разработке своей цифровой платформы для дилеров команда занялась нормализацией этого массива. По описанию в статье:
— дедуплицировали массив, убрав повторы;
— дважды провели данные через экспертную проверку — в проекте участвовал 21 эксперт;
— для 96,13% работ после дедупликации подтвердили корректный узел.
Путь был не прямым. По ходу пришлось отказаться от полнотекстового поиска, несколько раз перестроить связку «LLM + эксперты» и научиться возвращать экспертный фидбек обратно в правила и skills агента. Авторы честно признают, что в оценке производительности на одной из задач ошиблись больше чем втрое. Проект ещё не завершён, но основную часть нормализации уже прошли.
Почему это важно за пределами автобизнеса
Самое ценное здесь — не автосервис. Кейс показывает, что современные мультимодальные и языковые модели научились работать с неструктурированным текстом: понимать опечатки, сокращения и разные формулировки одного и того же смысла.
Раньше такую работу мог делать только человек «в теме». Теперь значительную часть можно передать ИИ. Это открывает автоматизацию в задачах, которые долго считались неавтоматизируемыми:
— исторические справочники, прайсы и номенклатуры, которые вели разные сотрудники;
— заявки и обращения клиентов, написанные вольным текстом;
— базы товаров и услуг с дублями и разнобоем в названиях;
— обращения в поддержку, где важен смысл, а не точная формулировка.
Главный принцип: ИИ + эксперт, а не ИИ вместо эксперта
Обратите внимание на роли в кейсе. Модель делает массовую черновую работу, эксперты проверяют результат, а их правки возвращаются в настройки агента — и качество растёт с каждой итерацией. Это рабочая схема для клиентского сервиса: ИИ снимает рутину, люди отвечают за точность и сложные случаи.
Вывод
Если у вас есть массив данных, который годами вели разные люди — справочник услуг, база клиентов, история обращений — часть работы по его приведению в порядок уже можно доверить ИИ. Начать стоит не с покупки инструмента, а с понимания, какие именно процессы у вас держатся на «людях, которые знают».
Разбираем такие задачи на бесплатном ИИ-аудите: находим, что автоматизировать в вашем бизнесе. Без продаж.
Первоисточник: habr.com/ru/companies/rolf_autotech/articles/1083810