AI-анализ договоров: что автоматизируется, а что нет
Как устроен AI-анализ договоров: сверка с шаблоном, разметка рисков, границы применимости и что происходит с текстом при загрузке в нейросеть.
TL;DR. AI-анализ договоров — это первичный разбор входящего документа до того, как за него сядет юрист. Система вытаскивает ключевые поля, показывает отличия от вашего шаблона по пунктам и помечает рискованные формулировки с пояснением. Решение остаётся за человеком. Две вещи, о которых обычно молчат: сверка с шаблоном и оценка риска — разные механизмы, и смешивать их нельзя; а договор, загруженный в облачный чат-бот, покидает ваш контур.
Что такое AI-анализ договоров
Договор приходит в редакции контрагента. Дальше юрист читает его целиком — сверяет структуру, ищет добавленные и удалённые пункты, отмечает формулировки, которые смещают ответственность. Час-полтора на документ. И уходит это время не на решение, а на вычитку.
AI-анализ закрывает ровно эту часть. На выходе не вердикт «договор хороший или плохой», а размеченный документ: вот отличия от вашей нормы, вот пункты, где смещён баланс, вот почему. Юрист начинает не с первой страницы.
Как это устроено: четыре шага
- Парсинг с сохранением структуры пунктов. Договор разбирается не как сплошной текст, а как дерево пунктов и подпунктов. Это не техническая деталь: если структура потеряна, перенос абзаца на страницу выше читается системой как изменение содержания, и отчёт тонет в шуме. PDF со сложной вёрсткой и сканы требуют отдельного парсера — текстового слоя недостаточно.
- Извлечение ключевых полей. Стороны, предмет, сроки, суммы, порядок оплаты, ответственность, порядок расторжения. Это структурированные данные, с которыми дальше можно работать программно.
- Сверка с эталонным шаблоном — детерминированно. Какие пункты добавлены, какие удалены, какие переписаны. Здесь языковой модели делать нечего: сравнение двух деревьев — обычная алгоритмическая задача, и решать её моделью означает добровольно внести в отчёт вероятность выдумки там, где возможен точный ответ.
- Разметка риска — языковой моделью. Вот тут модель на месте: она читает изменённый пункт и объясняет, что именно в формулировке создаёт риск — по категориям (ответственность, сроки, штрафные санкции), с цитатой из текста.
Разделение третьего и четвёртого шага — главное решение во всей этой схеме. Когда сверка и оценка риска идут одним запросом к модели, вы не отличите «модель нашла расхождение» от «модель его придумала». Разделили — и список отличий проверяется механически, а под сомнением остаётся только интерпретация. Её видно: к каждой пометке приложена цитата из текста.
Что автоматизируется хорошо
- Поиск отличий от вашего шаблона, включая тихие правки в середине документа — там, где человеческий глаз замыливается к двадцатой странице.
- Извлечение полей в таблицу — сроки, суммы, реквизиты по потоку договоров, без ручного переноса.
- Первичная разметка типовых рисков: односторонний порядок расторжения, несимметричные штрафы, размытые сроки приёмки.
- Массовая работа с однотипными документами — типовые поставки, аренда, приложения к рамочному договору. Чем больше поток и чем однообразнее документы, тем очевиднее выигрыш.
Что не автоматизируется
Здесь стоит быть точным, потому что общими словами про «галлюцинации» проблема не описывается.
- Пропущенную ошибку система не ловит. Пометка модели проверяется цитатой: сказала «здесь риск» — покажи фрагмент, иначе пометка снимается. Это работает в одну сторону. Выдуманный риск отсекается, а вот риск, который модель не заметила, ничем не ловится — в отчёте его просто нет. Поэтому AI-разбор сокращает время чтения, но не отменяет его для значимых сделок.
- Судебная практика и контекст отношений. Формулировка, которая на бумаге выглядит стандартной, может быть болезненной именно с этим контрагентом или именно в вашей отрасли. Модель видит документ, а не историю.
- Нетиповые сделки. M&A, сложная недвижимость, госконтракты, международное право — там, где цена ошибки высока, а документ не похож на предыдущие, первичная разметка экономит мало.
- Ответственность. Её нельзя делегировать системе. Отсюда конструкция «система готовит материал, решение принимает человек» — не осторожная формулировка для маркетинга, а требование к архитектуре: модель обязана объяснять каждую пометку, иначе её всё равно придётся перепроверять с нуля.
- Актуальность шаблона. Сверка идёт против того документа, который вы считаете нормой. Устарел шаблон — устарели и результаты сверки, молча.
Куда уходит текст договора
Вопрос, который обходят стороной почти все обзоры на эту тему. Загрузили договор в публичную нейросеть — документ ушёл на чужие серверы. Для персональных данных сотрудников, коммерческих условий сделки или проекта контрагента это отдельный разговор с точки зрения 152-ФЗ и внутренних регламентов. Вести его нужно до внедрения, а не после.
Вариантов три:
- Облачное API. Быстро и дёшево, подходит для документов, которые и так не составляют тайны.
- Обезличивание перед отправкой. Из текста вырезаются наименования, суммы, реквизиты. Работает, но частично: контекст сделки часто восстанавливается и по обезличенному тексту.
- Локальный инференс. Модель разворачивается на сервере компании, документы никуда не уходят. Дороже по железу — но это единственный вариант, при котором вопрос «где сейчас лежит наш договор» имеет однозначный ответ.
Третий вариант — не теория: в проекте с аналитикой звонков мы разворачивали весь пайплайн локально именно потому, что записи разговоров не должны были покидать контур заказчика. Для договоров задача та же по своей сути, и решается она на этапе аудита, до начала работ.
С чего начать
Порядок, который экономит деньги, — не «выбрать инструмент», а сначала ответить на три вопроса.
- Что считается вашей нормой. Пока нет зафиксированного эталонного шаблона, сверять не с чем — и любой инструмент будет сравнивать договор с абстрактным представлением о хорошем договоре, а не с вашим. Обычно оказывается, что шаблонов в компании три, и все немного разные.
- Какой у вас поток. Пять договоров в месяц дешевле проверить руками, чем автоматизировать их проверку. Разговор начинает иметь смысл где-то от нескольких десятков документов в месяц, а по-настоящему — там, где документы однотипны.
- Где проходит граница контура. Ответ на вопрос из предыдущего раздела определяет бюджет сильнее, чем всё остальное: облачное API и локальный инференс отличаются по стоимости железа на порядок. Решать это после выбора инструмента — переделывать.
Дальше берётся два десятка уже разобранных юристом договоров и прогоняется через систему. Сравнение с тем, что нашёл человек, показывает реальную пользу на ваших документах — до того, как под это выделен бюджет.
Как мы это реализовали
- AI-анализ договоров: сверка с шаблоном и поиск рисков — парсинг PDF и DOCX с сохранением структуры пунктов, детерминированная сверка с эталоном, разметка рисков по категориям с пояснением. Первичный разбор — с часа-полутора ручного чтения до отчёта за минуты.
- Проверка контрагента: AI-агент по реестрам и санкциям — соседняя задача: на входе ИНН, на выходе заключение по компании-подписанту со ссылками на источники.
Механику поиска по документам разбираем отдельно в гайде про RAG-ассистентов — она отвечает на смежный вопрос: как найти нужный пункт в базе из тысяч документов, а не разобрать один.
Если разбор договоров стал узким местом — обсудим за 30 минут.