Студенты ТГУ второй год тестируют юридический ИИ - результаты

В 2025 году студенты-юристы Томского государственного университета проверили нейросеть для юристов ExplainLaw на 20 реальных делах и поставили 5,5 из 10. Через год, уже на 100 делах и по строгим метрикам — 8,0 из 10.
Рассказываем, что происходило между этими двумя цифрами: как выглядело первое тестирование, что мы после него переделали и почему сотрудничество университета с ИИ-стартапом даёт продукту то, чего не купишь ни за какие деньги.

Коротко: два года в одной таблице
| 2025 | 2026 | |
|---|---|---|
| Средняя оценка | 5,5 / 10 | 8,0 / 10 |
| Кейсов | 20 | 100 |
| Худший результат кейса | 2,0 — ответ так и не получили | 5,0 |
| Лучший результат кейса | 8,5 | 10 |
| Кто тестировал | Один юрист на дело | 6 групп по 5–6 человек |
| Как оценивали | Свободный отзыв | 6 метрик с формулами расчёта |
| Главная претензия | «Падает на файлах, не читает сканы» | «Проверяйте судебную практику» |
| Что проверяли в ссылках | Существует ли акт | Содержание, юрисдикция, редакция, куда ведёт ссылка |
Из этой таблицы видно как изменился характер претензий. В 2025 году студенты спорили с платформой о том, откроется ли PDF. В 2026-м — о том, насколько корректно подобрана судебная практика. И как выросла планка проверки. Оценку 8,0 поставили люди, которые сверяли не только номер судебного акта, но и его содержание, юрисдикцию суда и адрес, куда ведёт гиперссылка.
Ещё нагляднее разница видна в разбросе оценок: в 2025 году результат кейса мог оказаться любым — от двойки до 8,5. В 2026-м нижняя граница поднялась до 5,0, а верхняя достигла максимума.

2025 год: как это выглядело
Первое тестирование было почти полевым. Мы сознательно не давали студентам ни шаблона, ни метрик — хотелось посмотреть, за что они зацепятся сами. Двадцать реальных обращений из юридической клиники ТГУ, по каждому уже есть заключение живого юриста (подготовленное студентом и проверенное преподавателем), к каждому — отчёт в свободной форме.
Отчёты получились честные. Настолько, что читать их было местами больно.
Проблема была не в праве, а в криво работающей системе.
Не читались PDF-сканы. Один из юристов дал интересное и весьма точное описание:
«По причине несчитываемости текста, мне мнится, бот сделал вид, что он всё воспринял, понял и тактично про это умолчал».
Экспертиза на 75 страниц не загружалась. Юристу пришлось скринить документ по кускам и отправлять по одному скриншоту. Файлы около мегабайта выдавали ошибку.
Синяя рамка при копировании. Текст из чата вставлялся в Word вместе с рамкой, и юристы придумали обходной путь: вставить сначала в поисковую строку Google, а уже оттуда скопировать чистый текст. Мелочь, но именно из таких мелочей складывается ощущение сырого продукта.
Кейс, который мы вспоминаем до сих пор
Студент загружает шаблон договора купли-продажи квартиры и просит провести правовую экспертизу. Система принимает присланный документ за уже готовую экспертизу, написанную юристом, и вместо анализа начинает хвалить работу, которой не существует:
«Ваша работа демонстрирует глубокое понимание предмета и высокую квалификацию... Ваш анализ является образцовым... Отличная работа!»
Студент переформулировала промпт. Ещё раз. Потом составила промпт с помощью самого ИИ. Всего вышло пять с лишним попыток: система то снова хвалила пустоту, то обрывала ответ на полуслове, то молчала полчаса и возвращала пустой экран.
Ответ клиенту по этому кейсу подготовить так и не удалось. Вердикт из отчёта звучал сдержанно: «Возможно, ИИ нужно дорабатывать именно в этой части».
Что тогда работало
При всём этом 5,5 — не приговор, и разброс оценок оказался показательным: от 2,0 до 8,5.
| Группа дел | Балл |
|---|---|
| Процессуальные и публично-правовые споры | 7,8 |
| Договорные споры и защита прав потребителей | 6,0 |
| Социальное и пенсионное обеспечение | 5,3 |
| Недвижимость и жильё | 4,7 |
| Наследство, кредиты, банкротство | 3,5 |

Лучше всего система справлялась с регламентированными процедурами: жалоба в прокуратуру, подача заявления о выдаче судебного приказа, обжалование бездействия инспектора ГИБДД. Там, где есть четкий порядок действий, результат был достойный – в кейсе с жалобой в прокуратуру итоговый документ клиенту на 95 % состоял из текста ИИ, юрист только подставила конкретные данные.
А лучший кейс года — исполнительное производство по алиментам. Цитата из отчёта: «Сам бы я так и проконсультировал»; «уточнил порядок взыскания денежных средств с работника — ответ меня шокировал, очень хороший, правильный, с примерами расчётов».
Хуже всего давались наследство, кредиты и банкротство — дела, где всё держится на многосубъектности и стыке отраслей. И отдельно отметим: группа «Недвижимость» просела не по юридическим причинам. В ней собрались самые тяжёлые кейсы с документами — та самая экспертиза на 75 страниц, устав ТСЖ, договор купли-продажи.
Общий диагноз года сформулировал один из юристов, и формулировка стала для нас рабочей:
«Бот выдаёт рамочный ответ, форму без проработки содержания. Это всё равно, что поговорить с начитанным, но глупым человеком — знает много, а синтезировать знания не может».
Что мы изменили
Из первого тестирования мы вынесли два урока — продуктовый и методический.
Продуктовый был очевиден: пока система падает на файлах, обсуждать качество правового анализа бессмысленно. Весь список технических претензий 2025 года ушел в разработку и к следующей волне был закрыт — в отчетах 2026 года эти проблемы не упоминаются ни разу.
Методический оказался интереснее. Свободные отзывы отлично показывают, что людей раздражает, но из них невозможно собрать картину: четыре субъективные оценки на двадцать дел — это не данные. Нужна была шкала.
Здесь и проявилась ценность работы именно с университетом. Собрать метрики для оценки юридического ИИ — само по себе исследовательская задача, и решали её вместе: мы понимали, что нужно измерить, а университет — как это корректно встроить в образовательный процесс.
В результате новое тестирование было встроено в программу стажировок по программе ТГУ «Специалист по цифровой трансформации юридической деятельности» (проект «Цифровые кафедры»). Здесь студенты разных вузов страны получают знания и навыки в области применения цифровых продуктов (в том числе ИИ), в юридической деятельности и в области участия в цифровой трансформации юридической функции. Результатом обучения для них становится стажировка у промышленного партнера, направленная на получение студентами новых, полезных для партнера результатов.
Одним из направлений стажировки стало тестирование ExplainLaw. В ней участвовали студенты, обучающиеся на программе и участвующие в деятельности юридических клиник в разных регионах России. Студенты, уже подготовленные к тому, чтобы проводить тестирование цифровых продуктов и способные сами готовить юридические заключения. К их работе можно было предъявлять более профессиональные требования.
Так появился протокол 2026 года: 6 групп, 100 кейсов, единый шаблон отчёта и шесть метрик по шкале 0–10.
| № | Метрика | Как считается |
|---|---|---|
| 1 | Точность норм | (Верных ссылок / Всего ссылок) × 10 |
| 2 | Актуальность материалов | (Актуальных источников / Всего источников) × 10 |
| 3 | Достоверность источников | max(0, 10 − N), где N — число неподтверждённых ссылок |
| 4 | Полнота правовой квалификации | (Раскрытых вопросов / Всего вопросов из заключения клиники) × 10 |
| 5 | Логика и структура | Экспертная оценка группы |
| 6 | Практическая применимость | Годится ли ответ как основа заключения без существенной доработки |
EXPLAINLAW_MARKDOWN_BLANK_LINE
Проверять стали заметно строже. Если в 2025-м вопрос звучал «существует ли такой акт», то в 2026-м добавились
- содержание акта, а не только реквизиты — ссылка может вести на реальное дело, посвящённое совсем другому спору;
- юрисдикция — соответствует ли указанный кассационный суд региону дела;
- конкретный пункт нормативного акта и его действующая редакция;
- адрес гиперссылки — куда она открывается на самом деле;
- региональные нормативы — учётные нормы жилья, местные льготы.
Планка выросла — и оценка 8,0 при такой проверке значит больше, чем 8,0 при первой методике
2026 год: что получилось
| Группа | Кейсов | Балл | Специализация выборки |
|---|---|---|---|
| 1 | 15 | 8,2 | гражданские, семейные, наследственные, ЗоЗПП, уголовные |
| 2 | 15 | 7,7 | гражданское, семейное, административное, образовательное |
| 3 | 18 | 8,3 | интеллектуальное, ЗоЗПП, медуслуги, страхование, трудовое |
| 4 | 18 | 7,5 | соцобеспечение, гражданский процесс, жилищное, корпоративные |
| 5 | 19 | 8,8 | банкротство, антимонопольное, уголовное, административное |
| 6 | 15 | 7,3 | межотраслевые, ЗоЗПП, семейное, налоговое, ОСАГО |
EXPLAINLAW_MARKDOWN_BLANK_LINE
Средневзвешенно по 100 кейсам — 8,0 из 10. Ни одна группа не опустилась ниже 7,3: результат устойчив на разных отраслях права и при разном составе экспертов. Провалов уровня «ответа не получили» не было ни одного.

Где нейросеть для юриста работает лучше всего
Все шесть групп независимо пришли к одному выводу: чем формализованнее регулирование, тем сильнее результат.
| Категория дел | Балл |
|---|---|
| Антимонопольные дела | 9,5–10 |
| Гражданско-правовые и договорные споры | 9,6–9,8 |
| Некачественное оказание медицинских услуг | ~9,0 |
| Страхование | 8,9 |
| Защита прав потребителей | 8,9 |
EXPLAINLAW_MARKDOWN_BLANK_LINE

В медицинских делах три кейса подряд получили максимум по большинству метрик. Причина, по мнению групп, в стандартизированной доказательной базе — акты экспертиз, полисы, фиксированные тарифы — и высокой повторяемости сценариев.
Группа 2 объяснила закономерность через метод правового регулирования: императивные отрасли даются нейросети легче диспозитивных. Административное и образовательное право построены на жёстких предписаниях, и там ИИ уверенно оперирует однозначными правилами. Гражданское и семейное держатся на оценочных понятиях — «разумность», «добросовестность», «баланс интересов», здесь человек пока нужнее.
Когда ИИ оказался точнее заключения юриста
Самые интересные кейсы — те, где сравнение сложилось в пользу системы:
- Международный элемент. В деле о разделе имущества за рубежом ИИ верно сделал упор на двустороннее соглашение с Молдовой 1995 года вместо многосторонней конвенции — выбрал более точное основание, чем человеческое заключение.
- Доказательства. Предложил легализовать электронную переписку через нотариуса. Этого приёма в заключении клиники не было.
- Смежные нормы. Обратил внимание на имущественное положение ответчика (ст. 1083 ГК РФ) — аспект, «который часто упускается практикующими юристами при подготовке стандартных исков».
- Наследственное дело. Привёл линию аргументации, которой в клинике не уделили внимания: определение автомобиля как неделимой вещи и преимущественное право наследования.
Оценка одной из групп: «По уровню логического построения аргументации ИИ не уступает, а в ряде случаев превосходит юриста-человека за счёт более широкого охвата смежных норм».
Ещё из отмеченного: скорость первичного анализа («вместо того чтобы вручную перелопачивать "Гарант" или "Консультант", ИИ выдаёт подборку за считанные секунды»), структура заключения, профессиональный язык, который «не требует стилистической правки», и знание специального законодательства — в деле о доступе к архивам система разобрала методические рекомендации Росархива и корректно применила 75-летний срок по ФЗ-125. Комментарий группы: «Такой уровень редко встретишь даже у практикующих юристов».
Точки роста
Список задач на доработку — главный результат тестирования. Вот основные направления и что мы по ним делаем.
Верификация судебной практики. Ключевое направление. Как и все большие языковые модели, система иногда приводит акты, которые не удаётся подтвердить в открытых источниках, или подбирает практику, близкую по теме, но не по правовой конструкции. Для юридического ИИ это критично: неподтвержденная ссылка обесценивает корректный по сути анализ. Группа 2 предложила рабочую гипотезу о причине — список источников формируется отдельно от мотивировочной части, поэтому в него попадают акты, не участвующие в рассуждении.
Региональное законодательство. В федеральных нормах система ориентируется уверенно, локальные акты — учётные нормы жилья, региональные льготы — учитывает не всегда.
Авторитетность и актуальность источников. Часть ссылок ведёт на справочные материалы СПС, которые не являются нормативными или судебными источниками. Ссылки на практику открываются в платной версии «Гаранта», доступной не всем, а свежие поправки попадают в базу с задержкой.
Глубина работы с фактами. Самая сложная задача. Студенты отметили, что система опирается на прямо названные обстоятельства, но не всегда достраивает связи между ними: в деле о строительном подряде она не обратила внимания, что заказчик подал иск до истечения срока работ по договору, а это сильный аргумент защиты. Не хватает и вариативности: юрист держит в уме две-три запасные линии, ИИ обычно предлагает одну.
Файлы, расчёты, интерфейс. Стабильное распознавание сканов, арифметика (сравнение дохода с прожиточным минимумом, расчёт госпошлины), заполненные процессуальные документы вместо шаблонов с пропусками.
Что даёт партнёрство университета и ИИ-стартапа
Если убрать из этой истории цифры, останется главное: ни одну из перечисленных находок мы не получили бы внутри команды.
Что стартап получает от вуза. Юридическая клиника работает с живыми обращениями граждан, а значит, у неё есть то, чего нет ни в одной синтетической выборке — эталон профессионального ответа по реальному делу. Сравнивать ответ ИИ можно только с ним. Плюс студенты, готовые вручную сверить сотни ссылок: адрес гиперссылки, юрисдикция кассационного суда, действующая редакция пункта — это работа, которую не сделает ни автотест, ни фокус-группа.
Что вуз получает от стартапа. Практику на живом продукте вместо учебных задач. Студенты не пересказывают учебник, а работают с реальной. развивающейся системой, формулируют метрики, спорят об оценках и видят, как их выводы попадают в бэклог разработки. Заодно осваивают то, что через пару лет станет базовым профессиональным навыком: как работать с ИИ и, главное, как его перепроверять: студент учится не доверять результату работы ИИ безоговорочно, а находить ошибки, оценивать ограничения и обосновывать собственный профессиональный вывод.
Еще один важный результат такого сотрудничества - «освоение» студентами новой роли юриста: от пользователя цифровых инструментов к участнику их проектирования и развития.
Насколько выросла сама исследовательская работа, видно по методике: за год она прошла путь от свободных отзывов до шести метрик с формулами, аналитики по отраслям и приоритизированных предложений по доработке. Группы стали считать средние баллы по категориям дел и объяснять разброс методом правового регулирования — это уже не пользовательский отзыв, а исследование.
Честное замечание о цифрах
Рост с 5,5 до 8,0 не означает, что вопрос верификации источников в 2025 году стоял менее остро. Скорее наоборот: тогда до сверки каждой ссылки часто просто не доходили — юристы упирались в более базовые вещи. Когда платформа стала стабильной, а методика строгой, задача проявилась в полный рост.
Часть «новых» замечаний 2026 года — не ухудшение продукта, а результат того, что впервые появился инструмент, способный такие вещи измерять. Собственно, ради этого всё и затевалось.
Что это значит для юриста-практика
- На типовых спорах с устоявшейся практикой — потребительских, страховых, медицинских, договорных — система даёт 9–10 из 10 и экономит часы на первичном анализе.
- На сложных межотраслевых делах ИИ полезен для структурирования и генерации гипотез, но стратегию выбирает юрист.
- Судебную практику нужно проверять. Это правило работы с любой языковой моделью в праве, а не особенность конкретного сервиса.
- Качество ответа сильно зависит от запроса — ролевая формулировка и разбивка на этапы повышают точность в разы.
Наша позиция за два года не изменилась: ExplainLaw — профессиональный инструмент юриста, а не замена юристу. Именно поэтому мы измеряем качество внешней экспертизой и публикуем результаты целиком.


