О повышении качества RAG при выявлении противоречий в судебных постановлениях

Main Article Content

Аннотация

Настоящее исследование является продолжением работы над пилотной системой по детекции противоречий в судебных постановлениях, целью которой является выявление противоречий между судебными постановлениями по делам об административных правонарушениях и регулирующими нормами. Представленный ранее пайплайн, включающий правиловую предобработку документов, поиск по репозиторию правовых норм и дообучение LLM с использованием адаптера LoRA, обеспечил приемлемый уровень качества [1], однако имел ряд ограничений, связанных с компонентом RAG. В отличие от LLM, RAG не обучался на юридических текстах, что приводило к потере релевантных для сопоставления фрагментов на этапе поиска сходных текстовых пар, в связи с чем проведен анализ качества RAG и выполнено улучшение RAG-части системы.


Для оценки полноты извлечения данных созданы датасет из 30 документов и автоматические тесты, содержащие все пары релевантных для сопоставления предложений из данного датасета (более ста пар). На этих данных рассчитана полнота для исходной версии модели, использующей эмбеддинги предложений sbert_large_nlu_ru для создания векторной базы и вычисления косинусной близости.


Для повышения полноты извлекаемых данных проведены следующие эксперименты: (1) дообучение исходных эмбеддингов на обучающем датасете; (2) добавление модели-ранжировщика с дообучением и без; (3) комбинирование вариаций «базовые/дообученные эмбеддинги» и «базовый/дообученный ранжировщик» на нескольких версиях параметра top_k (количество извлекаемых соответствий); (4) замена модели эмбеддингов предложений на другие варианты. В результате существенно повысилось качество RAG – с 72% до 90%, однако увеличение количества извлекаемых фрагментов снизило общую точность системы, что требует ее дальнейшей калибровки. Кроме того, проведены реорганизация базы кодексов, расширение тестовой выборки и улучшение алгоритма фильтрации нерелевантных предложений из постановлений.

Article Details

Как цитировать
Козлова, Е. А., А. М. Баюк, и М. А. Петрова. «О повышении качества RAG при выявлении противоречий в судебных постановлениях». Электронные библиотеки, т. 29, вып. 6, октябрь 2026 г., сс. 2105-33, doi:10.26907/1562-5419-2026-29-6-2105-2133.

Библиографические ссылки

1. Kozlova E., Petrova M., Baiuk A. Contradiction Detection in Administrative Offense Rulings: A Case Study Analysis // Proc. of Conference on Computational Linguistics and Intellectual Technologies Dialog-2026. 2026. P. 294–310.
2. Harabagiu S., Hickl A., Lacatusu F. Negation, contrast and contradiction in text processing // Proc. of the 21st National Conference on Artificial Intelligence (AAAI-06). 2006. P. 755–762.
3. De Marneffe M.-C., Rafferty A.N., Manning C.D. Finding contradictions in text // Proc. of the 46th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies (ACL-08: HLT). 2008. P. 1039–1047.
4. Mehdad Y., Negri M., Federico M. Towards cross-lingual textual entailment // Proc. of the 2010 Annual Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT 2010). 2010. P. 321–324.
5. Bowman S., Angeli G., Potts C., Manning C.D. A large annotated corpus for learning natural language inference // arXiv:1508.05326. 2015. https://doi.org/10.48550/arXiv.1508.05326
6. Dragos V. Detection of contradictions by relation matching and uncertainty assessment // Procedia Computer Science. 2017. Vol. 112. P. 71–80.
7. Pielka M., et al. A linguistic investigation of machine learning based contradiction detection models: an empirical analysis and future perspectives // arXiv:2210.10434. 2022. https://doi.org/10.48550/arXiv.2210.10434
8. Putra I M. S., Siahaan D., Saikhu A. Recognizing textual entailment: a review of resources, approaches, applications, and challenges // ICT Express. 2024. Vol. 10, No. 1. P. 132–155. https://doi.org/10.1016/j.icte.2023.08.012
9. Shajalal M., et al. Textual entailment recognition with semantic features from empirical text representation // arXiv:2210.09723v4. 2022. https://doi.org/10.48550/arXiv.2210.09723
10. Rahimi Z., ShamsFard M. A knowledge-based approach for recognizing textual entailments with a focus on causality and contradiction // Research Square preprint. 2024. https://doi.org/10.21203/rs.3.rs-3826973/v1
11. Asif M., Ahmed Khan T., Song W.-C. Evaluating large language models for optimized intent translation and contradiction detection using KNN in IBN // IEEE Access. 2025. Vol. 13. P. 20316–20327.
12. Wu X., Niu X., Rahman R. Topological analysis of contradictions in text // Proc. of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2022). 2022. P. 2478–2483. https://doi.org/10.1145/3477495.3531881
13. Williams A., Nangia N., Bowman S. A broad-coverage challenge corpus for sentence understanding through inference // Proc. of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT 2018). 2018. P. 1112–1122. https://doi.org/10.18653/v1/N18-1101
14. Camarda A.D., Ianni G. A study on contradiction detection using a neuro-symbolic approach // Proc. of 40th Italian Conference on Computational Logic (CILC 2025). 2025, paper 08.
15. Feng X., Hunter A. Identification of entailment and contradiction relations between natural language sentences: a neurosymbolic approach //
arXiv:2405.01259. 2024. https://doi.org/10.48550/arXiv.2405.01259
16. Walton D., Reed C. Argumentation schemes and defeasible inferences // Working Notes of the ECAI 2002 Workshop on Computational Models of Natural Argument (CMNA 2002). 2002. P. 45–55.
17. Ibraim S.S., Mendonça P.C.C. Book Review: «Argumentation Schemes» // Ensaio Pesquisa em Educação em Ciências. 2013. Vol. 15, No. 3. P. 255–262.
18. Walton D. Legal argumentation and evidence // Penn State University Press, 2010. 392 p.
19. Mantravadi A., et al. LegalWiz: a multi-agent generation framework for contradiction detection in legal documents // arXiv:2510.03418. 2025. https://doi.org/10.48550/arXiv.2510.03418
20. Koreeda Y., Manning C.D. ContractNLI: a dataset for document-level natural language inference for contracts // Findings of the Association for Computational Linguistics: EMNLP 2021. 2021, P. 1907–1919. https://doi.org/10.18653/v1/2021.findings-emnlp.164
21. Nguyen H.-T., et al. Transformer-based approaches for legal text processing: JNLP team – COLIEE 2021 // The Review of Socionetwork Strategies. 2022. Vol. 16, No. 1. P. 135–155. https://doi.org/10.1007/s12626-022-00102-2
22. Nguyen C., et al. CAPTAIN at COLIEE 2023: efficient methods for legal information retrieval and entailment tasks // arXiv:2401.03551. 2024. https://doi.org/10.48550/arXiv.2401.03551
23. Aires J.P., Strube de Lima V.L., Meneguzzi F. Identifying potential conflicts between norms in contracts // 18th International Workshop on Coordination, Organizations, Institutions, and Norms (COIN 2015). 2016. P. 179–188.
24. Surana S., Dembla S., Bihani P. Identifying contradictions in the legal proceedings using natural language models // SN Computer Science. 2022. Vol. 3, No. 3. Art. no. 187. https://doi.org/10.1007/s42979-022-01075-3
25. Ariai F., Mackenzie J., Demartini G. Natural language processing for the legal domain: a survey of tasks, datasets, models, and challenges // ACM Computing Surveys. 2025. Vol. 58, No. 6. P. 1–37. https://doi.org/10.48550/arXiv.2410.21306
26. Hosseini M.J., Petrov A., Fabrikant A., Louis A. A synthetic data approach for domain generalization of NLI models // Proc. of the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024). 2024. P. 2212–2226. https://doi.org/10.18653/v1/2024.acl-long.120


Наиболее читаемые статьи этого автора (авторов)