PromptAlign: автоматическое итеративное выравнивание большой языковой модели под экспертную разметку без дообучения
Main Article Content
Аннотация
Большие языковые модели все активнее применяются в социальных и психологических науках, однако их предсказания систематически смещены относительно экспертной разметки (эффект смещения выравнивания, alignment shift), а попытки улучшить инструкции вручную или с помощью примеров приводят к так называемому эффекту «перетягивания одеяла» – деградации миноритарных классов.
В работе предложен PromptAlign – автоматический конвейер оптимизации инструкций, не требующий ни доступа к весам модели, ни участия человека в итеративной коррекции, так как таксономия и пространство признаков задаются экспертом априори. Конвейер извлекает гибридные лингвистические и семантические признаки с помощью большой языковой модели, строит на их основе интерпретируемые L1-логистические регрессии для локализации расхождений с экспертом, выполняет метаанализ ошибок и компилирует новые инструкции, управляя балансом через метрику индекса дисбаланса классов (Blanket Pulling Index, BPI). Эксперимент на корпусе, включающем 541 текст на русском языке, с тремя психологическими классами показал рост macro-F1 на отложенной тестовой выборке с 0.655 до 0.749 и минимальной классовой F1 с 0.449 до 0.656 (p > 0.99 по парному бутстрэп-тесту). Метод значимо превосходит базовые уровни — без примеров (zero-shot) и с подачей примеров (few-shot). Анализ вклада компонентов подтвердил критическую роль семантической интерпретации признаков и периодической перекомпоновки инструкций. Итоговая инструкция содержит пять правил, отражающих латентные критерии экспертов; в отличие от неинтерпретируемых моделей автоматических оптимизаторов, эти правила доступны для проверки и корректировки специалистом.
Article Details
Библиографические ссылки
2. Zhou Y., Muresanu A.I., Han Z., et al. Large Language Models Are Human-Level Prompt Engineers. arXiv preprint arXiv:2211.01910. 2023. https://doi.org/10.48550/arXiv.2211.01910 (дата обращения: 15.05.2025).
3. Yang C., Wang X., Lu Y., et al. Large Language Models as Optimizers. arXiv preprint arXiv:2309.03409. 2024. https://doi.org/10.48550/arXiv.2309.03409 (дата обращения: 15.05.2025).
4. Khattab O., Singhvi A., Maheshwari P., et al. DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines. arXiv preprint arXiv:2310.03714. 2023. https://doi.org/10.48550/arXiv.2310.03714 (дата обращения: 15.05.2025).
5. Brown T.B., Mann B., Ryder N., et al. Language Models are Few-Shot Learners // Advances in Neural Information Processing Systems. 2020. Vol. 33. P. 1877–1901.
6. Reynolds L., McDonell K. Prompt Programming for Large Language Models: Beyond the Few-Shot Paradigm // Extended Abstracts of the 2021 CHI Conference on Human Factors in Computing Systems. 2021. P. 1–7. https://doi.org/10.1145/3411763.3451760
7. Christiano P.F., Leike J., Brown T.B., et al. Deep Reinforcement Learning from Human Preferences // Advances in Neural Information Processing Systems. 2017. Vol. 30. P. 4299–4307.
8. Ouyang L., Wu J., Jiang X., et al. Training Language Models to Follow Instructions with Human Feedback // Advances in Neural Information Processing Systems. 2022. Vol. 35. P. 27730–27744.
9. Rafailov R., Sharma A., Mitchell E., et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model // Advances in Neural Information Processing Systems. 2023. Vol. 36. P. 53728–53741.
10. Wei J., Wang X., Schuurmans D., et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models // Advances in Neural Information Processing Systems. 2022. Vol. 35. P. 24824–24837.
11. Davidson T., Warmsley D., Macy M., Weber I. Automated Hate Speech Detection and the Problem of Offensive Language // Proceedings of the 11th International AAAI Conference on Web and Social Media. 2017. P. 512–515. https://doi.org/10.1609/icwsm.v11i1.14955
12. Zampieri M., Malmasi S., Nakov P., et al. Predicting the Type and Target of Offensive Posts in Social Media // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 2019. P. 1415–1420. https://doi.org/10.18653/v1/N19-1144
13. Kolhatkar V., Wu H., Cavasso L., et al. The SFU Opinion and Comments Corpus: A Corpus for the Analysis of Online News Comments // Corpus Pragmatics. 2020. Vol. 4, No. 2. P. 155–190. https://doi.org/10.1007/s41701-019-00065-w
14. Park G., Schwartz H.A., Eichstaedt J.C., et al. Automatic Personality Assessment through Social Media Language // Journal of Personality and Social Psychology. 2015. Vol. 108, No. 6. P. 934–952. https://doi.org/10.1037/pspp0000020
15. Tibshirani R. Regression Shrinkage and Selection via the Lasso // Journal of the Royal Statistical Society. Series B (Methodological). 1996. Vol. 58, No. 1. P. 267–288. https://doi.org/10.1111/j.2517-6161.1996.tb02080.x
16. Efron B. Bootstrap Methods: Another Look at the Jackknife // The Annals of Statistics. 1979. Vol. 7, No. 1. P. 1–26. https://doi.org/10.1214/aos/1176344552
17. Doshi-Velez F., Kim B. Towards a Rigorous Science of Interpretable Machine Learning. arXiv preprint arXiv:1702.08608. 2017. https://doi.org/10.48550/arXiv.1702.08608 (дата обращения: 15.05.2025).
18. Lipton Z.C. The Mythos of Model Interpretability // Communications of the ACM. 2018. Vol. 61, No. 10. P. 36–43. https://doi.org/10.1145/3233231
19. Van Hee C., Lefever E., Hoste V. We Usually Don’t Like Going to the Dentist: Using Common Sense to Detect Irony on Twitter // Computational Linguistics. 2018. Vol. 44, No. 4. P. 793–832. https://doi.org/10.1162/coli_a_00337

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Представляя статьи для публикации в журнале «Электронные библиотеки», авторы автоматически дают согласие предоставить ограниченную лицензию на использование материалов Казанскому (Приволжскому) федеральному университету (КФУ) (разумеется, лишь в том случае, если статья будет принята к публикации). Это означает, что КФУ имеет право опубликовать статью в ближайшем выпуске журнала (на веб-сайте или в печатной форме), а также переиздавать эту статью на архивных компакт-дисках журнала или включить в ту или иную информационную систему или базу данных, производимую КФУ.
Все авторские материалы размещены в журнале «Электронные библиотеки» с ведома авторов. В случае, если у кого-либо из авторов есть возражения против публикации его материалов на данном сайте, материал может быть снят при условии уведомления редакции журнала в письменной форме.
Документы, изданные в журнале «Электронные библиотеки», защищены законодательством об авторских правах, и все авторские права сохраняются за авторами. Авторы самостоятельно следят за соблюдением своих прав на воспроизводство или перевод их работ, опубликованных в журнале. Если материал, опубликованный в журнале «Электронные библиотеки», с разрешения автора переиздается другим издателем или переводится на другой язык, то ссылка на оригинальную публикацию обязательна.
Передавая статьи для опубликования в журнале «Электронные библиотеки», авторы должны принимать в расчет, что публикации в интернете, с одной стороны, предоставляют уникальные возможности доступа к их материалам, но, с другой, являются новой формой обмена информацией в глобальном информационном обществе, где авторы и издатели пока не всегда обеспечены защитой от неправомочного копирования или иного использования материалов, защищенных авторским правом.
При использовании материалов из журнала обязательна ссылка на URL: http://rdl-journal.ru. Любые изменения, дополнения или редактирования авторского текста недопустимы. Копирование отдельных фрагментов статей из журнала разрешается для научных исследований, персонального использования, коммерческого использования до тех пор, пока есть ссылка на оригинальную статью.
Запросы на право переиздания или использования любых материалов, опубликованных в журнале «Электронные библиотеки», следует направлять главному редактору Елизарову А.М. по адресу: amelizarov@gmail.com
Издатели журнала «Электронные библиотеки» не несут ответственности за точки зрения, излагаемые в публикуемых авторских статьях.
Предлагаем авторам статей загрузить с этой страницы, подписать и выслать в адрес издателя журнала по электронной почте скан Авторского договора о передаче неисключительных прав на использование произведения.