Аннотация:
Большие языковые модели все активнее применяются в социальных и психологических науках, однако их предсказания систематически смещены относительно экспертной разметки (эффект смещения выравнивания, alignment shift), а попытки улучшить инструкции вручную или с помощью примеров приводят к так называемому эффекту «перетягивания одеяла» – деградации миноритарных классов.
В работе предложен PromptAlign – автоматический конвейер оптимизации инструкций, не требующий ни доступа к весам модели, ни участия человека в итеративной коррекции, так как таксономия и пространство признаков задаются экспертом априори. Конвейер извлекает гибридные лингвистические и семантические признаки с помощью большой языковой модели, строит на их основе интерпретируемые L1-логистические регрессии для локализации расхождений с экспертом, выполняет метаанализ ошибок и компилирует новые инструкции, управляя балансом через метрику индекса дисбаланса классов (Blanket Pulling Index, BPI). Эксперимент на корпусе, включающем 541 текст на русском языке, с тремя психологическими классами показал рост macro-F1 на отложенной тестовой выборке с 0.655 до 0.749 и минимальной классовой F1 с 0.449 до 0.656 (p > 0.99 по парному бутстрэп-тесту). Метод значимо превосходит базовые уровни — без примеров (zero-shot) и с подачей примеров (few-shot). Анализ вклада компонентов подтвердил критическую роль семантической интерпретации признаков и периодической перекомпоновки инструкций. Итоговая инструкция содержит пять правил, отражающих латентные критерии экспертов; в отличие от неинтерпретируемых моделей автоматических оптимизаторов, эти правила доступны для проверки и корректировки специалистом.