Существующие методы оценки больших языковых моделей (БЯМ) часто страдают от недостаточной детализации и оторванности от процесса генерации, что приводит к общим объяснениям, не дающим конкретных указаний для улучшения моделей. В ответ на эту проблему был предложен CriticGen — фреймворк для детальной, учитывающей генерацию оценки, который преобразует процесс оценивания в действенный механизм контроля для улучшения ответов. CriticGen сначала генерирует специфичные для каждого образца измерения оценки и критерии выставления баллов в рамках высокоуровневых категорий, таких как субъективные, объективные и самопроизводные ограничения. Эти критерии затем служат динамической рубрикой для совместного формирования оценки, обоснования, исполняемого предложения по доработке и улучшенного ответа. Этот процесс доработки, обусловленный рубрикой, позволяет моделям диагностировать недостатки и целенаправленно улучшать ответы.
Методология CriticGen
CriticGen отходит от традиционных подходов, предлагая многоступенчатую систему. На первом этапе фреймворк создает уникальные для каждого сгенерированного ответа критерии оценки и правила выставления баллов. Эти критерии категоризируются по трем основным направлениям: субъективные аспекты (например, стиль, тон), объективные параметры (фактическая точность) и самопроизвольные ограничения (внутренние правила или инструкции, заданные модели). Такой подход обеспечивает высокую степень адаптивности и релевантности оценки для каждого конкретного случая, в отличие от универсальных методов.
После определения критериев, CriticGen использует их как динамическую рубрику. Эта рубрика служит основой для одновременного формирования нескольких ключевых элементов: числовой оценки качества ответа, подробного обоснования этой оценки, конкретного и выполнимого предложения по доработке, а также непосредственно улучшенного варианта ответа. Такой интегрированный процесс позволяет моделям не только выявлять ошибки, но и получать четкие инструкции по их исправлению, что является критически важным для итеративного улучшения производительности.
Результаты экспериментов и эффективность
Экспериментальные данные подтверждают, что детальная оценка должна быть как специфичной для каждого экземпляра, так и действенной. CriticGen продемонстрировал способность генерировать более качественные рубрики, улучшая показатели релевантности и охвата с 3.33/4.03 до 3.97/4.24 соответственно. Это указывает на то, что критерии, созданные CriticGen, более точно отражают потребности оценки и охватывают широкий спектр важных аспектов ответа.
Кроме того, CriticGen достиг наилучших корреляций оценок, с коэффициентом Пирсона 0.9556 и коэффициентом Спирмена 0.9560. Эти высокие значения корреляции свидетельствуют о том, что оценки, выставленные CriticGen, очень точно соответствуют человеческим оценкам. Фреймворк также значительно повысил F1-меру для обоснованных критериями причин и выполнимых предложений с 0.6369/0.5994 до 0.7554/0.7900, что подчеркивает улучшение качества и применимости генерируемой обратной связи. Самое главное, обратная связь от CriticGen привела к надежному улучшению ответов: 73.17% ответов были улучшены, при этом 93.28% ответов не ухудшились после доработки.
Источник: cs.AI updates on arXiv.org





































