Новое исследование выявило, что современные крупные языковые модели (LLM) склонны переоценивать негативные санкции за нарушение социальных норм, создавая более суровую картину социального взаимодействия, чем та, что наблюдается у людей. Это может привести к искажению представлений о социальном регулировании в критически важных областях.
Исследователи представили CriticGen, фреймворк для детальной оценки больших языковых моделей, который генерирует специфичные для каждого образца критерии и предоставляет действенные рекомендации для улучшения ответов. Система демонстрирует значительное повышение качества обратной связи и эффективности доработки.
Крис Уайт, директор Catalyst Lab в Microsoft Research, рассказал о своем пути от академических исследований до передовых технологических операций в Афганистане и разработки инструментов для борьбы с торговлей людьми в даркнете. Его карьера отмечена работой в DARPA и президентской наградой за выдающиеся усилия в борьбе с торговлей людьми.
Исследователи представили MERIT – новый бенчмарк для оценки долгосрочной памяти в LLM-агентах. Он измеряет полезность памяти для выполнения задач с учётом затрат, выявляя, как запомненные факты влияют на действия агента, а не только на его способность отвечать на вопросы.

ПОДПИШИСЬ

82,000ПодписчикиПодписаться
- Продвижение -
Радио Красная волна

ПОСЛЕДНИЕ ПОСТЫ