Исследователи представили CriticGen, фреймворк для детальной оценки больших языковых моделей, который генерирует специфичные для каждого образца критерии и предоставляет действенные рекомендации для улучшения ответов. Система демонстрирует значительное повышение качества обратной связи и эффективности доработки.
Крис Уайт, директор Catalyst Lab в Microsoft Research, рассказал о своем пути от академических исследований до передовых технологических операций в Афганистане и разработки инструментов для борьбы с торговлей людьми в даркнете. Его карьера отмечена работой в DARPA и президентской наградой за выдающиеся усилия в борьбе с торговлей людьми.
Исследователи представили MERIT – новый бенчмарк для оценки долгосрочной памяти в LLM-агентах. Он измеряет полезность памяти для выполнения задач с учётом затрат, выявляя, как запомненные факты влияют на действия агента, а не только на его способность отвечать на вопросы.
Новое исследование выявило, что современные крупные языковые модели (LLM) склонны переоценивать негативные санкции за нарушение социальных норм, создавая более суровую картину социального взаимодействия, чем та, что наблюдается у людей. Это может привести к искажению представлений о социальном регулировании в критически важных областях.







































