Let's Roleplay: Examining LLM Alignment in Collaborative Dialogues
2509.05882v1
cs.CL, cs.AI, cs.LG
2025-09-10
Авторы:
Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy
Резюме на русском
## Контекст
Коллаборативные диалоги, в которых AI-коллабораторы взаимодействуют с несколькими участниками, становятся важной областью исследования. Большинство существующих методик выравнивания LLMs разрабатываются для простых однопользовательских сценариев, не учитывая сложности многопользовательских, многократных взаимодействий. Эти динамики требуют новых подходов для обеспечения надежности и кредибильности AI в коллаборативных задачах. Мотивацией для данного исследования является значимость создания AI-коллабораторов, которые могут адекватно участвовать в групповых задачах, обеспечивая предсказуемость и эффективность взаимодействия.
## Метод
Исследование основывается на использовании метода ролевой игры, где AI-агенты применяются в качестве "friction agent" во время групповых диалогов, стимулируя участников к продолжительному рефлектирующему обсуждению. Модели тренировались с разными настройками, чтобы изучить их влияние на процесс коллаборации. Основной фокус данного исследования лежит на разработке нового фреймворка для оценки эффективности AI-коллабораторов, который измеряет изменения в групповых траекториях, верификацию версий и заключение взаимного договоренности.
## Результаты
В ходе экспериментов были проведены несколько ролевых игр с различными моделями AI-агентов, использующими различные методы выравнивания. Участники наблюдали за групповыми диалогами, в которых агенты вносили фракти-интервенции, стимулирующие группу к согласованию и рефлексивному анализу. Оценка проводилась с помощью разработанного квантитативного фреймворка, показавший что метод с friction-aware позволил достичь лучших результатов в достижении общего понимания и достижения задачи в отношении точности решений.
## Значимость
Результаты данного исследования демонстрируют, что метод friction-aware может быть применен в различных областях, где требуется улучшение качества коллаборации AI с человеком. Это включает групповые принятия решений, управление проектами и образовательные программы. Главным преимуществом является повышение точности решений и упрощение процесса достижения общих целей, что может увеличить эффективность в работе групп. Данный подход также открывает новые возможности для изучения интерактивных систем в будущих исследованиях.
## Выводы
Исследование показало, что friction-aware-approach эффективно повышает уровень коллаборативности в многопользовательских сценариях, стимулируя надежность и точность решений. На основе этого подхода, будущие исследования могут более подробно изучить динамики многопользовательских диалогов и развить новые методы для улуч
Abstract
As Large Language Models (LLMs) integrate into diverse workflows, they are
increasingly being considered "collaborators" with humans. If such AI
collaborators are to be reliable, their behavior over multiturn interactions
must be predictable, validated and verified before deployment. Common alignment
techniques are typically developed under simplified single-user settings and do
not account for the dynamics of long-horizon multiparty interactions. This
paper examines how different alignment methods affect LLM agents' effectiveness
as partners in multiturn, multiparty collaborations. We study this question
through the lens of friction agents that intervene in group dialogues to
encourage the collaborative group to slow down and reflect upon their reasoning
for deliberative decision-making. Using a roleplay methodology, we evaluate
interventions from differently-trained friction agents in collaborative task
conversations. We propose a novel counterfactual evaluation framework that
quantifies how friction interventions change the trajectory of group
collaboration and belief alignment. Our results show that a friction-aware
approach significantly outperforms common alignment baselines in helping both
convergence to a common ground, or agreed-upon task-relevant propositions, and
correctness of task outcomes.
Ссылки и действия
Дополнительные ресурсы: