Сравнительный анализ архитектур многоагентных дебатов крупных языковых моделей в задаче поддержки принятия решений
https://doi.org/10.25682/NIISI.2026.2.0003
Аннотация
В статье представлен сравнительный анализ пяти архитектур многоагентных дебатов крупных языковых моделей в задаче поддержки принятия решений при оценке качества образовательных тестов. Цель исследования состояла в выявлении зависимости между топологией взаимодействия агентов и качеством решения, вычислительными затратами, временем ответа и устойчивостью результата, а также в определении условий, при которых применение многоагентных дебатов в системах поддержки принятия решений (СППР) является практически оправданным. На едином прикладном полигоне сопоставлялись базовая, линейная, циклическая, перекрестная архитектуры и архитектура с исключением модели. Корпус включал 60 тестов по четырем дисциплинам основного общего образования с разделением на корректные тесты и тесты с внесенными ошибками; ансамбль моделей был фиксирован и включал Qwen 2.5 72B Instruct, Grok 4.1 Fast и Gemma 4 26B-A4B IT. Для оценки использовались macro-F1, макро-средняя абсолютная ошибка, число токенов, стоимость на один тест и средняя длительность ответа. Установлено, что наибольшее наблюдаемое значение macro-F1 в рамках проведенного эксперимента показала архитектура с исключением модели, тогда как базовая архитектура оказалась лучшей по макро-средней абсолютной ошибке и сохранила сильные позиции по операционной эффективности. Дополнительно выявлено, что часть архитектур значительно чувствительна к типу теста, а увеличение числа раундов циклических дебатов после определенного порога не обеспечивает устойчивого прироста качества. Полученные результаты позволяют рассматривать архитектуру дебатов как управляемый параметр СППР, а не как нейтральную техническую деталь.
Список литературы
1. Du Y., Li S., Torralba A., Tenenbaum J. B., Mordatch I. Improving factuality and reasoning in language models through multiagent debate [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2305.14325. – URL: https://arxiv.org/abs/2305.14325 (дата обращения: 20.02.2026). – Текст: электронный.
2. Li Y., Du Y., Zhang J. [et al.]. Improving multi-agent debate with sparse communication topology // Findings of the Association for Computational Linguistics: EMNLP 2024. – 2024. – P. 7281–7294. – URL: https://arxiv.org/abs/2406.11776 (дата обращения: 30.06.2026).
3. Zheng L., Chiang W.-L., Sheng Y. [et al.]. Judging LLM-as-a-judge with MT-Bench and Chatbot Arena [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2306.05685. – URL: https://arxiv.org/abs/2306.05685 (дата обращения: 22.02.2026). – Текст: электронный.
4. Zhu L., Wang X., Wang X. JudgeLM: fine-tuned large language models are scalable judges [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2310.17631. – URL: https://arxiv.org/abs/2310.17631 (дата обращения: 25.02.2026). – Текст: электронный.
5. Guo T., Chen X., Wang Y. [et al.]. Large language model based multi-agents: a survey of progress and challenges // Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence. – 2024. – URL: https://arxiv.org/pdf/2402.01680 (дата обращения: 30.06.2026).
6. Shi Y., Liang R., Xu Y. EducationQ: evaluating LLMs’ teaching capabilities through multi-agent dialogue framework // Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. – 2025. – P. 32799–32828. – URL: https://arxiv.org/html/2504.14928 (дата обращения: 30.06.2026).
7. Аванесов В. С. Форма тестовых заданий: учебное пособие для учителей школ, лицеев, преподавателей вузов и колледжей. – 2-е изд., перераб. и расшир. – Москва: Центр тестирования, 2005. – 156 с.
8. Челышкова М. Б. Теория и практика конструирования педагогических тестов. – Москва: Логос, 2002. – 432 с.
9. Приказ Министерства просвещения Российской Федерации от 31.05.2021 № 287 «Об утверждении федерального государственного образовательного стандарта основного общего образования» [Электронный ресурс]. URL: https://publication.pravo.gov.ru/Document/View/0001202107050027 (дата обращения: 13.03.2026). – Текст: электронный.
10. Федеральный институт педагогических измерений. Аналитические и методические материалы по разработке и оцениванию контрольных измерительных материалов [Электронный ресурс]. – URL: https://fipi.ru/ege/analiticheskie-i-metodicheskie-materialy (дата обращения: 13.03.2026). – Текст: электронный.
Рецензия
Для цитирования:
Магомедов Ш.М. Сравнительный анализ архитектур многоагентных дебатов крупных языковых моделей в задаче поддержки принятия решений. Труды НИИСИ. 2026;16(2):26-31. https://doi.org/10.25682/NIISI.2026.2.0003
For citation:
Magomedov Sh.M. Comparative analysis of multi-agent debate architectures of large language models in decision support. SRISA Proceedings. 2026;16(2):26-31. (In Russ.) https://doi.org/10.25682/NIISI.2026.2.0003
JATS XML