<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.3 20210610//EN" "JATS-journalpublishing1-3.dtd">
<article article-type="research-article" dtd-version="1.3" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xml:lang="ru"><front><journal-meta><journal-id journal-id-type="publisher-id">trudyniisi</journal-id><journal-title-group><journal-title xml:lang="ru">Труды НИИСИ</journal-title><trans-title-group xml:lang="en"><trans-title>SRISA Proceedings</trans-title></trans-title-group></journal-title-group><issn pub-type="ppub">2225-7349</issn><issn pub-type="epub">3033-6422</issn><publisher><publisher-name>НИЦ «КУРЧАТОВСКИЙ ИНСТИТУТ» - НИИСИ</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.25682/NIISI.2026.2.0003</article-id><article-id custom-type="elpub" pub-id-type="custom">trudyniisi-154</article-id><article-categories><subj-group subj-group-type="heading"><subject>Research Article</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="ru"><subject>СИСТЕМНЫЙ АНАЛИЗ, УПРАВЛЕНИЕ И ОБРАБОТКА ИНФОРМАЦИИ, СТАТИСТИКА</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="en"><subject>SYSTEM ANALYSIS, CONTROL, INFORMATION PROCESSING, STATISTICS</subject></subj-group></article-categories><title-group><article-title>Сравнительный анализ архитектур многоагентных дебатов крупных языковых моделей в задаче поддержки принятия решений</article-title><trans-title-group xml:lang="en"><trans-title>Comparative analysis of multi-agent debate architectures of large language models  in decision support</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author" corresp="yes"><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Магомедов</surname><given-names>Ш. М.</given-names></name><name name-style="western" xml:lang="en"><surname>Magomedov</surname><given-names>Sh. M.</given-names></name></name-alternatives><email xlink:type="simple">shakhmanay.magomedov@mail.ru</email><xref ref-type="aff" rid="aff-1"/></contrib></contrib-group><aff xml:lang="ru" id="aff-1"><institution>Дагестанский государственный технический университет, Махачкала</institution><country>Russian Federation</country></aff><pub-date pub-type="collection"><year>2026</year></pub-date><pub-date pub-type="epub"><day>22</day><month>07</month><year>2026</year></pub-date><volume>16</volume><issue>2</issue><fpage>26</fpage><lpage>31</lpage><permissions><copyright-statement>Copyright &amp;#x00A9; Магомедов Ш.М., 2026</copyright-statement><copyright-year>2026</copyright-year><copyright-holder xml:lang="ru">Магомедов Ш.М.</copyright-holder><copyright-holder xml:lang="en">Magomedov S.M.</copyright-holder><license xml:lang="ru" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>Данная работа распространяется под лицензией Creative Commons Attribution 4.0.</license-p></license><license xml:lang="en" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>This work is licensed under a Creative Commons Attribution 4.0 License.</license-p></license></permissions><self-uri xlink:href="https://www.t-niisi.ru/jour/article/view/154">https://www.t-niisi.ru/jour/article/view/154</self-uri><abstract><p>В статье представлен сравнительный анализ пяти архитектур многоагентных дебатов крупных языковых моделей в задаче поддержки принятия решений при оценке качества образовательных тестов. Цель исследования состояла в выявлении зависимости между топологией взаимодействия агентов и качеством решения, вычислительными затратами, временем ответа и устойчивостью результата, а также в определении условий, при которых применение многоагентных дебатов в системах поддержки принятия решений (СППР) является практически оправданным. На едином прикладном полигоне сопоставлялись базовая, линейная, циклическая, перекрестная архитектуры и архитектура с исключением модели. Корпус включал 60 тестов по четырем дисциплинам основного общего образования с разделением на корректные тесты и тесты с внесенными ошибками; ансамбль моделей был фиксирован и включал Qwen 2.5 72B Instruct, Grok 4.1 Fast и Gemma 4 26B-A4B IT. Для оценки использовались macro-F1, макро-средняя абсолютная ошибка, число токенов, стоимость на один тест и средняя длительность ответа. Установлено, что наибольшее наблюдаемое значение macro-F1 в рамках проведенного эксперимента показала архитектура с исключением модели, тогда как базовая архитектура оказалась лучшей по макро-средней абсолютной ошибке и сохранила сильные позиции по операционной эффективности. Дополнительно выявлено, что часть архитектур значительно чувствительна к типу теста, а увеличение числа раундов циклических дебатов после определенного порога не обеспечивает устойчивого прироста качества. Полученные результаты позволяют рассматривать архитектуру дебатов как управляемый параметр СППР, а не как нейтральную техническую деталь.</p></abstract><trans-abstract xml:lang="en"><p>The paper presents a comparative analysis of five multi-agent debate architectures of large language models in a decision-support task related to evaluating the quality of educational tests. The study aims to identify how communication topology affects decision quality, computational cost, latency, and robustness. A unified experimental setting was used to compare a baseline, linear, cyclic, cross, and model-elimination architecture. The corpus comprised 60 tests from four school disciplines split into correct and errors subsets, while the model ensemble included Qwen 2.5 72B Instruct, Grok 4.1 Fast, and Gemma 4 26B-A4B IT. The main evaluation metrics were macro-F1 for detecting problematic questions, macro-MAE for the numerical assessment of test quality, and token usage, cost per test, and response time for operational comparison. The results show that the model-elimination architecture achieved the highest observed macro-F1 within the experiment, while the baseline architecture remained superior in macro-MAE and cost-efficiency. The study also demonstrates that some debate architectures are highly sensitive to the type of test and that increasing the number of rounds does not guarantee sustained quality improvement. The findings support treating debate architecture as a controllable design parameter of decision-support systems rather than as a neutral implementation detail.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>крупные языковые модели</kwd><kwd>многоагентные дебаты</kwd><kwd>поддержка принятия решений</kwd><kwd>образовательные тесты</kwd><kwd>языковая модель-судья</kwd><kwd>macro-F1</kwd><kwd>архитектура взаимодействия</kwd></kwd-group><kwd-group xml:lang="en"><kwd>large language models</kwd><kwd>multi-agent debate</kwd><kwd>decision support</kwd><kwd>educational tests</kwd><kwd>LLM-as-a-Judge</kwd><kwd>macro-F1</kwd><kwd>interaction architecture</kwd></kwd-group></article-meta></front><back><ref-list><title>References</title><ref id="cit1"><label>1</label><citation-alternatives><mixed-citation xml:lang="ru">Du Y., Li S., Torralba A., Tenenbaum J. B., Mordatch I. Improving factuality and reasoning in language models through multiagent debate [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2305.14325. – URL: https://arxiv.org/abs/2305.14325 (дата обращения: 20.02.2026). – Текст: электронный.</mixed-citation><mixed-citation xml:lang="en">Du Y., Li S., Torralba A., Tenenbaum J. B., Mordatch I. Improving factuality and reasoning in language models through multiagent debate [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2305.14325. – URL: https://arxiv.org/abs/2305.14325 (дата обращения: 20.02.2026). – Текст: электронный.</mixed-citation></citation-alternatives></ref><ref id="cit2"><label>2</label><citation-alternatives><mixed-citation xml:lang="ru">Li Y., Du Y., Zhang J. [et al.]. Improving multi-agent debate with sparse communication topology // Findings of the Association for Computational Linguistics: EMNLP 2024. – 2024. – P. 7281–7294. – URL: https://arxiv.org/abs/2406.11776 (дата обращения: 30.06.2026).</mixed-citation><mixed-citation xml:lang="en">Li Y., Du Y., Zhang J. [et al.]. Improving multi-agent debate with sparse communication topology // Findings of the Association for Computational Linguistics: EMNLP 2024. – 2024. – P. 7281–7294. – URL: https://arxiv.org/abs/2406.11776 (дата обращения: 30.06.2026).</mixed-citation></citation-alternatives></ref><ref id="cit3"><label>3</label><citation-alternatives><mixed-citation xml:lang="ru">Zheng L., Chiang W.-L., Sheng Y. [et al.]. Judging LLM-as-a-judge with MT-Bench and Chatbot Arena [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2306.05685. – URL: https://arxiv.org/abs/2306.05685 (дата обращения: 22.02.2026). – Текст: электронный.</mixed-citation><mixed-citation xml:lang="en">Zheng L., Chiang W.-L., Sheng Y. [et al.]. Judging LLM-as-a-judge with MT-Bench and Chatbot Arena [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2306.05685. – URL: https://arxiv.org/abs/2306.05685 (дата обращения: 22.02.2026). – Текст: электронный.</mixed-citation></citation-alternatives></ref><ref id="cit4"><label>4</label><citation-alternatives><mixed-citation xml:lang="ru">Zhu L., Wang X., Wang X. JudgeLM: fine-tuned large language models are scalable judges [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2310.17631. – URL: https://arxiv.org/abs/2310.17631 (дата обращения: 25.02.2026). – Текст: электронный.</mixed-citation><mixed-citation xml:lang="en">Zhu L., Wang X., Wang X. JudgeLM: fine-tuned large language models are scalable judges [Электронный ресурс] // arXiv.org. – 2023. – arXiv: 2310.17631. – URL: https://arxiv.org/abs/2310.17631 (дата обращения: 25.02.2026). – Текст: электронный.</mixed-citation></citation-alternatives></ref><ref id="cit5"><label>5</label><citation-alternatives><mixed-citation xml:lang="ru">Guo T., Chen X., Wang Y. [et al.]. Large language model based multi-agents: a survey of progress and challenges // Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence. – 2024. – URL: https://arxiv.org/pdf/2402.01680 (дата обращения: 30.06.2026).</mixed-citation><mixed-citation xml:lang="en">Guo T., Chen X., Wang Y. [et al.]. Large language model based multi-agents: a survey of progress and challenges // Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence. – 2024. – URL: https://arxiv.org/pdf/2402.01680 (дата обращения: 30.06.2026).</mixed-citation></citation-alternatives></ref><ref id="cit6"><label>6</label><citation-alternatives><mixed-citation xml:lang="ru">Shi Y., Liang R., Xu Y. EducationQ: evaluating LLMs’ teaching capabilities through multi-agent dialogue framework // Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. – 2025. – P. 32799–32828. – URL: https://arxiv.org/html/2504.14928 (дата обращения: 30.06.2026).</mixed-citation><mixed-citation xml:lang="en">Shi Y., Liang R., Xu Y. EducationQ: evaluating LLMs’ teaching capabilities through multi-agent dialogue framework // Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. – 2025. – P. 32799–32828. – URL: https://arxiv.org/html/2504.14928 (дата обращения: 30.06.2026).</mixed-citation></citation-alternatives></ref><ref id="cit7"><label>7</label><citation-alternatives><mixed-citation xml:lang="ru">Аванесов В. С. Форма тестовых заданий: учебное пособие для учителей школ, лицеев, преподавателей вузов и колледжей. – 2-е изд., перераб. и расшир. – Москва: Центр тестирования, 2005. – 156 с.</mixed-citation><mixed-citation xml:lang="en">Аванесов В. С. Форма тестовых заданий: учебное пособие для учителей школ, лицеев, преподавателей вузов и колледжей. – 2-е изд., перераб. и расшир. – Москва: Центр тестирования, 2005. – 156 с.</mixed-citation></citation-alternatives></ref><ref id="cit8"><label>8</label><citation-alternatives><mixed-citation xml:lang="ru">Челышкова М. Б. Теория и практика конструирования педагогических тестов. – Москва: Логос, 2002. – 432 с.</mixed-citation><mixed-citation xml:lang="en">Челышкова М. Б. Теория и практика конструирования педагогических тестов. – Москва: Логос, 2002. – 432 с.</mixed-citation></citation-alternatives></ref><ref id="cit9"><label>9</label><citation-alternatives><mixed-citation xml:lang="ru">Приказ Министерства просвещения Российской Федерации от 31.05.2021 № 287 «Об утверждении федерального государственного образовательного стандарта основного общего образования» [Электронный ресурс]. URL: https://publication.pravo.gov.ru/Document/View/0001202107050027 (дата обращения: 13.03.2026). – Текст: электронный.</mixed-citation><mixed-citation xml:lang="en">Приказ Министерства просвещения Российской Федерации от 31.05.2021 № 287 «Об утверждении федерального государственного образовательного стандарта основного общего образования» [Электронный ресурс]. URL: https://publication.pravo.gov.ru/Document/View/0001202107050027 (дата обращения: 13.03.2026). – Текст: электронный.</mixed-citation></citation-alternatives></ref><ref id="cit10"><label>10</label><citation-alternatives><mixed-citation xml:lang="ru">Федеральный институт педагогических измерений. Аналитические и методические материалы по разработке и оцениванию контрольных измерительных материалов [Электронный ресурс]. – URL: https://fipi.ru/ege/analiticheskie-i-metodicheskie-materialy (дата обращения: 13.03.2026). – Текст: электронный.</mixed-citation><mixed-citation xml:lang="en">Федеральный институт педагогических измерений. Аналитические и методические материалы по разработке и оцениванию контрольных измерительных материалов [Электронный ресурс]. – URL: https://fipi.ru/ege/analiticheskie-i-metodicheskie-materialy (дата обращения: 13.03.2026). – Текст: электронный.</mixed-citation></citation-alternatives></ref></ref-list><fn-group><fn fn-type="conflict"><p>The authors declare that there are no conflicts of interest present.</p></fn></fn-group></back></article>
