رفتن به محتوای اصلی
خوشه‌ی چندایجنتی · مقاله‌ی ۰۱

مناظره‌ی مدل‌های هوش مصنوعی: چرا چند LLM با هم لزوماً باهوش‌تر نیستند

ایده وسوسه‌انگیز است: به‌جای یک مدل، سه مدل را وادار کن پاسخ همدیگر را نقد کنند. اما این ایده‌ی تازه‌ای نیست — بازآزماییِ یک قضیه‌ی ۲۴۰ ساله است، و شواهد ۲۰۲۵ نشان داد مناظره دقیقاً شرطی را نقض می‌کند که آن قضیه بر آن بنا شده.

فتیم فنی فیلتور به‌روزرسانی: ۶ مرداد ۱۴۰۵ ۳۲ دقیقه مطالعه ۲۰ منبع
تصویر شاخص مقاله مناظره‌ی مدل‌های هوش مصنوعی؛ یک متخصص ایرانی در حال بررسی شبکه‌ی سه ایجنت هوش مصنوعی و گفت‌وگوی میان آن‌ها
نمایی مفهومی از مناظره‌ی چندایجنتی: سه مدل زبانی در حال تبادل استدلال و بازبینی پاسخ‌ها، با تمرکز بر تحلیل، داوری و تصمیم‌گیری بهتر.
۱۷۸۵سال طرح قضیه‌ای که پایه‌ی ریاضی این ایده است
۸۱٫۸٪دقت مناظره در برابر ۶۷٪ ایجنت تکی، در آزمایش ۲۰۲۳
مارتینگلچارچوب نظری ۲۰۲۵: بخش عمده‌ی سود از رأی‌گیری می‌آید
۸۸٪دقت داور غیرمتخصص با مناظره، در برابر ۶۰٪ بدون آن
خوشه‌ی تخصصی سیستم‌های چندایجنتی

مسیر کامل از انتخاب معماری تا عیب‌یابی و تجارت

این پنج مقاله یک مجموعه‌ی پیوسته‌اند؛ صفحه‌ی مادر نقشه را می‌دهد و چهار مقاله‌ی بعدی هر مسئله را عمیق و مستقل بررسی می‌کنند.

مرجعسیستم چندایجنتی چیست؟نقشه‌ی جامع معماری‌ها، الگوهای همکاری، هزینه و پروتکل‌ها.
۰۱مناظره‌ی مدل‌های هوش مصنوعیمناظره، رأی‌گیری و داوری؛ چه زمانی سود می‌دهد و چه زمانی نه.
۰۲چندایجنتی یا تک‌ایجنتی؟سه معیار عددی برای انتخاب معماری پیش از شروع پیاده‌سازی.۰۳چرا سیستم‌های چندایجنتی شکست می‌خورند؟۱۴ مود شکست، نشانه‌های تشخیص و اصلاح معماری.۰۴مذاکره‌ی ایجنت‌به‌ایجنتچانه‌زنی، پرداخت عامل‌محور و مرزهای امن تجارت ایجنتی.
ترتیب پیشنهادی: ابتدا راهنمای مرجع؛ سپس مقاله‌ای که با مسئله‌ی واقعی شما هماهنگ است.بررسی رایگان معماری پروژه ←
۰۱

آنچه شواهد می‌گویند

در سه سال گذشته، ده‌ها مقاله‌ی پژوهشی این پرسش را آزمودند که آیا چند مدل زبانی که با هم بحث می‌کنند به پاسخ بهتری می‌رسند یا نه. پاسخ کوتاه «بله» نیست، «نه» هم نیست — پاسخ این است که سودِ مشاهده‌شده از جای دیگری می‌آید و ما سه سال آن را اشتباه نسبت داده‌ایم.

  • موج اول (۲۰۲۳). سه مدل با دو راند مناظره، دقت حساب را از ۶۷٪ به ۸۱٫۸٪ و MMLU را از ۶۳٫۹٪ به ۷۱٫۱٪ رساندند۵. جامعه‌ی فنی نتیجه گرفت «چند مدل بهتر از یکی است».
  • تردید (۲۰۲۴). یک مقایسه‌ی سیستماتیک نشان داد مناظره به‌طور قابل‌اتکا از روش‌های ساده‌تری مثل self-consistency بهتر نیست — فقط بسیار حساس‌تر به تنظیمات است۸.
  • ضربه‌ی اصلی (۲۰۲۵). در چارچوب نظری مقاله‌ی «Debate or Vote»، مسیر باور ایجنت‌ها به‌صورت مارتینگل مدل‌سازی شد؛ نتیجه این بود که تحت فرض‌های همان مدل، بحث به‌تنهایی امید ریاضیِ درستی را بالا نمی‌برد و بخش عمده‌ی سود از رأی‌گیری اکثریت می‌آید۱۱.
  • ریشه‌ی مسئله. رأی‌گیری وقتی کار می‌کند که آرا مستقل باشند — شرط اصلی قضیه‌ی کندورسه۱. مناظره با نشان دادن پاسخ‌ها به یکدیگر، دقیقاً همین استقلال را از بین می‌برد.
  • چیزی که واقعاً کار می‌کند. تنوع مدل‌ها، نه ساختار مناظره. ترتیب صحبت و نمایش میزان اطمینان تقریباً بی‌اثرند۱۳.
  • جایی که مناظره بی‌رقیب است. داوری و نظارت. دقت داور غیرمتخصص انسانی با مناظره از ۶۰٪ به ۸۸٪ رسید۱۰.
این مقاله بخشی از یک خوشه است

مفاهیم پایه‌ی سیستم‌های چندایجنتی — معماری‌ها، هزینه‌ی توکن، پروتکل‌های ارتباطی و چک‌لیست تصمیم — در راهنمای سیستم چندایجنتی آمده و اینجا تکرار نمی‌شود. این صفحه فقط یک الگو را تا انتها می‌کاود: مناظره.

۰۲

تباری که به ۱۷۸۵ می‌رسد

پاسخ کوتاه

مناظره‌ی مدل‌ها یک اختراع دوران LLM نیست. پایه‌ی ریاضی‌اش قضیه‌ای است که مارکی دو کندورسه در ۱۷۸۵ درباره‌ی هیئت‌منصفه اثبات کرد، الهام معماری‌اش از «جامعه‌ی ذهن» مینسکی (۱۹۸۶) می‌آید، و شکل امروزی‌اش را یک مقاله‌ی ایمنی هوش مصنوعی در ۲۰۱۸ پیشنهاد داد — پنج سال پیش از آنکه کسی آن را روی LLM اجرا کند.

دانستن این تبار صرفاً آرایه‌ی تاریخی نیست. هر حلقه‌ی این زنجیره یک شرط با خود آورده که در پیاده‌سازی‌های امروزی نادیده گرفته می‌شود — و بیشتر شکست‌های عملی مناظره، دقیقاً نقض همان شرط‌هاست.

۱۷۸۵

قضیه‌ی هیئت‌منصفه‌ی کندورسه

اگر هر رأی‌دهنده مستقل تصمیم بگیرد و با احتمالی بیش از ۵۰٪ درست باشد، با افزایش تعداد رأی‌دهندگان احتمال درستی رأی اکثریت به ۱ میل می‌کند. این ریاضیاتِ پشتِ هر ensemble و هر self-consistency است.۱

۱۹۵۱

آزمایش هم‌رنگی سالومون اَش

وقتی گروه به‌اتفاق پاسخ آشکارا غلطی می‌داد، حدود یک‌سوم افراد با آن هم‌رنگ می‌شدند — در حالی که نرخ خطا در تنهایی زیر ۱٪ بود. اولین سند تجربی از اینکه بحث گروهی می‌تواند پاسخ درست را حذف کند.۲

۱۹۸۶

«جامعه‌ی ذهن» ماروین مینسکی

هوش از یک سازوکار واحد نمی‌آید، بلکه از تعامل عوامل ساده‌ی متعدد پدید می‌آید. این کتاب، نامِ استعاری بسیاری از چارچوب‌های مناظره‌ی امروزی را به آن‌ها داد.۳

۲۰۱۸

«ایمنی هوش مصنوعی از راه مناظره»

پنج سال پیش از موج LLM، پژوهشگران OpenAI مناظره را نه برای دقت، بلکه برای نظارت پیشنهاد دادند: دو ایجنت بحث می‌کنند تا داور انسانیِ ضعیف‌تر بتواند قضاوت کند.۴

۲۰۲۳

اولین اجرای گسترده روی LLM

سه مدل، دو راند، شش محک، بهبود ۷ تا ۱۶ درصدی. مقاله‌ای که کل این حوزه را ساخت۵ و رسانه‌های دانشگاهی آن را «همکاری چند هوش مصنوعی» نامیدند.۶

۲۰۲۴

مقایسه‌های مستقل

مناظره از self-consistency بهتر نیست۸؛ و یک ایجنت تکی با پرامپت قوی تقریباً به همان نتیجه می‌رسد۹.

۲۰۲۵

اثبات مارتینگل

بحث به‌تنهایی امید ریاضی درستی را بالا نمی‌برد. رأی‌گیری بخش عمده‌ی سود را توضیح می‌دهد.۱۱

۲۰۲۵

تنوع و کیفیت اولیه، مهم‌تر از جزئیات ساختار

محرک واقعی موفقیت، قدرت استدلال ذاتی و تنوع گروه است — نه مهندسی پروتکل مناظره.۱۳

برداشت

هر ادعایی درباره‌ی مناظره‌ی مدل‌ها باید با پرسش کندورسه سنجیده شود: آیا ایجنت‌های من مستقل‌اند، و آیا هرکدام بهتر از شانس عمل می‌کنند؟

۰۳

مناظره‌ی چندایجنتی دقیقاً چیست؟

پاسخ کوتاه

پروتکلی که در آن چند مدل زبانی مستقل به یک پرسش پاسخ می‌دهند، سپس در یک یا چند راند پاسخ‌های یکدیگر را می‌بینند و پاسخ خود را بازنگری می‌کنند. در پایان یا به اجماع می‌رسند یا با رأی‌گیری یک پاسخ انتخاب می‌شود.

تفاوت مناظره با دو روش شبیه به آن، جایی است که بیشتر سوءتفاهم‌ها از آن شروع می‌شود:

روشایجنت‌ها همدیگر را می‌بینند؟آرا مستقل‌اند؟هزینه
Self-ConsistencyخیربلهN فراخوان
Ensemble چندمدلیخیربلهN فراخوان
مناظره (MAD)بلهخیرN × راند فراخوان

ستون سوم را به‌خاطر بسپارید. مناظره از نظر ساختاری «self-consistency به‌علاوه‌ی دیدن پاسخ دیگران» است، و همان «دیدن» است که استقلال آرا را از بین می‌برد. کل بحث پژوهشی سه سال گذشته حول یک پرسش می‌چرخد: آیا اطلاعاتی که از دیدن پاسخ دیگران به دست می‌آید، بیشتر از استقلالی است که از دست می‌رود؟

شکل یک مناظره‌ی واقعی

نمونه‌ی ساده‌شده‌ی یک مناظره‌ی دو راندی روی یک مسئله‌ی حساب:

مناظره‌ی دو راندی · ۲ ایجنت
ایجنت الف — راند ۱حاصل ۲۳ × ۱۷ برابر ۳۷۱ است، چون ۲۳ × ۱۰ + ۲۳ × ۷ = ۲۳۰ + ۱۴۱ = ۳۷۱.
ایجنت ب — راند ۱حاصل ۳۹۱ است. ۲۳ × ۲۰ − ۲۳ × ۳ = ۴۶۰ − ۶۹ = ۳۹۱.
ایجنت الف — راند ۲اختلاف از گام دوم من است: ۲۳ × ۷ برابر ۱۶۱ است نه ۱۴۱. پس ۲۳۰ + ۱۶۱ = ۳۹۱. خطای من بود.
ایجنت ب — راند ۲مسیر جایگزین را هم بررسی کردم؛ ۳۹۱ درست است.
اجماع۳۹۱

این دقیقاً همان چیزی است که طرفداران مناظره را هیجان‌زده می‌کند: یک مدل خطا کرد و دیدن استدلال دیگری اصلاحش کرد. اما همین نمونه پرسش کلیدی را پنهان کرده — اگر بدون هیچ بحثی فقط رأی می‌گرفتیم، آیا به همان جواب نمی‌رسیدیم؟ در بخش ۰۸ به این برمی‌گردیم.

۰۴

مسئله‌ای که مناظره قرار بود حل کند

پاسخ کوتاه

«زوال اندیشه» (Degeneration-of-Thought) توضیح می‌دهد چرا خودبازبینیِ یک مدل کافی نیست: وقتی مدلی به پاسخ خود اطمینان پیدا کرد، حتی اگر آن پاسخ غلط باشد، در بازبینی‌های بعدی نمی‌تواند فکر تازه‌ای تولید کند. مناظره برای شکستن همین بن‌بست پیشنهاد شد.

پژوهشگران سه ریشه برای این پدیده شناسایی کردند: ادراک تحریف‌شده از داده‌ی آموزشی، مقاومت در برابر تغییر باور تثبیت‌شده، و نبود دیدگاه بیرونی۷. مورد سوم کلید ماجراست — مدل نمی‌تواند چیزی را ببیند که در زمینه‌اش نیست. اگر با نحوه‌ی ساخت و مدیریت زمینه آشنا نیستید، مهندسی زمینه پایه‌های آن را توضیح می‌دهد.

راه‌حل پیشنهادی، ساختاری با سه نقش بود: دو مناظره‌کننده که موظف‌اند مواضع مخالف بگیرند و «مو به مو» پاسخ هم را رد کنند؛ یک داور با دو حالت کاری (تشخیص اجماع و استخراج پاسخ نهایی)؛ و فرا-پرامپت‌هایی که موضوع، سقف تکرار و قواعد را تعیین می‌کنند.

نتایج قابل توجه بودند: روی محک استدلال ضدشهودی، دقت از ۲۶٪ به ۳۷٪ رسید. و روی ترجمه‌ی ماشینی، نسخه‌ی مناظره‌ایِ یک مدل نسل قبل امتیاز انسانی ۳٫۷۸ گرفت — بالاتر از مدل نسل بعدی که به‌تنهایی ۳٫۴۱ گرفته بود.

دو یافته‌ی جانبی که تقریباً هیچ‌جا نقل نمی‌شوند

۱. «توقف تطبیقی» حیاتی بود — یعنی توانایی مناظره برای تمام‌شدن در لحظه‌ی درست، نه ادامه دادن تا سقف راند. سود اصلی از همین‌جا می‌آمد. ۲. داورها بی‌طرف نبودند — داور LLM به مناظره‌کننده‌ای که همان مدل پایه را داشت گرایش نشان می‌داد. اگر داور و یکی از طرفین از یک خانواده باشند، نتیجه از پیش کج است.

۰۵

موج اول: اعدادی که همه را هیجان‌زده کرد

پاسخ کوتاه

مقاله‌ی مرجع این حوزه با سه مدل زبانی که دو راند مناظره می‌کردند، روی شش محک آزمایش شد. بهبودها بزرگ و یکدست بودند: حساب از ۶۷٪ به ۸۱٫۸٪، ریاضی مدرسه از ۷۷٪ به ۸۵٪، MMLU از ۶۳٫۹٪ به ۷۱٫۱٪ و صحت زیست‌نامه‌ها از ۶۶٪ به ۷۳٫۸٪.

محکایجنت تکیمناظره (۳ ایجنت، ۲ راند)تغییر
حساب (Arithmetic)۶۷٫۰٪۸۱٫۸٪+۱۴٫۸
ریاضی مدرسه (Grade School Math)۷۷٫۰٪۸۵٫۰٪+۸٫۰
MMLU۶۳٫۹٪۷۱٫۱٪+۷٫۲
صحت زیست‌نامه (Biographies)۶۶٫۰٪۷۳٫۸٪+۷٫۸
اعتبار حرکت شطرنج۲۹٫۳٪۴۵٫۲٪+۱۵٫۹
کیفیت حرکت شطرنج (امتیاز)۹۱٫۴۱۲۲٫۹+۳۱٫۵

و دو نمودار که بعداً محل مناقشه شد: با افزایش تعداد ایجنت‌ها عملکرد یکنواخت بالا می‌رفت، و با افزایش تعداد راندها هم — وقتی تعداد ایجنت روی ۳ ثابت بود۵. دومی همان یافته‌ای است که پژوهش‌های بعدی معکوسش کردند.

برداشت

این اعداد واقعی‌اند و کسی آن‌ها را رد نکرده. چیزی که رد شد، تفسیرِ آن‌ها بود: خط پایه‌ی مقایسه یک فراخوان تکی بود، نه سه فراخوان مستقل.

۰۶

پنج متغیری که همه‌چیز را تعیین می‌کنند

پاسخ کوتاه

هر پیاده‌سازی مناظره پنج تصمیم طراحی دارد: چند ایجنت، چند راند، با چه میزان توافق‌پذیری، با چه پروتکل تصمیم‌گیری، و با چه شرط توقفی. شواهد نشان می‌دهد این پنج متغیر — نه انتخاب مدل — بیشترین اثر را روی نتیجه‌ی نهایی دارند.

متغیراثر مشاهده‌شدهتوصیه‌ی مبتنی بر شواهد
تعداد ایجنتمثبت و نسبتاً پایدار۳ تا ۵ — بیشتر از این سود نهایی کم و هزینه خطی است
تعداد راندمثبت در مقاله‌ی ۲۰۲۳، منفی در پژوهش‌های بعدی۱ تا ۲ راند. راند سوم به‌ندرت ارزش دارد
میزان توافق‌پذیریبسیار زیاد — تنظیمش تا ۱۵٪ عملکرد را جابه‌جا کردصریحاً در پرامپت بگویید «به‌راحتی تسلیم نشو»
پروتکل تصمیموابسته به نوع مسئلهاجماع برای پرسش دانشی، رأی‌گیری برای استدلالی
شرط توقفحیاتی — عامل اصلی سود در مقالات اولیهوقتی توزیع پاسخ‌ها پایدار شد متوقف کنید، نه وقتی سقف راند پر شد

متغیر سوم غیرمنتظره‌ترین است. در یک مطالعه‌ی مقایسه‌ای، صرفاً تنظیم میزان توافق‌پذیری ایجنت‌ها از طریق پرامپت، یکی از استراتژی‌های مناظره را از بدترین به بهترین تبدیل کرد — حدود ۱۵ درصد جابه‌جایی۸. یک جمله در پرامپت، اثری بزرگ‌تر از تعویض کل معماری داشت.

۰۷

تردید اول: «آیا باید MAD برویم؟»

پاسخ کوتاه

در ۲۰۲۴ یک مقایسه‌ی سیستماتیک، چند استراتژی مناظره را در برابر روش‌های پرامپت‌نویسی رقیب گذاشت. نتیجه سرد بود: سیستم‌های مناظره در شکل کنونی‌شان به‌طور قابل‌اتکا از روش‌هایی مثل self-consistency و ensembling بهتر عمل نمی‌کنند — و به‌مراتب گران‌ترند.

یافته‌ی مرکزی ظریف‌تر از «مناظره بد است» بود. نویسندگان نوشتند پروتکل‌های مناظره ذاتاً بدتر از رویکردهای دیگر نیستند، بلکه به تنظیمات هایپرپارامتر بسیار حساس‌ترند و بهینه‌سازی‌شان سخت است۸. مناظره یک ابزار پرنوسان است: با تنظیم درست خوب، با تنظیم پیش‌فرض بد.

  • تنظیمات بهینه به مجموعه‌داده وابسته‌اند. هیچ پیکربندی واحدی روی محک‌های پزشکی و غیرپزشکی هم‌زمان برنده نبود.
  • انتقال بین مدل‌ها ناپایدار است. تنظیماتی که به یک مدل مرزی منتقل می‌شد، به یک مدل متن‌باز کوچک‌تر منتقل نشد.
  • هزینه توجیه ندارد. فراخوان و توکن به‌مراتب بیشتر، بدون تضمین بهبود دقت.

یک سال بعد، بررسی مستقل دیگری روی نُه محک با دو مدل مختلف، همین نتیجه را تأیید کرد: چارچوب‌های مناظره به‌طور مداوم از استراتژی‌های ساده‌ی محاسبه در زمان استنتاج — مثل زنجیره‌ی تفکر و self-consistency — بهتر عمل نکردند، و افزایش بودجه‌ی محاسباتی هم لزوماً دقت را بالا نبرد۱۶.

چرا این برای شما مهم است

اگر معماری مناظره‌ای را از یک مقاله یا مخزن گیت‌هاب کپی کنید و روی مدل و داده‌ی خودتان اجرا کنید، احتمال قابل توجهی هست که نتیجه بدتر از یک فراخوان ساده باشد — و این نه به‌خاطر اشتباه شما، بلکه ویژگی ذاتی این روش است.

۰۸

ضربه‌ی اصلی: بحث یا رأی؟

پاسخ کوتاه

مقاله‌ی «Debate or Vote» در ۲۰۲۵ یک چارچوب نظری ارائه داد که در آن مسیر باور ایجنت‌ها به‌صورت مارتینگل مدل می‌شود. نتیجه، تحت فرض‌های همان چارچوب، این است که بحث به‌تنهایی امید ریاضیِ درست‌بودن پاسخ را بالا نمی‌برد و بخش عمده‌ی سود مشاهده‌شده از رأی‌گیری اکثریت می‌آید.

مارتینگل مفهومی از نظریه‌ی احتمال است: فرایندی که در آن بهترین پیش‌بینی شرطی برای مقدار بعدی، مقدار فعلی است. بنابراین در مدل نظری آن مقاله، راند اضافه به‌خودیِ خود تضمینی برای نزدیک‌تر شدن به پاسخ درست ندارد؛ البته مداخله‌های جهت‌دار، داور بهتر یا اطلاعات تازه می‌توانند این فرض خنثی را بشکنند.

«رأی‌گیری اکثریت به‌تنهایی، بخش عمده‌ی بهبودی را که معمولاً به مناظره نسبت داده می‌شود توضیح می‌دهد.»

Debate or Vote — NeurIPS 2025 (Spotlight)

پس چرا آزمایش‌های ۲۰۲۳ بهبود نشان دادند؟

چون در آن آزمایش‌ها، مناظره و رأی‌گیری از هم تفکیک نشده بودند. وقتی سه ایجنت پاسخ می‌دهند و در پایان پاسخ غالب انتخاب می‌شود، دو اثر هم‌زمان در کارند:

  1. اثر آماری. میانگین‌گیری روی چند نمونه، نویز تصادفی را کم می‌کند. این اثر بدون هیچ بحثی هم وجود دارد — و دقیقاً همان چیزی است که کندورسه در ۱۷۸۵ اثبات کرد.
  2. اثر اطلاعاتی. ایجنت با دیدن استدلال دیگری چیز تازه‌ای می‌فهمد و نظرش عوض می‌شود.

خط پایه‌ی درست برای سنجش مناظره، «یک فراخوان تکی» نیست — «همان تعداد فراخوان، ولی بدون دیدن پاسخ دیگران» است. وقتی این خط پایه‌ی منصفانه گذاشته شد، بخش عمده‌ی برتری ناپدید شد.

برداشت

پیش از هر ادعایی درباره‌ی مناظره‌تان، خط پایه‌ی self-consistency با همان تعداد فراخوان را اجرا کنید. اگر برتری معناداری نماند، شما مناظره نساخته‌اید — یک رأی‌گیری گران ساخته‌اید.

۰۹

تناقض کندورسه: مناظره شرط خودش را نقض می‌کند

پاسخ کوتاه

قضیه‌ی کندورسه دو شرط دارد: رأی‌دهندگان باید مستقل باشند، و هرکدام باید با احتمال بیش از ۵۰٪ درست تصمیم بگیرند. مناظره شرط اول را عمداً می‌شکند — چون کل ایده‌اش این است که ایجنت‌ها روی هم اثر بگذارند. نتیجه: هرچه مناظره «موفق‌تر» باشد، رأی‌گیری پایانی بی‌اثرتر می‌شود.

در این مقاله، قضیه‌ی کندورسه را به‌عنوان یک توضیح شهودی مکمل برای فهم نتیجه‌ی مارتینگل به کار می‌بریم؛ نه به‌عنوان اثبات آن. این دو چارچوب فرض‌های یکسانی ندارند، اما هر دو توجه را به استقلال آرا و نحوه‌ی به‌روزرسانی باورها جلب می‌کنند.

شرط اول: استقلال

کندورسه در ۱۷۸۵ نشان داد اگر هر رأی‌دهنده به‌طور مستقل با احتمال p > ۰٫۵ درست تصمیم بگیرد، احتمال درستی رأی اکثریت با افزایش تعداد رأی‌دهندگان به ۱ میل می‌کند۱. کلمه‌ی «مستقل» تزئینی نیست؛ موتور کل قضیه است. استقلال یعنی خطاهای رأی‌دهندگان با هم هم‌بسته نیستند، پس در رأی‌گیری همدیگر را خنثی می‌کنند.

حالا مناظره را در نظر بگیرید. ایجنت ب پاسخ ایجنت الف را می‌بیند. اگر نظرش را عوض کند، رأی او دیگر شاهدِ مستقلی نیست — بازتابی از رأی الف است. شما فکر می‌کنید سه رأی دارید، اما در عمل شاید یک رأی و دو پژواک داشته باشید.

هسته‌ی مسئله

مناظره اطلاعات را بین ایجنت‌ها جابه‌جا می‌کند و هم‌زمان استقلال پاسخ‌های بعدی را کاهش می‌دهد. اینکه سود اطلاعاتی از زیان استقلال بیشتر باشد یا نه، به مدل، مسئله و پروتکل بستگی دارد. نتیجه‌ی مارتینگل یک صورت‌بندی مشخص از این مسئله تحت فرض‌های مقاله است، نه اثبات مستقیم قضیه‌ی کندورسه برای LLMها.

شرط دوم: بهتر از شانس بودن

وجه کمتر شناخته‌شده‌ی قضیه‌ی کندورسه، حالت معکوس آن است: اگر p < ۰٫۵ باشد — یعنی رأی‌دهنده‌ها به‌طور میانگین بیشتر غلط می‌گویند تا درست — آنگاه افزایش تعداد رأی‌دهندگان اوضاع را بدتر می‌کند، و بهترین هیئت‌منصفه یک نفر است۱.

ترجمه‌ی این حکم به زبان مهندسی هوش مصنوعی، هشداری جدی است: روی وظیفه‌ای که مدل شما در آن ضعیف‌تر از شانس عمل می‌کند، اضافه کردن ایجنت دقت را بالا نمی‌برد — آن را پایین می‌آورد. رأی‌گیری خطای سیستماتیک را تقویت می‌کند، نه فیلتر.

محدودیت این ترجمه

این نتیجه فقط وقتی مستقیم برقرار است که رأی‌ها تقریباً مستقل باشند و هر ایجنت احتمال موفقیت نسبتاً ثابتی داشته باشد. نمونه‌های یک LLM معمولاً خطاهای هم‌بسته دارند و مقدار p با نوع سؤال، پرامپت و زمینه تغییر می‌کند؛ پس این بخش یک هشدار مهندسی است، نه قانون تضمین‌شده برای همه‌ی مدل‌ها.

وضعیت مدل روی وظیفهاثر افزودن ایجنتراهبرد درست
به‌طور مطمئن بهتر از شانس (p بالا)بهبود، اما با بازده نزولی۳ تا ۵ ایجنت مستقل، بدون بحث
حدوداً در مرز شانس (p ≈ ۰٫۵)بهبود بسیار کند (متناسب با جذر تعداد)مسئله را ساده کنید یا مدل را عوض کنید
ضعیف‌تر از شانس (p پایین)بدتر شدن سیستماتیکیک ایجنت + بازبینی انسانی

چرا ۳ تا ۵ ایجنت؟ ریاضیاتش اینجاست

در تقریب‌های مجانبیِ نزدیک به مرز شانس، نسبت سیگنال به نویز با جذر تعداد رأی‌دهندگان رشد می‌کند۱. پیام عملی، بازده نزولی است: افزایش تیم از سه به پنج ممکن است مفید باشد، اما جهش از ده به بیست فقط با آزمون روی داده‌ی واقعی توجیه می‌شود و به‌خودیِ خود تضمینی برای بهبود ندارد.

این همان چیزی است که توصیه‌ی تجربی «۳ تا ۵ ایجنت» را از یک قاعده‌ی سرانگشتی به یک نتیجه‌ی قابل استنتاج تبدیل می‌کند — و توضیح می‌دهد چرا در بخش ۱۱ خواهیم دید افزودن ایجنت مفید است ولی افزودن راند مضر.

برداشت

هر بار که به مناظره‌تان ایجنت اضافه می‌کنید، بپرسید: آیا این ایجنت شاهدِ مستقلی است، یا فقط بلندگوی دیگری برای همان دیدگاه؟

۱۰

درسِ آزمایش اَش: چطور اقلیتِ درست را نجات دهیم

پاسخ کوتاه

در ۱۹۵۱ سالومون اَش نشان داد وقتی گروه به‌اتفاق پاسخ آشکارا غلطی می‌دهد، حدود یک‌سوم افراد با آن هم‌رنگ می‌شوند — در حالی که در تنهایی نرخ خطا زیر ۱٪ است. اما یافته‌ی مهم‌تر این بود: کافی بود یک نفر پاسخ درست را بگوید تا هم‌رنگی به حدود ۵٪ سقوط کند.

اعداد اصلی آزمایش۲:

<۱٪نرخ خطا وقتی فرد تنها قضاوت می‌کرد
~۳۲٪نرخ هم‌رنگی با اکثریتِ غلط در آزمون‌های بحرانی
~۷۵٪افرادی که دست‌کم یک بار هم‌رنگ شدند
~۵٪نرخ هم‌رنگی وقتی فقط یک نفر مخالفت می‌کرد

مطالعه‌ی کنترل‌شده‌ی ۲۰۲۵ روی مناظره‌ی مدل‌ها دقیقاً همین الگو را در ایجنت‌ها مستند کرد: وقتی اکثریت روی پاسخ غلطی هم‌نظر می‌شدند، فشار گروه مانع می‌شد ایجنتِ درست روی موضع خود بماند۱۳. یعنی مناظره می‌تواند پاسخ درست را حذف کند — نه به‌خاطر ضعف استدلال، بلکه به‌خاطر پویایی گروه.

یک مخالف کافی است تا اکثریت قدرت سرکوبش را از دست بدهد.

یافته‌ی مشترک اَش (۱۹۵۱) و مطالعات مناظره‌ی LLM (۲۰۲۵)

الگوی پیشنهادی برای آزمایش: مخالفِ کاشته

از این یافته می‌توان یک الگوی طراحی قابل‌آزمایش پیشنهاد کرد: به‌جای اینکه فقط به تنوع طبیعی مدل‌ها امید ببندید، یک ایجنت را موظف کنید قوی‌ترین نقد ممکن را علیه پاسخ غالب بسازد. این پیشنهاد از آزمایش اَش الهام گرفته، اما هنوز نباید آن را نتیجه‌ای اثبات‌شده برای همه‌ی LLMها دانست.

  • ایجنت مخالف نباید در رأی‌گیری نهایی شرکت کند؛ نقش او تولید فشار است، نه رأی.
  • پرامپت او باید بگوید: «قوی‌ترین استدلال ممکن علیه پاسخ غالب را بساز، حتی اگر خودت آن را باور نداری.»
  • اگر مخالف نتوانست حفره‌ای پیدا کند، آن را فقط یک سیگنال کمکی بدانید؛ ناتوانی یک LLM در یافتن نقد، تضمین صحت پاسخ نیست.

ساختار مشابهی در چارچوب «فرشته و شیطان» پیشنهاد شده بود۷. پیوند دادن آن به آزمایش اَش در اینجا یک تفسیر طراحی است و باید با A/B تست روی داده‌ی واقعی سنجیده شود.

برداشت

اگر پرامپت شما به ایجنت‌ها می‌گوید «سعی کنید به توافق برسید»، دارید سرکوب اقلیت را تشویق می‌کنید. توافق باید نتیجه باشد، نه دستور.

۱۱

اصلاً چند ایجنت لازم است؟ شاید یکی

پاسخ کوتاه

پژوهشی در ۲۰۲۴ نشان داد یک ایجنت تکی با پرامپت قوی — شامل مثال‌های درون‌زمینه‌ای و شرح دقیق مسئله — تقریباً به همان عملکرد بهترین روش‌های مناظره می‌رسد. برتری مناظره عمدتاً در حالت بدون مثال (zero-shot) دیده می‌شود، یعنی دقیقاً جایی که پرامپت ضعیف است.

این یافته، مناظره را در جای تازه‌ای می‌نشاند: نه یک روش برتر، بلکه یک جبران‌کننده‌ی پرامپت ضعیف. وقتی به مدل مثال و شرح کافی می‌دهید، مزیت بحث گروهی عملاً محو می‌شود۹.

شرایطایجنت تکیمناظرهتوصیه
پرامپت با مثال و شرح دقیقتقریباً برابربرابر، ولی چند برابر گران‌ترایجنت تکی
پرامپت بدون مثال (zero-shot)ضعیف‌تربهترمناظره یا بهبود پرامپت
ترکیب مدل قوی و ضعیف—مدل ضعیف تقویت می‌شودمناظره‌ی ناهمگن

ردیف سوم نکته‌ی ظریفی دارد: همان پژوهش دید که ایجنت‌های مبتنی بر مدل‌های ضعیف‌تر، وقتی در کنار مدل‌های قوی‌تر قرار می‌گیرند عملکردشان بالا می‌رود. یعنی سود مناظره به ناهمگنی توانایی بستگی دارد، نه به صرفِ زیاد بودن تعداد ایجنت‌ها. این پلی است به بخش ۱۳.

← پیش از ساختن مناظره، پرامپت‌تان را درست کنید مقایسه‌ی پرامپت‌نویسی و مهندسی حلقه — کجا کدام‌یک مسئله را حل می‌کند
۱۲

اجماع یا رأی‌گیری؟ به نوع مسئله بستگی دارد

پاسخ کوتاه

پژوهشی در ۲۰۲۵ هفت پروتکل تصمیم‌گیری را روی سه وظیفه‌ی دانشی و سه وظیفه‌ی استدلالی مقایسه کرد، در حالی که همه‌چیز جز خودِ سازوکار تصمیم ثابت بود. نتیجه یک تفکیک روشن بود: اجماع در وظایف دانشی برنده است، رأی‌گیری در وظایف استدلالی.

نوع وظیفهمحکپروتکل برندهمیزان برتری
دانشیMMLUاجماع+۲٫۳٪
MMLU-Proاجماع+۴٫۹٪
GPQAاجماع+۱٫۳٪
استدلالیSQuAD 2.0رأی‌گیری+۱۳٫۱٪
MuSRرأی‌گیری+۲۶٫۴٪

منطق پشت این تفکیک روشن است. در وظایف دانشی، خطاها معمولاً فردی و تصادفی‌اند؛ الزام به توافق چند ایجنت، این خطاها را فیلتر می‌کند. در وظایف استدلالی، مسیرهای متعدد و معتبری به پاسخ وجود دارد؛ اجبار به اجماع، تنوع مسیرها را زودتر از موعد می‌کشد۱۲.

۱٫۴۲میانگین راند لازم برای رسیدن به اجماع
۳٫۳۸میانگین راند در پروتکل‌های رأی‌گیری
+۷٫۴٪بهبود روش «بهبود جمعی» پیشنهادی همان مقاله
یافته‌ای که خلاف شهود است

همان پژوهش نشان داد افزایش تعداد ایجنت‌ها عملکرد را بالا می‌برد اما افزایش تعداد راندها آن را پایین می‌آورد. این دقیقاً برعکس نمودارهای مقاله‌ی ۲۰۲۳ است — و برعکس کاری که اکثر تیم‌ها هنگام «بهتر کردن» مناظره‌شان انجام می‌دهند. اگر مناظره‌ی شما جواب نمی‌دهد، ایجنت اضافه کنید نه راند.

۱۳

آنچه واقعاً کار می‌کند: تنوع، نه ساختار

پاسخ کوتاه

یک مطالعه‌ی کنترل‌شده شش عامل را جداگانه دستکاری کرد: اندازه‌ی تیم، ترکیب تیم، نمایش میزان اطمینان، ترتیب صحبت، عمق مناظره و سختی مسئله. نتیجه: محرک‌های اصلی موفقیت، قدرت استدلال ذاتی مدل‌ها و تنوع گروه بودند. عوامل ساختاری مثل ترتیب صحبت اثر ناچیزی داشتند.

پیامد عملی مستقیم دارد: وقت گذاشتن روی طراحی پروتکل مناظره — چه کسی اول حرف بزند، آیا میزان اطمینان نمایش داده شود — عمدتاً اتلاف وقت است. آنچه ارزش دارد، انتخاب مدل‌های متفاوت است۱۳.

و این دقیقاً همان چیزی است که از قضیه‌ی کندورسه انتظار داریم: تنوع مدل‌ها یعنی خطاهای کمتر هم‌بسته، یعنی رأی‌گیری قدرت فیلتر کردن خود را حفظ می‌کند. سه نمونه از یک مدل، سه رأی نیستند — یک رأی با نویزند. پژوهش مستقلی هم نشان داده گروه‌های ناهمگن از ایجنت‌ها، توان استدلالی بالاتری از گروه‌های همگن دارند.۱۷

قاعده‌ی عملی

مدل‌های متفاوت معمولاً شانس بیشتری برای تولید خطاهای کم‌هم‌بسته دارند؛ اما نام متفاوتِ مدل به‌تنهایی کافی نیست. تنوع را با اختلاف واقعی در پاسخ‌های اولیه و عملکرد روی داده‌ی خودتان اندازه بگیرید.

سه رفتار گروهی که مستند شد

  • اکثریت، اقلیت را سرکوب می‌کند — همان الگویی که در بخش ۱۰ دیدیم.
  • مخالفت مؤثر کار می‌کند. تیم‌های موفق آن‌هایی بودند که توانستند اجماع معیوب را واژگون کنند، نه آن‌هایی که سریع‌تر به توافق رسیدند.
  • منطق مهم‌تر از لحن است. استدلالی که با اعتبار منطقی هم‌راستا بود، بهترین پیش‌بینی‌کننده‌ی بهبود بود.
۱۴

جایی که مناظره واقعاً می‌درخشد: داوری

پاسخ کوتاه

اگر یک کاربرد وجود داشته باشد که شواهد پژوهشی محکمی به نفعش هست، ارزیابی است — نه پاسخ‌دهی. وقتی چند مدل درباره‌ی کیفیت یک خروجی بحث می‌کنند، نتیجه به‌طور پایدار به قضاوت انسانی نزدیک‌تر می‌شود، چون ارزیابی ذاتاً چندبعدی است و تنوع دیدگاه واقعاً اطلاعات اضافه می‌کند.

این تفاوت بنیادی است و باز هم به کندورسه برمی‌گردد. در یک مسئله‌ی حساب، پاسخ درست یکی است و «دیدگاه متفاوت» چیزی جز نویز نیست. در ارزیابی یک متن، «خوب بودن» چند بُعد دارد — دقت، انسجام، لحن، کامل بودن — و هر ایجنت می‌تواند بُعد متفاوتی را ببیند. اینجا تنوع، اطلاعات واقعیِ غیرهم‌بسته تولید می‌کند۱۴.

نسل جدید سیستم‌های داوری چندایجنتی، سازوکار تشخیص پایداری اضافه کرده‌اند: به‌جای اجرای تعداد ثابتی راند، توزیع آرای داورها رصد می‌شود و به‌محض پایدار شدن، مناظره متوقف می‌شود۱۵. این دقیقاً همان «توقف تطبیقی» است که از ۲۰۲۳ به‌عنوان عامل اصلی سود شناخته شده بود — حالا با پشتوانه‌ی آماری.

← کاربرد عملی: کنترل کیفیت خودکار مکالمات همین الگوی داوری چندایجنتی در ارزیابی ایجنت صوتی و ربات پشتیبانی استفاده می‌شود
۱۵

شاخه‌ی فراموش‌شده: مناظره برای نظارت

پاسخ کوتاه

مناظره در اصل برای بالا بردن دقت پیشنهاد نشده بود. در ۲۰۱۸ — پنج سال پیش از موج LLM — پژوهشگران آن را به‌عنوان راهی برای نظارت مطرح کردند: وقتی مدل‌ها از ناظر انسانی تواناتر شوند، دو مدل بحث می‌کنند تا داوری ضعیف‌تر بتواند حقیقت را تشخیص دهد.

ایده‌ی اصلی، قیاسی از نظریه‌ی پیچیدگی داشت: مناظره مثل یک درخت بازی است. وقتی استدلال کامل از توان درک انسان بیرون است، بحث به‌تدریج روی نقاط اختلاف «زوم» می‌کند تا به ادعایی برسد آن‌قدر ساده که انسان بتواند مستقیماً درباره‌اش قضاوت کند۴.

آزمایش اولیه روی تشخیص ارقام دست‌نویس انجام شد، با محدودیتی عمدی: داور فقط شش پیکسل از تصویر را می‌دید. نتیجه:

آزمایششرایطدقت داور
تشخیص رقم با ۶ پیکسل (۲۰۱۸)پیکسل‌های تصادفی۵۹٫۴٪
پیکسل‌های انتخاب‌شده در مناظره۸۸٫۹٪
درک متن نخوانده (۲۰۲۴)قضاوت بدون کمک۶۰٪
مشاوره‌ی یک متخصص۷۸٪
مناظره‌ی دو طرف۸۸٪

این خط پژوهشی بعدها صورت‌بندی نظری دقیق‌تری هم پیدا کرد، با تمرکز بر اینکه داور با چه میزان محاسبه می‌تواند مناظره را به‌درستی داوری کند.۲۰

شباهت دو عدد پایانی — ۸۸٫۹٪ و ۸۸٪ — با فاصله‌ی شش سال و روی دو نوع کاملاً متفاوت از داده، تصادفی به نظر نمی‌رسد. نکته‌ی کلیدی آزمایش ۲۰۲۴ این بود که مناظره‌کننده‌ها برای متقاعدکنندگی بهینه شده بودند، نه برای درستی، و بدون هیچ برچسب حقیقتِ زمینی. با این حال توانایی داور غیرمتخصص در تشخیص حقیقت بالا رفت۱۰.

چرا این با بخش‌های قبل تناقض ندارد

در «مناظره برای پاسخ‌دهی»، هر دو طرف تلاش می‌کنند به پاسخ درست برسند و مسیرشان به‌سرعت هم‌گرا می‌شود — یعنی استقلال از بین می‌رود و کندورسه بی‌اثر می‌ماند. در «مناظره برای نظارت»، هر طرف موظف است از یک موضع مشخص دفاع کند. این اجبار به عدم هم‌گرایی، همان چیزی است که اطلاعات تولید می‌کند. تفاوت در ساختار انگیزه است، نه در مدل‌ها.

برداشت

مناظره وقتی ارزش دارد که طرفین مجبور به اختلاف باشند. مناظره‌ی داوطلبانه به توافق ختم می‌شود؛ مناظره‌ی اجباری به اطلاعات.

۱۶

اقتصاد مناظره: چرا راند سوم اینقدر گران است

پاسخ کوتاه

هزینه‌ی مناظره با تعداد راندها خطی رشد نمی‌کند — درجه‌دوم رشد می‌کند. چون هر راند، کل تاریخچه‌ی راندهای قبل را دوباره وارد زمینه‌ی همه‌ی ایجنت‌ها می‌کند. در یک مناظره‌ی سه‌ایجنتی، راند سوم به‌تنهایی توکن ورودی بیشتری مصرف می‌کند از راند اول و دوم روی هم.

بیایید با اعداد مشخص حساب کنیم. فرض: پرسش و دستور سیستمی ۵۰۰ توکن، پاسخ هر ایجنت ۴۰۰ توکن، سه ایجنت.

روشتوکن ورودیتوکن خروجینسبت ورودی به فراخوان تکی
یک فراخوان ساده۵۰۰۴۰۰۱×
Self-Consistency (۳ نمونه)۱٬۵۰۰۱٬۲۰۰۳×
مناظره — ۳ ایجنت، ۱ راند۱٬۵۰۰۱٬۲۰۰۳×
مناظره — ۳ ایجنت، ۲ راند۶٬۶۰۰۲٬۴۰۰۱۳٫۲×
مناظره — ۳ ایجنت، ۳ راند۱۵٬۳۰۰۳٬۶۰۰۳۰٫۶×

ردیف آخر را با ردیف قبلش مقایسه کنید. رفتن از دو راند به سه راند، ۸٬۷۰۰ توکن ورودی اضافه می‌کند — بیشتر از کل ۶٬۶۰۰ توکنی که دو راند اول مصرف کرده بودند. دلیلش ساده است: در راند سوم، هر ایجنت باید پاسخ‌های هر سه ایجنت در دو راند قبل را بخواند.

فرمول کلی

در پیاده‌سازی ساده‌ای که هر ایجنت در هر راند، پرسش و تمام پاسخ‌های راندهای قبلی را می‌خواند، کل توکن ورودی برابر است با N·R·P + N²·A·R(R−1)/2. جمله‌ی تاریخچه نسبت به N و R درجه‌دوم است؛ بنابراین وقتی تاریخچه بخش غالب هزینه باشد، دو برابر کردن تعداد ایجنت‌ها می‌تواند هزینه را به حدود چهار برابر نزدیک کند، نه همیشه دقیقاً چهار برابر.

Prompt caching می‌تواند هزینه‌ی صورتحسابِ بخش‌های تکراری را کم کند، اما رشد تاریخچه، محدودیت پنجره‌ی زمینه و زمان پردازش را حذف نمی‌کند؛ ضمن اینکه میزان صرفه‌جویی به API و یکسان بودن پیشوندها بستگی دارد. خلاصه‌سازی تاریخچه یا ارسال انتخابی پیام‌ها می‌تواند فرمول واقعی را تغییر دهد.

این فرمول، توصیه‌ی «ایجنت اضافه کن نه راند» را پیچیده‌تر می‌کند: افزودن ایجنت هم گران است و فقط وقتی ارزش دارد که روی داده‌ی شما سود بیشتری نشان دهد. اگر بودجه محدود دارید، ترتیب درست این است: اول پرامپت را قوی کنید (بخش ۱۱)، بعد self-consistency، و مناظره را برای آخر بگذارید.

این محاسبه فقط توکن را می‌شمارد. داده‌ی میدانی Anthropic نشان می‌دهد سیستم‌های چندایجنتی در عمل حدود ۱۵ برابر یک مکالمه‌ی ساده توکن مصرف می‌کنند۱۸، و تیم Cognition استدلال می‌کند هزینه‌ی پنهان بزرگ‌تر جای دیگری است: اشکال‌زدایی و ناسازگاری خروجی‌ها.۱۹ برای تصویر کامل — شامل تأخیر و هزینه‌ی نگهداری — بخش هزینه در راهنمای سیستم چندایجنتی را ببینید.

۱۷

پیاده‌سازی عملی، از ارزان به گران

پاسخ کوتاه

هرگز از مناظره شروع نکنید. مسیر درست پنج گام دارد و در بیشتر پروژه‌های واقعی، گام دوم — یک تولیدکننده و یک منتقد — کافی است. برای کسب‌وکارهای ایرانی که با مدل‌های لوکال کار می‌کنند، تنوع خانواده‌ی مدل مهم‌تر از تعداد است.

گامساختارهزینهکِی کافی است
۰یک فراخوان + پرامپت قوی با مثال۱×خط پایه. همیشه اول این را بسازید و اندازه بگیرید
۱تولیدکننده + منتقد۲×بیشترین سود به‌ازای کمترین هزینه. برای اکثر کاربردها کافی است
۲رأی‌گیری ۳ نمونه (بدون بحث)۳×وقتی خطاها تصادفی‌اند نه سیستماتیک
۳مناظره‌ی ۳ مدل متفاوت، ۱ راند۳×وقتی گام ۲ کافی نبود و به دلیل نیاز دارید
۴مناظره + مخالفِ کاشته + داور مستقل۱۳×+ارزیابی و کنترل کیفیت — نه پاسخ‌دهی
اشتباه رایج در انتخاب مدل لوکال

سه نمونه از یک مدل واحد با دمای بالا، مناظره نیست. آن‌ها همان توزیع را نمونه‌برداری می‌کنند و خطاهای سیستماتیک مشترک دارند — یعنی خطاها هم‌بسته‌اند و شرط استقلال کندورسه برقرار نیست. اگر مدل شما باور غلطی دارد، هر سه نمونه همان را می‌گویند و «اجماع» شما یک خطای تثبیت‌شده است.

پرامپت آماده: مناظره‌کننده

# نقش
تو یکی از چند کارشناس مستقل هستی که روی یک مسئله کار می‌کنند.

# وظیفه در این راند
۱. پاسخ‌های سایر کارشناسان را بخوان.
۲. برای هر پاسخِ متفاوت با خودت، دقیقاً مشخص کن اختلاف از کجاست:
   از فرض اولیه، از یک گام محاسبه، یا از تفسیر صورت مسئله.
۳. اگر خطایی در استدلال خودت پیدا کردی، صریح بگو کجا بود.
۴. پاسخ نهایی این راندت را بده.

# قواعد سخت
- فقط وقتی نظرت را عوض کن که دلیل مشخصی دیده باشی.
- صرفِ اینکه اکثریت چیز دیگری گفته، دلیل نیست. اقلیت بودن اشکالی ندارد.
- «موافقم» بدون ذکر دلیل، پاسخ نامعتبر است.
- اگر مطمئن نیستی، میزان تردیدت را بنویس؛ تظاهر به قطعیت نکن.

# قالب خروجی
تحلیل اختلاف: ...
اصلاح خودم (در صورت وجود): ...
پاسخ این راند: ...
میزان اطمینان (۰ تا ۱۰۰): ...

هر یک از چهار «قاعده‌ی سخت» مستقیماً از یک یافته‌ی پژوهشی می‌آید: قاعده‌ی اول و دوم برای مهار سرکوب اقلیت (بخش ۱۰)، قاعده‌ی سوم برای جلوگیری از هم‌گرایی توخالی که استقلال آرا را نابود می‌کند (بخش ۰۹)، و قاعده‌ی چهارم برای اینکه شرط توقف بتواند پایداری واقعی را تشخیص دهد.

پرامپت مخالفِ کاشته

# نقش
تو منتقد رسمی این مناظره‌ای. در رأی‌گیری نهایی شرکت نمی‌کنی.

# وظیفه
قوی‌ترین استدلال ممکن علیه پاسخی که اکثریت روی آن توافق کرده‌اند بساز —
حتی اگر خودت آن پاسخ را درست می‌دانی.

# قواعد
- به یک نقطه‌ی مشخص حمله کن، نه به کلیت پاسخ.
- اگر پس از تلاش جدی هیچ حفره‌ای پیدا نکردی، صریح بنویس:
  «حفره‌ای پیدا نشد» — این خودش یک سیگنال اعتماد است.
- استدلال ساختگی نساز؛ ضعف واقعی پیدا کن.

شرط توقف — مهم‌ترین قطعه

مناظره را با «سقف راند» متوقف نکنید. چهار سیگنال را ترکیب کنید:

  1. پایداری. اگر توزیع پاسخ‌ها بین دو راند متوالی تغییر نکرد، تمام.
  2. اجماع زودهنگام. اگر همه در راند اول موافق بودند، راند دوم را اجرا نکنید.
  3. سقف سخت. حداکثر ۲ تا ۳ راند، به‌عنوان محافظ نه هدف.
  4. سقف بودجه. سقف توکن یا هزینه‌ی هر پرسش، مستقل از وضعیت مناظره.

مفهوم شرط توقف مرکب، همان چیزی است که در مهندسی حلقه به‌عنوان شاخص بلوغ یک سیستم ایجنتی معرفی شده — و در مناظره اهمیتش دوچندان است، چون طبق بخش ۱۶ هر راند اضافه هزینه‌ی درجه‌دوم دارد.

۱۸

هفت اشتباه رایج در پیاده‌سازی مناظره

۱

خط پایه‌ی نادرست

مناظره‌ی سه‌ایجنتی را با یک فراخوان تکی مقایسه می‌کنید و ذوق‌زده می‌شوید.

درست: با سه فراخوان مستقل و رأی‌گیری مقایسه کنید. اگر برتری معناداری نماند، مناظره ارزش ندارد.
۲

راند اضافه کردن برای بهبود

نتیجه بد است، پس تعداد راندها را از ۲ به ۵ می‌برید. هم عملکرد پایین می‌آید هم هزینه درجه‌دوم بالا می‌رود.

درست: تعداد ایجنت‌ها را زیاد کنید نه راندها.
۳

یک مدل، چند نمونه

سه نمونه از یک مدل با دمای بالا اجرا می‌کنید و اسمش را مناظره می‌گذارید. خطاها هم‌بسته‌اند.

درست: مدل‌های متفاوت از خانواده‌های متفاوت. تنوع، محرک اصلی است.
۴

پرامپتی که به توافق تشویق می‌کند

نوشته‌اید «با هم به یک نتیجه برسید» — و مدل‌ها هم می‌رسند، به هر قیمتی.

درست: صریحاً بگویید اقلیت ماندن اشکالی ندارد و توافق بدون دلیل نامعتبر است.
۵

نداشتن مخالفِ کاشته

به تنوع طبیعی مدل‌ها امید بسته‌اید تا اجماع زودهنگام را بشکند. معمولاً نمی‌شکند.

درست: یک ایجنت را موظف به مخالفت کنید و او را از رأی‌گیری نهایی خارج نگه دارید.
۶

داور از خانواده‌ی یکی از طرفین

داور و یکی از مناظره‌کننده‌ها یک مدل پایه دارند. نتیجه از پیش کج است.

درست: داور را از خانواده‌ی سومی انتخاب کنید، یا به‌جای داور از رأی‌گیری استفاده کنید.
۷

کپی کردن تنظیمات از یک مقاله

پیکربندی یک مخزن گیت‌هاب را برمی‌دارید و روی مدل و داده‌ی خودتان اجرا می‌کنید.

درست: تنظیمات مناظره بین مدل‌ها و مجموعه‌داده‌ها منتقل نمی‌شوند. روی داده‌ی خودتان تنظیم کنید.
۱۹

جمع‌بندی: بالاخره بسازیم یا نه؟

پاسخ کوتاه

برای بالا بردن دقت پاسخ، مناظره معمولاً بهترین ابزار نیست — پرامپت بهتر و رأی‌گیری ساده ارزان‌تر و قابل‌اتکاترند. مناظره وقتی ارزش دارد که به چیزی بیش از پاسخ نیاز داشته باشید: یک ارزیابی چندبعدی، یک استدلال قابل بازرسی، یا سازوکاری برای نظارت بر مدلی که از ناظرش تواناتر است.

هدف شماتوصیهچرا
دقت بیشتر در پرسش‌های بستهپرامپت قوی‌تر، بعد رأی‌گیریایجنت تکی با مثال، تقریباً به همان نتیجه می‌رسد
کاهش توهم در تولید محتواتولیدکننده + منتقدبیشترین اثر به‌ازای کمترین هزینه
ارزیابی کیفیت خروجیمناظره ✓ارزیابی چندبعدی است؛ تنوع اطلاعات غیرهم‌بسته تولید می‌کند
نیاز به استدلال قابل بازرسیمناظره ✓ردِ بحث، خودش خروجی است نه فقط ابزار
نظارت بر مدل تواناتر از ناظرمناظره ✓یکی از روش‌های دارای شواهد تجربی مستقیم در این حوزه
سرعت یا هزینه‌ی پایینمناظره ✕هزینه‌ی ورودی درجه‌دوم رشد می‌کند
مدل ضعیف‌تر از شانس روی وظیفهمناظره ✕طبق کندورسه، ایجنت بیشتر خطا را تقویت می‌کند

مناظره برای پیدا کردن پاسخ ابزار ضعیفی است، اما برای سنجیدن پاسخ ابزار قدرتمندی است.

می‌خواهید کیفیت پاسخ‌های ربات‌تان را بالا ببرید؟

در فیلتور پیش از هر معماری پیچیده‌ای، خط پایه را اندازه می‌گیریم و ارزان‌ترین راهکاری را پیشنهاد می‌دهیم که مسئله را حل کند. اگر پاسخ «مناظره لازم ندارید» باشد، همین را می‌گوییم.

مطالب مرتبط و ادامه‌ی مسیر

۲۰

پرسش‌های پرتکرار

بخشی از بهبود واقعی است، اما پژوهش NeurIPS 2025 نشان داد بخش عمده‌ی سود معمولاً از رأی‌گیری می‌آید. در چارچوب نظری همان مقاله، بحث به‌تنهایی امید ریاضی درستی را بالا نمی‌برد. اگر فقط دنبال دقت بیشتر هستید، ابتدا رأی‌گیری ساده را با همان تعداد فراخوان آزمایش کنید.

قضیه‌ی کندورسه (۱۷۸۵) می‌گوید رأی اکثریت وقتی به حقیقت نزدیک می‌شود که رأی‌دهندگان مستقل باشند و هرکدام با احتمال بیش از ۵۰٪ درست تصمیم بگیرند. مناظره دقیقاً شرط استقلال را نقض می‌کند: وقتی ایجنت‌ها پاسخ هم را می‌بینند، خطاهایشان هم‌بسته می‌شود و رأی‌گیری قدرت فیلتر کردن خطا را از دست می‌دهد.

در self-consistency چند پاسخ مستقل تولید و رأی اکثریت انتخاب می‌شود و ایجنت‌ها پاسخ هم را نمی‌بینند. در مناظره هر ایجنت پاسخ دیگران را در زمینه‌ی خود می‌بیند و بازنگری می‌کند. مناظره چند برابر گران‌تر است ولی در مقایسه‌های مستقل، برتری قابل‌اتکایی نشان نداده.

۳ تا ۵ ایجنت و ۱ تا ۲ راند. شواهد ۲۰۲۵ نشان می‌دهد افزایش تعداد ایجنت‌ها عملکرد را بهتر و افزایش تعداد راندها آن را بدتر می‌کند. ضمناً هزینه‌ی راندها به‌صورت درجه‌دوم رشد می‌کند نه خطی، چون هر راند کل تاریخچه را دوباره وارد زمینه می‌کند.

فنی بله، ولی سود کمی دارد. سه نمونه از یک مدل همان توزیع را نمونه‌برداری می‌کنند و خطاهای سیستماتیک مشترک دارند؛ یعنی خطاها هم‌بسته‌اند و رأی‌گیری نمی‌تواند آن‌ها را فیلتر کند. مطالعه‌ی کنترل‌شده‌ی ۲۰۲۵ نشان داد محرک اصلی موفقیت، تنوع گروه است.

ایجنتی است که موظف می‌شود قوی‌ترین نقد ممکن را علیه پاسخ غالب بسازد و در رأی نهایی شرکت نکند. این الگو از آزمایش هم‌رنگی اَش الهام گرفته، اما برای LLMها یک پیشنهاد طراحی است نه قانون اثبات‌شده؛ باید اثرش روی داده‌ی واقعی اندازه‌گیری شود.

ارزیابی و داوری، و نظارت بر مدل‌های تواناتر از ناظر. ارزیابی ذاتاً چندبعدی است و هر ایجنت می‌تواند بُعد متفاوتی را ببیند. در یک آزمایش، دقت داورهای انسانی غیرمتخصص با مناظره از ۶۰٪ به ۸۸٪ رسید؛ در آزمایش اولیه‌ی OpenAI در ۲۰۱۸ هم دقت داور از ۵۹٫۴٪ به ۸۸٫۹٪ رفت.

در بسیاری موارد بله. پژوهشی در ۲۰۲۴ نشان داد یک ایجنت تکی با پرامپت قوی — شامل مثال‌های درون‌زمینه‌ای و شرح دقیق مسئله — تقریباً به همان عملکرد بهترین روش‌های مناظره می‌رسد. برتری مناظره عمدتاً در حالت بدون مثال (zero-shot) دیده می‌شود.

با سقف راند متوقف نکنید. چهار سیگنال را ترکیب کنید: پایداری توزیع پاسخ‌ها بین دو راند، اجماع زودهنگام در راند اول، سقف سخت ۲ تا ۳ راند به‌عنوان محافظ، و سقف بودجه‌ی مستقل. توقف تطبیقی از ۲۰۲۳ به‌عنوان یکی از عوامل اصلی سود مناظره شناخته شده است.

۲۱

واژه‌نامه

مناظره‌ی چندایجنتیMulti-Agent Debate
پروتکلی که در آن چند مدل زبانی پاسخ یکدیگر را می‌بینند، نقد می‌کنند و طی چند راند به پاسخ نهایی می‌رسند.
قضیه‌ی کندورسهCondorcet Jury Theorem
اگر رأی‌دهندگان مستقل باشند و هرکدام با احتمال بیش از ۵۰٪ درست تصمیم بگیرند، احتمال درستی رأی اکثریت با افزایش تعدادشان به ۱ میل می‌کند.
خطای هم‌بستهCorrelated Error
خطایی که چند ایجنت به‌طور مشترک مرتکب می‌شوند؛ رأی‌گیری نمی‌تواند آن را فیلتر کند.
زوال اندیشهDegeneration-of-Thought
ناتوانی مدل در تولید فکر تازه پس از تثبیت اطمینان به پاسخ خود، حتی هنگام خودبازبینی.
خودسازگاریSelf-Consistency
تولید چند پاسخ مستقل و انتخاب رأی اکثریت، بدون اینکه ایجنت‌ها پاسخ هم را ببینند.
مارتینگلMartingale
فرایند تصادفی که بهترین پیش‌بینی برای مقدار بعدی‌اش، مقدار فعلی است.
توقف تطبیقیAdaptive Break
پایان دادن به مناظره در لحظه‌ی پایداری پاسخ‌ها، به‌جای اجرای تعداد ثابتی راند.
سرکوب اقلیتMajority Suppression
پدیده‌ای که در آن فشار توافق گروهی، ایجنتِ دارای پاسخ درست را وادار به عقب‌نشینی می‌کند.
مخالفِ کاشتهPlanted Dissenter
ایجنتی که از پیش موظف است موضع مخالف بگیرد تا اجماع زودهنگام شکسته شود.
بایاس داورJudge Bias
گرایش داور LLM به مناظره‌کننده‌ای که همان مدل پایه را دارد.
نظارت مقیاس‌پذیرScalable Oversight
روش‌هایی برای اینکه ناظر ضعیف‌تر بتواند خروجی مدل تواناتر را ارزیابی کند؛ مناظره یکی از آن‌هاست.
میزان توافق‌پذیریAgreeableness
تمایل ایجنت به پذیرش نظر دیگران؛ متغیری که تنظیمش تا ۱۵٪ عملکرد را جابه‌جا کرد.
۲۲

منابع

اعداد و یافته‌های محوری این مقاله تا حد امکان از مقاله‌ی اصلی، نسخه‌ی رسمی کنفرانس یا انتشار مستقیم سازمان سازنده گرفته شده‌اند؛ موارد استنتاجی نیز در متن از نتایج قطعی جدا شده‌اند.

  1. Condorcet's Jury Theorem — قضیه‌ی هیئت‌منصفه، و Jury Theorems در دانشنامه‌ی فلسفه‌ی استنفورد.Marquis de Condorcet, 1785نظریه
  2. Studies of Independence and Conformity — گزارش اصلی آزمایش‌های استقلال و هم‌رنگی.Solomon Asch, 1956روان‌شناسی
  3. Society of Mind — نظریه‌ی پیدایش هوش از تعامل عوامل ساده.Marvin Minsky, 1986مبانی
  4. AI Safety via Debate — طرح اولیه‌ی مناظره برای نظارت (شرح OpenAI).Irving, Christiano, Amodei — 2018arXiv
  5. Improving Factuality and Reasoning in Language Models through Multiagent Debate — مقاله‌ی مرجع، جدول‌های ۱ و ۲.Du et al. — ICML 2024داوری‌شده
  6. Multi-AI collaboration helps reasoning and factual accuracy in LLMs — شرح رسمی MIT.MIT News — 2023دانشگاهی
  7. Encouraging Divergent Thinking in LLMs through Multi-Agent Debate — مفهوم زوال اندیشه و چارچوب فرشته/شیطان.Liang et al. — EMNLP 2024داوری‌شده
  8. Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs — مقایسه‌ی سیستماتیک با روش‌های رقیب.Smit et al. — ICML 2024داوری‌شده
  9. Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key? — ایجنت تکی با پرامپت قوی.2024arXiv
  10. Debating with More Persuasive LLMs Leads to More Truthful Answers — دقت داور غیرمتخصص ۶۰ به ۸۸ درصد.Khan et al. — ICML 2024داوری‌شده
  11. Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models? — چارچوب مارتینگل و تفکیک اثر رأی از بحث.NeurIPS 2025 Spotlightداوری‌شده
  12. Voting or Consensus? Decision-Making in Multi-Agent Debate — تفکیک وظایف دانشی و استدلالی.ACL 2025 Findingsداوری‌شده
  13. Can LLM Agents Really Debate? A Controlled Study of Multi-Agent Debate in Logical Reasoning — تنوع در برابر ساختار، و سرکوب اقلیت.2025arXiv
  14. ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate — مناظره برای ارزیابی.Chan et al. — ICLR 2024داوری‌شده
  15. Multi-Agent Debate for LLM Judges with Adaptive Stability Detection — توقف تطبیقی آماری.2025arXiv
  16. Multi-LLM-Agents Debate — Performance, Efficiency and Scaling Challenges — بررسی روی ۹ محک.ICLR 2025 Blogpostsتحلیل پژوهشی
  17. Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks — اثر ناهمگنی گروه.2024arXiv
  18. How we built our multi-agent research system — داده‌ی مصرف توکن سیستم‌های چندایجنتی.Anthropic Engineering — 2025صنعتی
  19. Don't Build Multi-Agents — موضع مقابل درباره‌ی معماری چندایجنتی.Walden Yan, Cognition — 2025صنعتی
  20. Scalable AI Safety via Doubly-Efficient Debate — صورت‌بندی نظری مناظره در نظارت.Brown-Cohen et al.arXiv