آنچه شواهد میگویند
در سه سال گذشته، دهها مقالهی پژوهشی این پرسش را آزمودند که آیا چند مدل زبانی که با هم بحث میکنند به پاسخ بهتری میرسند یا نه. پاسخ کوتاه «بله» نیست، «نه» هم نیست — پاسخ این است که سودِ مشاهدهشده از جای دیگری میآید و ما سه سال آن را اشتباه نسبت دادهایم.
- موج اول (۲۰۲۳). سه مدل با دو راند مناظره، دقت حساب را از ۶۷٪ به ۸۱٫۸٪ و MMLU را از ۶۳٫۹٪ به ۷۱٫۱٪ رساندند۵. جامعهی فنی نتیجه گرفت «چند مدل بهتر از یکی است».
- تردید (۲۰۲۴). یک مقایسهی سیستماتیک نشان داد مناظره بهطور قابلاتکا از روشهای سادهتری مثل self-consistency بهتر نیست — فقط بسیار حساستر به تنظیمات است۸.
- ضربهی اصلی (۲۰۲۵). در چارچوب نظری مقالهی «Debate or Vote»، مسیر باور ایجنتها بهصورت مارتینگل مدلسازی شد؛ نتیجه این بود که تحت فرضهای همان مدل، بحث بهتنهایی امید ریاضیِ درستی را بالا نمیبرد و بخش عمدهی سود از رأیگیری اکثریت میآید۱۱.
- ریشهی مسئله. رأیگیری وقتی کار میکند که آرا مستقل باشند — شرط اصلی قضیهی کندورسه۱. مناظره با نشان دادن پاسخها به یکدیگر، دقیقاً همین استقلال را از بین میبرد.
- چیزی که واقعاً کار میکند. تنوع مدلها، نه ساختار مناظره. ترتیب صحبت و نمایش میزان اطمینان تقریباً بیاثرند۱۳.
- جایی که مناظره بیرقیب است. داوری و نظارت. دقت داور غیرمتخصص انسانی با مناظره از ۶۰٪ به ۸۸٪ رسید۱۰.
مفاهیم پایهی سیستمهای چندایجنتی — معماریها، هزینهی توکن، پروتکلهای ارتباطی و چکلیست تصمیم — در راهنمای سیستم چندایجنتی آمده و اینجا تکرار نمیشود. این صفحه فقط یک الگو را تا انتها میکاود: مناظره.
تباری که به ۱۷۸۵ میرسد
مناظرهی مدلها یک اختراع دوران LLM نیست. پایهی ریاضیاش قضیهای است که مارکی دو کندورسه در ۱۷۸۵ دربارهی هیئتمنصفه اثبات کرد، الهام معماریاش از «جامعهی ذهن» مینسکی (۱۹۸۶) میآید، و شکل امروزیاش را یک مقالهی ایمنی هوش مصنوعی در ۲۰۱۸ پیشنهاد داد — پنج سال پیش از آنکه کسی آن را روی LLM اجرا کند.
دانستن این تبار صرفاً آرایهی تاریخی نیست. هر حلقهی این زنجیره یک شرط با خود آورده که در پیادهسازیهای امروزی نادیده گرفته میشود — و بیشتر شکستهای عملی مناظره، دقیقاً نقض همان شرطهاست.
قضیهی هیئتمنصفهی کندورسه
اگر هر رأیدهنده مستقل تصمیم بگیرد و با احتمالی بیش از ۵۰٪ درست باشد، با افزایش تعداد رأیدهندگان احتمال درستی رأی اکثریت به ۱ میل میکند. این ریاضیاتِ پشتِ هر ensemble و هر self-consistency است.۱
آزمایش همرنگی سالومون اَش
وقتی گروه بهاتفاق پاسخ آشکارا غلطی میداد، حدود یکسوم افراد با آن همرنگ میشدند — در حالی که نرخ خطا در تنهایی زیر ۱٪ بود. اولین سند تجربی از اینکه بحث گروهی میتواند پاسخ درست را حذف کند.۲
«جامعهی ذهن» ماروین مینسکی
هوش از یک سازوکار واحد نمیآید، بلکه از تعامل عوامل سادهی متعدد پدید میآید. این کتاب، نامِ استعاری بسیاری از چارچوبهای مناظرهی امروزی را به آنها داد.۳
«ایمنی هوش مصنوعی از راه مناظره»
پنج سال پیش از موج LLM، پژوهشگران OpenAI مناظره را نه برای دقت، بلکه برای نظارت پیشنهاد دادند: دو ایجنت بحث میکنند تا داور انسانیِ ضعیفتر بتواند قضاوت کند.۴
اولین اجرای گسترده روی LLM
سه مدل، دو راند، شش محک، بهبود ۷ تا ۱۶ درصدی. مقالهای که کل این حوزه را ساخت۵ و رسانههای دانشگاهی آن را «همکاری چند هوش مصنوعی» نامیدند.۶
مقایسههای مستقل
مناظره از self-consistency بهتر نیست۸؛ و یک ایجنت تکی با پرامپت قوی تقریباً به همان نتیجه میرسد۹.
اثبات مارتینگل
بحث بهتنهایی امید ریاضی درستی را بالا نمیبرد. رأیگیری بخش عمدهی سود را توضیح میدهد.۱۱
تنوع و کیفیت اولیه، مهمتر از جزئیات ساختار
محرک واقعی موفقیت، قدرت استدلال ذاتی و تنوع گروه است — نه مهندسی پروتکل مناظره.۱۳
هر ادعایی دربارهی مناظرهی مدلها باید با پرسش کندورسه سنجیده شود: آیا ایجنتهای من مستقلاند، و آیا هرکدام بهتر از شانس عمل میکنند؟
مناظرهی چندایجنتی دقیقاً چیست؟
پروتکلی که در آن چند مدل زبانی مستقل به یک پرسش پاسخ میدهند، سپس در یک یا چند راند پاسخهای یکدیگر را میبینند و پاسخ خود را بازنگری میکنند. در پایان یا به اجماع میرسند یا با رأیگیری یک پاسخ انتخاب میشود.
تفاوت مناظره با دو روش شبیه به آن، جایی است که بیشتر سوءتفاهمها از آن شروع میشود:
| روش | ایجنتها همدیگر را میبینند؟ | آرا مستقلاند؟ | هزینه |
|---|---|---|---|
| Self-Consistency | خیر | بله | N فراخوان |
| Ensemble چندمدلی | خیر | بله | N فراخوان |
| مناظره (MAD) | بله | خیر | N × راند فراخوان |
ستون سوم را بهخاطر بسپارید. مناظره از نظر ساختاری «self-consistency بهعلاوهی دیدن پاسخ دیگران» است، و همان «دیدن» است که استقلال آرا را از بین میبرد. کل بحث پژوهشی سه سال گذشته حول یک پرسش میچرخد: آیا اطلاعاتی که از دیدن پاسخ دیگران به دست میآید، بیشتر از استقلالی است که از دست میرود؟
شکل یک مناظرهی واقعی
نمونهی سادهشدهی یک مناظرهی دو راندی روی یک مسئلهی حساب:
این دقیقاً همان چیزی است که طرفداران مناظره را هیجانزده میکند: یک مدل خطا کرد و دیدن استدلال دیگری اصلاحش کرد. اما همین نمونه پرسش کلیدی را پنهان کرده — اگر بدون هیچ بحثی فقط رأی میگرفتیم، آیا به همان جواب نمیرسیدیم؟ در بخش ۰۸ به این برمیگردیم.
مسئلهای که مناظره قرار بود حل کند
«زوال اندیشه» (Degeneration-of-Thought) توضیح میدهد چرا خودبازبینیِ یک مدل کافی نیست: وقتی مدلی به پاسخ خود اطمینان پیدا کرد، حتی اگر آن پاسخ غلط باشد، در بازبینیهای بعدی نمیتواند فکر تازهای تولید کند. مناظره برای شکستن همین بنبست پیشنهاد شد.
پژوهشگران سه ریشه برای این پدیده شناسایی کردند: ادراک تحریفشده از دادهی آموزشی، مقاومت در برابر تغییر باور تثبیتشده، و نبود دیدگاه بیرونی۷. مورد سوم کلید ماجراست — مدل نمیتواند چیزی را ببیند که در زمینهاش نیست. اگر با نحوهی ساخت و مدیریت زمینه آشنا نیستید، مهندسی زمینه پایههای آن را توضیح میدهد.
راهحل پیشنهادی، ساختاری با سه نقش بود: دو مناظرهکننده که موظفاند مواضع مخالف بگیرند و «مو به مو» پاسخ هم را رد کنند؛ یک داور با دو حالت کاری (تشخیص اجماع و استخراج پاسخ نهایی)؛ و فرا-پرامپتهایی که موضوع، سقف تکرار و قواعد را تعیین میکنند.
نتایج قابل توجه بودند: روی محک استدلال ضدشهودی، دقت از ۲۶٪ به ۳۷٪ رسید. و روی ترجمهی ماشینی، نسخهی مناظرهایِ یک مدل نسل قبل امتیاز انسانی ۳٫۷۸ گرفت — بالاتر از مدل نسل بعدی که بهتنهایی ۳٫۴۱ گرفته بود.
۱. «توقف تطبیقی» حیاتی بود — یعنی توانایی مناظره برای تمامشدن در لحظهی درست، نه ادامه دادن تا سقف راند. سود اصلی از همینجا میآمد. ۲. داورها بیطرف نبودند — داور LLM به مناظرهکنندهای که همان مدل پایه را داشت گرایش نشان میداد. اگر داور و یکی از طرفین از یک خانواده باشند، نتیجه از پیش کج است.
موج اول: اعدادی که همه را هیجانزده کرد
مقالهی مرجع این حوزه با سه مدل زبانی که دو راند مناظره میکردند، روی شش محک آزمایش شد. بهبودها بزرگ و یکدست بودند: حساب از ۶۷٪ به ۸۱٫۸٪، ریاضی مدرسه از ۷۷٪ به ۸۵٪، MMLU از ۶۳٫۹٪ به ۷۱٫۱٪ و صحت زیستنامهها از ۶۶٪ به ۷۳٫۸٪.
| محک | ایجنت تکی | مناظره (۳ ایجنت، ۲ راند) | تغییر |
|---|---|---|---|
| حساب (Arithmetic) | ۶۷٫۰٪ | ۸۱٫۸٪ | +۱۴٫۸ |
| ریاضی مدرسه (Grade School Math) | ۷۷٫۰٪ | ۸۵٫۰٪ | +۸٫۰ |
| MMLU | ۶۳٫۹٪ | ۷۱٫۱٪ | +۷٫۲ |
| صحت زیستنامه (Biographies) | ۶۶٫۰٪ | ۷۳٫۸٪ | +۷٫۸ |
| اعتبار حرکت شطرنج | ۲۹٫۳٪ | ۴۵٫۲٪ | +۱۵٫۹ |
| کیفیت حرکت شطرنج (امتیاز) | ۹۱٫۴ | ۱۲۲٫۹ | +۳۱٫۵ |
و دو نمودار که بعداً محل مناقشه شد: با افزایش تعداد ایجنتها عملکرد یکنواخت بالا میرفت، و با افزایش تعداد راندها هم — وقتی تعداد ایجنت روی ۳ ثابت بود۵. دومی همان یافتهای است که پژوهشهای بعدی معکوسش کردند.
این اعداد واقعیاند و کسی آنها را رد نکرده. چیزی که رد شد، تفسیرِ آنها بود: خط پایهی مقایسه یک فراخوان تکی بود، نه سه فراخوان مستقل.
پنج متغیری که همهچیز را تعیین میکنند
هر پیادهسازی مناظره پنج تصمیم طراحی دارد: چند ایجنت، چند راند، با چه میزان توافقپذیری، با چه پروتکل تصمیمگیری، و با چه شرط توقفی. شواهد نشان میدهد این پنج متغیر — نه انتخاب مدل — بیشترین اثر را روی نتیجهی نهایی دارند.
| متغیر | اثر مشاهدهشده | توصیهی مبتنی بر شواهد |
|---|---|---|
| تعداد ایجنت | مثبت و نسبتاً پایدار | ۳ تا ۵ — بیشتر از این سود نهایی کم و هزینه خطی است |
| تعداد راند | مثبت در مقالهی ۲۰۲۳، منفی در پژوهشهای بعدی | ۱ تا ۲ راند. راند سوم بهندرت ارزش دارد |
| میزان توافقپذیری | بسیار زیاد — تنظیمش تا ۱۵٪ عملکرد را جابهجا کرد | صریحاً در پرامپت بگویید «بهراحتی تسلیم نشو» |
| پروتکل تصمیم | وابسته به نوع مسئله | اجماع برای پرسش دانشی، رأیگیری برای استدلالی |
| شرط توقف | حیاتی — عامل اصلی سود در مقالات اولیه | وقتی توزیع پاسخها پایدار شد متوقف کنید، نه وقتی سقف راند پر شد |
متغیر سوم غیرمنتظرهترین است. در یک مطالعهی مقایسهای، صرفاً تنظیم میزان توافقپذیری ایجنتها از طریق پرامپت، یکی از استراتژیهای مناظره را از بدترین به بهترین تبدیل کرد — حدود ۱۵ درصد جابهجایی۸. یک جمله در پرامپت، اثری بزرگتر از تعویض کل معماری داشت.
تردید اول: «آیا باید MAD برویم؟»
در ۲۰۲۴ یک مقایسهی سیستماتیک، چند استراتژی مناظره را در برابر روشهای پرامپتنویسی رقیب گذاشت. نتیجه سرد بود: سیستمهای مناظره در شکل کنونیشان بهطور قابلاتکا از روشهایی مثل self-consistency و ensembling بهتر عمل نمیکنند — و بهمراتب گرانترند.
یافتهی مرکزی ظریفتر از «مناظره بد است» بود. نویسندگان نوشتند پروتکلهای مناظره ذاتاً بدتر از رویکردهای دیگر نیستند، بلکه به تنظیمات هایپرپارامتر بسیار حساسترند و بهینهسازیشان سخت است۸. مناظره یک ابزار پرنوسان است: با تنظیم درست خوب، با تنظیم پیشفرض بد.
- تنظیمات بهینه به مجموعهداده وابستهاند. هیچ پیکربندی واحدی روی محکهای پزشکی و غیرپزشکی همزمان برنده نبود.
- انتقال بین مدلها ناپایدار است. تنظیماتی که به یک مدل مرزی منتقل میشد، به یک مدل متنباز کوچکتر منتقل نشد.
- هزینه توجیه ندارد. فراخوان و توکن بهمراتب بیشتر، بدون تضمین بهبود دقت.
یک سال بعد، بررسی مستقل دیگری روی نُه محک با دو مدل مختلف، همین نتیجه را تأیید کرد: چارچوبهای مناظره بهطور مداوم از استراتژیهای سادهی محاسبه در زمان استنتاج — مثل زنجیرهی تفکر و self-consistency — بهتر عمل نکردند، و افزایش بودجهی محاسباتی هم لزوماً دقت را بالا نبرد۱۶.
اگر معماری مناظرهای را از یک مقاله یا مخزن گیتهاب کپی کنید و روی مدل و دادهی خودتان اجرا کنید، احتمال قابل توجهی هست که نتیجه بدتر از یک فراخوان ساده باشد — و این نه بهخاطر اشتباه شما، بلکه ویژگی ذاتی این روش است.
ضربهی اصلی: بحث یا رأی؟
مقالهی «Debate or Vote» در ۲۰۲۵ یک چارچوب نظری ارائه داد که در آن مسیر باور ایجنتها بهصورت مارتینگل مدل میشود. نتیجه، تحت فرضهای همان چارچوب، این است که بحث بهتنهایی امید ریاضیِ درستبودن پاسخ را بالا نمیبرد و بخش عمدهی سود مشاهدهشده از رأیگیری اکثریت میآید.
مارتینگل مفهومی از نظریهی احتمال است: فرایندی که در آن بهترین پیشبینی شرطی برای مقدار بعدی، مقدار فعلی است. بنابراین در مدل نظری آن مقاله، راند اضافه بهخودیِ خود تضمینی برای نزدیکتر شدن به پاسخ درست ندارد؛ البته مداخلههای جهتدار، داور بهتر یا اطلاعات تازه میتوانند این فرض خنثی را بشکنند.
«رأیگیری اکثریت بهتنهایی، بخش عمدهی بهبودی را که معمولاً به مناظره نسبت داده میشود توضیح میدهد.»
Debate or Vote — NeurIPS 2025 (Spotlight)پس چرا آزمایشهای ۲۰۲۳ بهبود نشان دادند؟
چون در آن آزمایشها، مناظره و رأیگیری از هم تفکیک نشده بودند. وقتی سه ایجنت پاسخ میدهند و در پایان پاسخ غالب انتخاب میشود، دو اثر همزمان در کارند:
- اثر آماری. میانگینگیری روی چند نمونه، نویز تصادفی را کم میکند. این اثر بدون هیچ بحثی هم وجود دارد — و دقیقاً همان چیزی است که کندورسه در ۱۷۸۵ اثبات کرد.
- اثر اطلاعاتی. ایجنت با دیدن استدلال دیگری چیز تازهای میفهمد و نظرش عوض میشود.
خط پایهی درست برای سنجش مناظره، «یک فراخوان تکی» نیست — «همان تعداد فراخوان، ولی بدون دیدن پاسخ دیگران» است. وقتی این خط پایهی منصفانه گذاشته شد، بخش عمدهی برتری ناپدید شد.
پیش از هر ادعایی دربارهی مناظرهتان، خط پایهی self-consistency با همان تعداد فراخوان را اجرا کنید. اگر برتری معناداری نماند، شما مناظره نساختهاید — یک رأیگیری گران ساختهاید.
تناقض کندورسه: مناظره شرط خودش را نقض میکند
قضیهی کندورسه دو شرط دارد: رأیدهندگان باید مستقل باشند، و هرکدام باید با احتمال بیش از ۵۰٪ درست تصمیم بگیرند. مناظره شرط اول را عمداً میشکند — چون کل ایدهاش این است که ایجنتها روی هم اثر بگذارند. نتیجه: هرچه مناظره «موفقتر» باشد، رأیگیری پایانی بیاثرتر میشود.
در این مقاله، قضیهی کندورسه را بهعنوان یک توضیح شهودی مکمل برای فهم نتیجهی مارتینگل به کار میبریم؛ نه بهعنوان اثبات آن. این دو چارچوب فرضهای یکسانی ندارند، اما هر دو توجه را به استقلال آرا و نحوهی بهروزرسانی باورها جلب میکنند.
شرط اول: استقلال
کندورسه در ۱۷۸۵ نشان داد اگر هر رأیدهنده بهطور مستقل با احتمال p > ۰٫۵ درست تصمیم بگیرد، احتمال درستی رأی اکثریت با افزایش تعداد رأیدهندگان به ۱ میل میکند۱. کلمهی «مستقل» تزئینی نیست؛ موتور کل قضیه است. استقلال یعنی خطاهای رأیدهندگان با هم همبسته نیستند، پس در رأیگیری همدیگر را خنثی میکنند.
حالا مناظره را در نظر بگیرید. ایجنت ب پاسخ ایجنت الف را میبیند. اگر نظرش را عوض کند، رأی او دیگر شاهدِ مستقلی نیست — بازتابی از رأی الف است. شما فکر میکنید سه رأی دارید، اما در عمل شاید یک رأی و دو پژواک داشته باشید.
مناظره اطلاعات را بین ایجنتها جابهجا میکند و همزمان استقلال پاسخهای بعدی را کاهش میدهد. اینکه سود اطلاعاتی از زیان استقلال بیشتر باشد یا نه، به مدل، مسئله و پروتکل بستگی دارد. نتیجهی مارتینگل یک صورتبندی مشخص از این مسئله تحت فرضهای مقاله است، نه اثبات مستقیم قضیهی کندورسه برای LLMها.
شرط دوم: بهتر از شانس بودن
وجه کمتر شناختهشدهی قضیهی کندورسه، حالت معکوس آن است: اگر p < ۰٫۵ باشد — یعنی رأیدهندهها بهطور میانگین بیشتر غلط میگویند تا درست — آنگاه افزایش تعداد رأیدهندگان اوضاع را بدتر میکند، و بهترین هیئتمنصفه یک نفر است۱.
ترجمهی این حکم به زبان مهندسی هوش مصنوعی، هشداری جدی است: روی وظیفهای که مدل شما در آن ضعیفتر از شانس عمل میکند، اضافه کردن ایجنت دقت را بالا نمیبرد — آن را پایین میآورد. رأیگیری خطای سیستماتیک را تقویت میکند، نه فیلتر.
این نتیجه فقط وقتی مستقیم برقرار است که رأیها تقریباً مستقل باشند و هر ایجنت احتمال موفقیت نسبتاً ثابتی داشته باشد. نمونههای یک LLM معمولاً خطاهای همبسته دارند و مقدار p با نوع سؤال، پرامپت و زمینه تغییر میکند؛ پس این بخش یک هشدار مهندسی است، نه قانون تضمینشده برای همهی مدلها.
| وضعیت مدل روی وظیفه | اثر افزودن ایجنت | راهبرد درست |
|---|---|---|
| بهطور مطمئن بهتر از شانس (p بالا) | بهبود، اما با بازده نزولی | ۳ تا ۵ ایجنت مستقل، بدون بحث |
| حدوداً در مرز شانس (p ≈ ۰٫۵) | بهبود بسیار کند (متناسب با جذر تعداد) | مسئله را ساده کنید یا مدل را عوض کنید |
| ضعیفتر از شانس (p پایین) | بدتر شدن سیستماتیک | یک ایجنت + بازبینی انسانی |
چرا ۳ تا ۵ ایجنت؟ ریاضیاتش اینجاست
در تقریبهای مجانبیِ نزدیک به مرز شانس، نسبت سیگنال به نویز با جذر تعداد رأیدهندگان رشد میکند۱. پیام عملی، بازده نزولی است: افزایش تیم از سه به پنج ممکن است مفید باشد، اما جهش از ده به بیست فقط با آزمون روی دادهی واقعی توجیه میشود و بهخودیِ خود تضمینی برای بهبود ندارد.
این همان چیزی است که توصیهی تجربی «۳ تا ۵ ایجنت» را از یک قاعدهی سرانگشتی به یک نتیجهی قابل استنتاج تبدیل میکند — و توضیح میدهد چرا در بخش ۱۱ خواهیم دید افزودن ایجنت مفید است ولی افزودن راند مضر.
هر بار که به مناظرهتان ایجنت اضافه میکنید، بپرسید: آیا این ایجنت شاهدِ مستقلی است، یا فقط بلندگوی دیگری برای همان دیدگاه؟
درسِ آزمایش اَش: چطور اقلیتِ درست را نجات دهیم
در ۱۹۵۱ سالومون اَش نشان داد وقتی گروه بهاتفاق پاسخ آشکارا غلطی میدهد، حدود یکسوم افراد با آن همرنگ میشوند — در حالی که در تنهایی نرخ خطا زیر ۱٪ است. اما یافتهی مهمتر این بود: کافی بود یک نفر پاسخ درست را بگوید تا همرنگی به حدود ۵٪ سقوط کند.
اعداد اصلی آزمایش۲:
مطالعهی کنترلشدهی ۲۰۲۵ روی مناظرهی مدلها دقیقاً همین الگو را در ایجنتها مستند کرد: وقتی اکثریت روی پاسخ غلطی همنظر میشدند، فشار گروه مانع میشد ایجنتِ درست روی موضع خود بماند۱۳. یعنی مناظره میتواند پاسخ درست را حذف کند — نه بهخاطر ضعف استدلال، بلکه بهخاطر پویایی گروه.
یک مخالف کافی است تا اکثریت قدرت سرکوبش را از دست بدهد.
یافتهی مشترک اَش (۱۹۵۱) و مطالعات مناظرهی LLM (۲۰۲۵)الگوی پیشنهادی برای آزمایش: مخالفِ کاشته
از این یافته میتوان یک الگوی طراحی قابلآزمایش پیشنهاد کرد: بهجای اینکه فقط به تنوع طبیعی مدلها امید ببندید، یک ایجنت را موظف کنید قویترین نقد ممکن را علیه پاسخ غالب بسازد. این پیشنهاد از آزمایش اَش الهام گرفته، اما هنوز نباید آن را نتیجهای اثباتشده برای همهی LLMها دانست.
- ایجنت مخالف نباید در رأیگیری نهایی شرکت کند؛ نقش او تولید فشار است، نه رأی.
- پرامپت او باید بگوید: «قویترین استدلال ممکن علیه پاسخ غالب را بساز، حتی اگر خودت آن را باور نداری.»
- اگر مخالف نتوانست حفرهای پیدا کند، آن را فقط یک سیگنال کمکی بدانید؛ ناتوانی یک LLM در یافتن نقد، تضمین صحت پاسخ نیست.
ساختار مشابهی در چارچوب «فرشته و شیطان» پیشنهاد شده بود۷. پیوند دادن آن به آزمایش اَش در اینجا یک تفسیر طراحی است و باید با A/B تست روی دادهی واقعی سنجیده شود.
اگر پرامپت شما به ایجنتها میگوید «سعی کنید به توافق برسید»، دارید سرکوب اقلیت را تشویق میکنید. توافق باید نتیجه باشد، نه دستور.
اصلاً چند ایجنت لازم است؟ شاید یکی
پژوهشی در ۲۰۲۴ نشان داد یک ایجنت تکی با پرامپت قوی — شامل مثالهای درونزمینهای و شرح دقیق مسئله — تقریباً به همان عملکرد بهترین روشهای مناظره میرسد. برتری مناظره عمدتاً در حالت بدون مثال (zero-shot) دیده میشود، یعنی دقیقاً جایی که پرامپت ضعیف است.
این یافته، مناظره را در جای تازهای مینشاند: نه یک روش برتر، بلکه یک جبرانکنندهی پرامپت ضعیف. وقتی به مدل مثال و شرح کافی میدهید، مزیت بحث گروهی عملاً محو میشود۹.
| شرایط | ایجنت تکی | مناظره | توصیه |
|---|---|---|---|
| پرامپت با مثال و شرح دقیق | تقریباً برابر | برابر، ولی چند برابر گرانتر | ایجنت تکی |
| پرامپت بدون مثال (zero-shot) | ضعیفتر | بهتر | مناظره یا بهبود پرامپت |
| ترکیب مدل قوی و ضعیف | — | مدل ضعیف تقویت میشود | مناظرهی ناهمگن |
ردیف سوم نکتهی ظریفی دارد: همان پژوهش دید که ایجنتهای مبتنی بر مدلهای ضعیفتر، وقتی در کنار مدلهای قویتر قرار میگیرند عملکردشان بالا میرود. یعنی سود مناظره به ناهمگنی توانایی بستگی دارد، نه به صرفِ زیاد بودن تعداد ایجنتها. این پلی است به بخش ۱۳.
← پیش از ساختن مناظره، پرامپتتان را درست کنید مقایسهی پرامپتنویسی و مهندسی حلقه — کجا کدامیک مسئله را حل میکنداجماع یا رأیگیری؟ به نوع مسئله بستگی دارد
پژوهشی در ۲۰۲۵ هفت پروتکل تصمیمگیری را روی سه وظیفهی دانشی و سه وظیفهی استدلالی مقایسه کرد، در حالی که همهچیز جز خودِ سازوکار تصمیم ثابت بود. نتیجه یک تفکیک روشن بود: اجماع در وظایف دانشی برنده است، رأیگیری در وظایف استدلالی.
| نوع وظیفه | محک | پروتکل برنده | میزان برتری |
|---|---|---|---|
| دانشی | MMLU | اجماع | +۲٫۳٪ |
| MMLU-Pro | اجماع | +۴٫۹٪ | |
| GPQA | اجماع | +۱٫۳٪ | |
| استدلالی | SQuAD 2.0 | رأیگیری | +۱۳٫۱٪ |
| MuSR | رأیگیری | +۲۶٫۴٪ |
منطق پشت این تفکیک روشن است. در وظایف دانشی، خطاها معمولاً فردی و تصادفیاند؛ الزام به توافق چند ایجنت، این خطاها را فیلتر میکند. در وظایف استدلالی، مسیرهای متعدد و معتبری به پاسخ وجود دارد؛ اجبار به اجماع، تنوع مسیرها را زودتر از موعد میکشد۱۲.
همان پژوهش نشان داد افزایش تعداد ایجنتها عملکرد را بالا میبرد اما افزایش تعداد راندها آن را پایین میآورد. این دقیقاً برعکس نمودارهای مقالهی ۲۰۲۳ است — و برعکس کاری که اکثر تیمها هنگام «بهتر کردن» مناظرهشان انجام میدهند. اگر مناظرهی شما جواب نمیدهد، ایجنت اضافه کنید نه راند.
آنچه واقعاً کار میکند: تنوع، نه ساختار
یک مطالعهی کنترلشده شش عامل را جداگانه دستکاری کرد: اندازهی تیم، ترکیب تیم، نمایش میزان اطمینان، ترتیب صحبت، عمق مناظره و سختی مسئله. نتیجه: محرکهای اصلی موفقیت، قدرت استدلال ذاتی مدلها و تنوع گروه بودند. عوامل ساختاری مثل ترتیب صحبت اثر ناچیزی داشتند.
پیامد عملی مستقیم دارد: وقت گذاشتن روی طراحی پروتکل مناظره — چه کسی اول حرف بزند، آیا میزان اطمینان نمایش داده شود — عمدتاً اتلاف وقت است. آنچه ارزش دارد، انتخاب مدلهای متفاوت است۱۳.
و این دقیقاً همان چیزی است که از قضیهی کندورسه انتظار داریم: تنوع مدلها یعنی خطاهای کمتر همبسته، یعنی رأیگیری قدرت فیلتر کردن خود را حفظ میکند. سه نمونه از یک مدل، سه رأی نیستند — یک رأی با نویزند. پژوهش مستقلی هم نشان داده گروههای ناهمگن از ایجنتها، توان استدلالی بالاتری از گروههای همگن دارند.۱۷
مدلهای متفاوت معمولاً شانس بیشتری برای تولید خطاهای کمهمبسته دارند؛ اما نام متفاوتِ مدل بهتنهایی کافی نیست. تنوع را با اختلاف واقعی در پاسخهای اولیه و عملکرد روی دادهی خودتان اندازه بگیرید.
سه رفتار گروهی که مستند شد
- اکثریت، اقلیت را سرکوب میکند — همان الگویی که در بخش ۱۰ دیدیم.
- مخالفت مؤثر کار میکند. تیمهای موفق آنهایی بودند که توانستند اجماع معیوب را واژگون کنند، نه آنهایی که سریعتر به توافق رسیدند.
- منطق مهمتر از لحن است. استدلالی که با اعتبار منطقی همراستا بود، بهترین پیشبینیکنندهی بهبود بود.
جایی که مناظره واقعاً میدرخشد: داوری
اگر یک کاربرد وجود داشته باشد که شواهد پژوهشی محکمی به نفعش هست، ارزیابی است — نه پاسخدهی. وقتی چند مدل دربارهی کیفیت یک خروجی بحث میکنند، نتیجه بهطور پایدار به قضاوت انسانی نزدیکتر میشود، چون ارزیابی ذاتاً چندبعدی است و تنوع دیدگاه واقعاً اطلاعات اضافه میکند.
این تفاوت بنیادی است و باز هم به کندورسه برمیگردد. در یک مسئلهی حساب، پاسخ درست یکی است و «دیدگاه متفاوت» چیزی جز نویز نیست. در ارزیابی یک متن، «خوب بودن» چند بُعد دارد — دقت، انسجام، لحن، کامل بودن — و هر ایجنت میتواند بُعد متفاوتی را ببیند. اینجا تنوع، اطلاعات واقعیِ غیرهمبسته تولید میکند۱۴.
نسل جدید سیستمهای داوری چندایجنتی، سازوکار تشخیص پایداری اضافه کردهاند: بهجای اجرای تعداد ثابتی راند، توزیع آرای داورها رصد میشود و بهمحض پایدار شدن، مناظره متوقف میشود۱۵. این دقیقاً همان «توقف تطبیقی» است که از ۲۰۲۳ بهعنوان عامل اصلی سود شناخته شده بود — حالا با پشتوانهی آماری.
← کاربرد عملی: کنترل کیفیت خودکار مکالمات همین الگوی داوری چندایجنتی در ارزیابی ایجنت صوتی و ربات پشتیبانی استفاده میشودشاخهی فراموششده: مناظره برای نظارت
مناظره در اصل برای بالا بردن دقت پیشنهاد نشده بود. در ۲۰۱۸ — پنج سال پیش از موج LLM — پژوهشگران آن را بهعنوان راهی برای نظارت مطرح کردند: وقتی مدلها از ناظر انسانی تواناتر شوند، دو مدل بحث میکنند تا داوری ضعیفتر بتواند حقیقت را تشخیص دهد.
ایدهی اصلی، قیاسی از نظریهی پیچیدگی داشت: مناظره مثل یک درخت بازی است. وقتی استدلال کامل از توان درک انسان بیرون است، بحث بهتدریج روی نقاط اختلاف «زوم» میکند تا به ادعایی برسد آنقدر ساده که انسان بتواند مستقیماً دربارهاش قضاوت کند۴.
آزمایش اولیه روی تشخیص ارقام دستنویس انجام شد، با محدودیتی عمدی: داور فقط شش پیکسل از تصویر را میدید. نتیجه:
| آزمایش | شرایط | دقت داور |
|---|---|---|
| تشخیص رقم با ۶ پیکسل (۲۰۱۸) | پیکسلهای تصادفی | ۵۹٫۴٪ |
| پیکسلهای انتخابشده در مناظره | ۸۸٫۹٪ | |
| درک متن نخوانده (۲۰۲۴) | قضاوت بدون کمک | ۶۰٪ |
| مشاورهی یک متخصص | ۷۸٪ | |
| مناظرهی دو طرف | ۸۸٪ |
این خط پژوهشی بعدها صورتبندی نظری دقیقتری هم پیدا کرد، با تمرکز بر اینکه داور با چه میزان محاسبه میتواند مناظره را بهدرستی داوری کند.۲۰
شباهت دو عدد پایانی — ۸۸٫۹٪ و ۸۸٪ — با فاصلهی شش سال و روی دو نوع کاملاً متفاوت از داده، تصادفی به نظر نمیرسد. نکتهی کلیدی آزمایش ۲۰۲۴ این بود که مناظرهکنندهها برای متقاعدکنندگی بهینه شده بودند، نه برای درستی، و بدون هیچ برچسب حقیقتِ زمینی. با این حال توانایی داور غیرمتخصص در تشخیص حقیقت بالا رفت۱۰.
در «مناظره برای پاسخدهی»، هر دو طرف تلاش میکنند به پاسخ درست برسند و مسیرشان بهسرعت همگرا میشود — یعنی استقلال از بین میرود و کندورسه بیاثر میماند. در «مناظره برای نظارت»، هر طرف موظف است از یک موضع مشخص دفاع کند. این اجبار به عدم همگرایی، همان چیزی است که اطلاعات تولید میکند. تفاوت در ساختار انگیزه است، نه در مدلها.
مناظره وقتی ارزش دارد که طرفین مجبور به اختلاف باشند. مناظرهی داوطلبانه به توافق ختم میشود؛ مناظرهی اجباری به اطلاعات.
اقتصاد مناظره: چرا راند سوم اینقدر گران است
هزینهی مناظره با تعداد راندها خطی رشد نمیکند — درجهدوم رشد میکند. چون هر راند، کل تاریخچهی راندهای قبل را دوباره وارد زمینهی همهی ایجنتها میکند. در یک مناظرهی سهایجنتی، راند سوم بهتنهایی توکن ورودی بیشتری مصرف میکند از راند اول و دوم روی هم.
بیایید با اعداد مشخص حساب کنیم. فرض: پرسش و دستور سیستمی ۵۰۰ توکن، پاسخ هر ایجنت ۴۰۰ توکن، سه ایجنت.
| روش | توکن ورودی | توکن خروجی | نسبت ورودی به فراخوان تکی |
|---|---|---|---|
| یک فراخوان ساده | ۵۰۰ | ۴۰۰ | ۱× |
| Self-Consistency (۳ نمونه) | ۱٬۵۰۰ | ۱٬۲۰۰ | ۳× |
| مناظره — ۳ ایجنت، ۱ راند | ۱٬۵۰۰ | ۱٬۲۰۰ | ۳× |
| مناظره — ۳ ایجنت، ۲ راند | ۶٬۶۰۰ | ۲٬۴۰۰ | ۱۳٫۲× |
| مناظره — ۳ ایجنت، ۳ راند | ۱۵٬۳۰۰ | ۳٬۶۰۰ | ۳۰٫۶× |
ردیف آخر را با ردیف قبلش مقایسه کنید. رفتن از دو راند به سه راند، ۸٬۷۰۰ توکن ورودی اضافه میکند — بیشتر از کل ۶٬۶۰۰ توکنی که دو راند اول مصرف کرده بودند. دلیلش ساده است: در راند سوم، هر ایجنت باید پاسخهای هر سه ایجنت در دو راند قبل را بخواند.
در پیادهسازی سادهای که هر ایجنت در هر راند، پرسش و تمام پاسخهای راندهای قبلی را میخواند، کل توکن ورودی برابر است با N·R·P + N²·A·R(R−1)/2. جملهی تاریخچه نسبت به N و R درجهدوم است؛ بنابراین وقتی تاریخچه بخش غالب هزینه باشد، دو برابر کردن تعداد ایجنتها میتواند هزینه را به حدود چهار برابر نزدیک کند، نه همیشه دقیقاً چهار برابر.
Prompt caching میتواند هزینهی صورتحسابِ بخشهای تکراری را کم کند، اما رشد تاریخچه، محدودیت پنجرهی زمینه و زمان پردازش را حذف نمیکند؛ ضمن اینکه میزان صرفهجویی به API و یکسان بودن پیشوندها بستگی دارد. خلاصهسازی تاریخچه یا ارسال انتخابی پیامها میتواند فرمول واقعی را تغییر دهد.
این فرمول، توصیهی «ایجنت اضافه کن نه راند» را پیچیدهتر میکند: افزودن ایجنت هم گران است و فقط وقتی ارزش دارد که روی دادهی شما سود بیشتری نشان دهد. اگر بودجه محدود دارید، ترتیب درست این است: اول پرامپت را قوی کنید (بخش ۱۱)، بعد self-consistency، و مناظره را برای آخر بگذارید.
این محاسبه فقط توکن را میشمارد. دادهی میدانی Anthropic نشان میدهد سیستمهای چندایجنتی در عمل حدود ۱۵ برابر یک مکالمهی ساده توکن مصرف میکنند۱۸، و تیم Cognition استدلال میکند هزینهی پنهان بزرگتر جای دیگری است: اشکالزدایی و ناسازگاری خروجیها.۱۹ برای تصویر کامل — شامل تأخیر و هزینهی نگهداری — بخش هزینه در راهنمای سیستم چندایجنتی را ببینید.
پیادهسازی عملی، از ارزان به گران
هرگز از مناظره شروع نکنید. مسیر درست پنج گام دارد و در بیشتر پروژههای واقعی، گام دوم — یک تولیدکننده و یک منتقد — کافی است. برای کسبوکارهای ایرانی که با مدلهای لوکال کار میکنند، تنوع خانوادهی مدل مهمتر از تعداد است.
| گام | ساختار | هزینه | کِی کافی است |
|---|---|---|---|
| ۰ | یک فراخوان + پرامپت قوی با مثال | ۱× | خط پایه. همیشه اول این را بسازید و اندازه بگیرید |
| ۱ | تولیدکننده + منتقد | ۲× | بیشترین سود بهازای کمترین هزینه. برای اکثر کاربردها کافی است |
| ۲ | رأیگیری ۳ نمونه (بدون بحث) | ۳× | وقتی خطاها تصادفیاند نه سیستماتیک |
| ۳ | مناظرهی ۳ مدل متفاوت، ۱ راند | ۳× | وقتی گام ۲ کافی نبود و به دلیل نیاز دارید |
| ۴ | مناظره + مخالفِ کاشته + داور مستقل | ۱۳×+ | ارزیابی و کنترل کیفیت — نه پاسخدهی |
سه نمونه از یک مدل واحد با دمای بالا، مناظره نیست. آنها همان توزیع را نمونهبرداری میکنند و خطاهای سیستماتیک مشترک دارند — یعنی خطاها همبستهاند و شرط استقلال کندورسه برقرار نیست. اگر مدل شما باور غلطی دارد، هر سه نمونه همان را میگویند و «اجماع» شما یک خطای تثبیتشده است.
پرامپت آماده: مناظرهکننده
تو یکی از چند کارشناس مستقل هستی که روی یک مسئله کار میکنند.
# وظیفه در این راند
۱. پاسخهای سایر کارشناسان را بخوان.
۲. برای هر پاسخِ متفاوت با خودت، دقیقاً مشخص کن اختلاف از کجاست:
از فرض اولیه، از یک گام محاسبه، یا از تفسیر صورت مسئله.
۳. اگر خطایی در استدلال خودت پیدا کردی، صریح بگو کجا بود.
۴. پاسخ نهایی این راندت را بده.
# قواعد سخت
- فقط وقتی نظرت را عوض کن که دلیل مشخصی دیده باشی.
- صرفِ اینکه اکثریت چیز دیگری گفته، دلیل نیست. اقلیت بودن اشکالی ندارد.
- «موافقم» بدون ذکر دلیل، پاسخ نامعتبر است.
- اگر مطمئن نیستی، میزان تردیدت را بنویس؛ تظاهر به قطعیت نکن.
# قالب خروجی
تحلیل اختلاف: ...
اصلاح خودم (در صورت وجود): ...
پاسخ این راند: ...
میزان اطمینان (۰ تا ۱۰۰): ...
هر یک از چهار «قاعدهی سخت» مستقیماً از یک یافتهی پژوهشی میآید: قاعدهی اول و دوم برای مهار سرکوب اقلیت (بخش ۱۰)، قاعدهی سوم برای جلوگیری از همگرایی توخالی که استقلال آرا را نابود میکند (بخش ۰۹)، و قاعدهی چهارم برای اینکه شرط توقف بتواند پایداری واقعی را تشخیص دهد.
پرامپت مخالفِ کاشته
تو منتقد رسمی این مناظرهای. در رأیگیری نهایی شرکت نمیکنی.
# وظیفه
قویترین استدلال ممکن علیه پاسخی که اکثریت روی آن توافق کردهاند بساز —
حتی اگر خودت آن پاسخ را درست میدانی.
# قواعد
- به یک نقطهی مشخص حمله کن، نه به کلیت پاسخ.
- اگر پس از تلاش جدی هیچ حفرهای پیدا نکردی، صریح بنویس:
«حفرهای پیدا نشد» — این خودش یک سیگنال اعتماد است.
- استدلال ساختگی نساز؛ ضعف واقعی پیدا کن.
شرط توقف — مهمترین قطعه
مناظره را با «سقف راند» متوقف نکنید. چهار سیگنال را ترکیب کنید:
- پایداری. اگر توزیع پاسخها بین دو راند متوالی تغییر نکرد، تمام.
- اجماع زودهنگام. اگر همه در راند اول موافق بودند، راند دوم را اجرا نکنید.
- سقف سخت. حداکثر ۲ تا ۳ راند، بهعنوان محافظ نه هدف.
- سقف بودجه. سقف توکن یا هزینهی هر پرسش، مستقل از وضعیت مناظره.
مفهوم شرط توقف مرکب، همان چیزی است که در مهندسی حلقه بهعنوان شاخص بلوغ یک سیستم ایجنتی معرفی شده — و در مناظره اهمیتش دوچندان است، چون طبق بخش ۱۶ هر راند اضافه هزینهی درجهدوم دارد.
هفت اشتباه رایج در پیادهسازی مناظره
خط پایهی نادرست
مناظرهی سهایجنتی را با یک فراخوان تکی مقایسه میکنید و ذوقزده میشوید.
درست: با سه فراخوان مستقل و رأیگیری مقایسه کنید. اگر برتری معناداری نماند، مناظره ارزش ندارد.راند اضافه کردن برای بهبود
نتیجه بد است، پس تعداد راندها را از ۲ به ۵ میبرید. هم عملکرد پایین میآید هم هزینه درجهدوم بالا میرود.
درست: تعداد ایجنتها را زیاد کنید نه راندها.یک مدل، چند نمونه
سه نمونه از یک مدل با دمای بالا اجرا میکنید و اسمش را مناظره میگذارید. خطاها همبستهاند.
درست: مدلهای متفاوت از خانوادههای متفاوت. تنوع، محرک اصلی است.پرامپتی که به توافق تشویق میکند
نوشتهاید «با هم به یک نتیجه برسید» — و مدلها هم میرسند، به هر قیمتی.
درست: صریحاً بگویید اقلیت ماندن اشکالی ندارد و توافق بدون دلیل نامعتبر است.نداشتن مخالفِ کاشته
به تنوع طبیعی مدلها امید بستهاید تا اجماع زودهنگام را بشکند. معمولاً نمیشکند.
درست: یک ایجنت را موظف به مخالفت کنید و او را از رأیگیری نهایی خارج نگه دارید.داور از خانوادهی یکی از طرفین
داور و یکی از مناظرهکنندهها یک مدل پایه دارند. نتیجه از پیش کج است.
درست: داور را از خانوادهی سومی انتخاب کنید، یا بهجای داور از رأیگیری استفاده کنید.کپی کردن تنظیمات از یک مقاله
پیکربندی یک مخزن گیتهاب را برمیدارید و روی مدل و دادهی خودتان اجرا میکنید.
درست: تنظیمات مناظره بین مدلها و مجموعهدادهها منتقل نمیشوند. روی دادهی خودتان تنظیم کنید.جمعبندی: بالاخره بسازیم یا نه؟
برای بالا بردن دقت پاسخ، مناظره معمولاً بهترین ابزار نیست — پرامپت بهتر و رأیگیری ساده ارزانتر و قابلاتکاترند. مناظره وقتی ارزش دارد که به چیزی بیش از پاسخ نیاز داشته باشید: یک ارزیابی چندبعدی، یک استدلال قابل بازرسی، یا سازوکاری برای نظارت بر مدلی که از ناظرش تواناتر است.
| هدف شما | توصیه | چرا |
|---|---|---|
| دقت بیشتر در پرسشهای بسته | پرامپت قویتر، بعد رأیگیری | ایجنت تکی با مثال، تقریباً به همان نتیجه میرسد |
| کاهش توهم در تولید محتوا | تولیدکننده + منتقد | بیشترین اثر بهازای کمترین هزینه |
| ارزیابی کیفیت خروجی | مناظره ✓ | ارزیابی چندبعدی است؛ تنوع اطلاعات غیرهمبسته تولید میکند |
| نیاز به استدلال قابل بازرسی | مناظره ✓ | ردِ بحث، خودش خروجی است نه فقط ابزار |
| نظارت بر مدل تواناتر از ناظر | مناظره ✓ | یکی از روشهای دارای شواهد تجربی مستقیم در این حوزه |
| سرعت یا هزینهی پایین | مناظره ✕ | هزینهی ورودی درجهدوم رشد میکند |
| مدل ضعیفتر از شانس روی وظیفه | مناظره ✕ | طبق کندورسه، ایجنت بیشتر خطا را تقویت میکند |
مناظره برای پیدا کردن پاسخ ابزار ضعیفی است، اما برای سنجیدن پاسخ ابزار قدرتمندی است.
میخواهید کیفیت پاسخهای رباتتان را بالا ببرید؟
در فیلتور پیش از هر معماری پیچیدهای، خط پایه را اندازه میگیریم و ارزانترین راهکاری را پیشنهاد میدهیم که مسئله را حل کند. اگر پاسخ «مناظره لازم ندارید» باشد، همین را میگوییم.
مطالب مرتبط و ادامهی مسیر
ادامهی مطالعه بر اساس مسئلهی شما
برای جلوگیری از مطالعهی پراکنده، مسیر بعدی را براساس وضعیت پروژه انتخاب کنید.
پرسشهای پرتکرار
بخشی از بهبود واقعی است، اما پژوهش NeurIPS 2025 نشان داد بخش عمدهی سود معمولاً از رأیگیری میآید. در چارچوب نظری همان مقاله، بحث بهتنهایی امید ریاضی درستی را بالا نمیبرد. اگر فقط دنبال دقت بیشتر هستید، ابتدا رأیگیری ساده را با همان تعداد فراخوان آزمایش کنید.
قضیهی کندورسه (۱۷۸۵) میگوید رأی اکثریت وقتی به حقیقت نزدیک میشود که رأیدهندگان مستقل باشند و هرکدام با احتمال بیش از ۵۰٪ درست تصمیم بگیرند. مناظره دقیقاً شرط استقلال را نقض میکند: وقتی ایجنتها پاسخ هم را میبینند، خطاهایشان همبسته میشود و رأیگیری قدرت فیلتر کردن خطا را از دست میدهد.
در self-consistency چند پاسخ مستقل تولید و رأی اکثریت انتخاب میشود و ایجنتها پاسخ هم را نمیبینند. در مناظره هر ایجنت پاسخ دیگران را در زمینهی خود میبیند و بازنگری میکند. مناظره چند برابر گرانتر است ولی در مقایسههای مستقل، برتری قابلاتکایی نشان نداده.
۳ تا ۵ ایجنت و ۱ تا ۲ راند. شواهد ۲۰۲۵ نشان میدهد افزایش تعداد ایجنتها عملکرد را بهتر و افزایش تعداد راندها آن را بدتر میکند. ضمناً هزینهی راندها بهصورت درجهدوم رشد میکند نه خطی، چون هر راند کل تاریخچه را دوباره وارد زمینه میکند.
فنی بله، ولی سود کمی دارد. سه نمونه از یک مدل همان توزیع را نمونهبرداری میکنند و خطاهای سیستماتیک مشترک دارند؛ یعنی خطاها همبستهاند و رأیگیری نمیتواند آنها را فیلتر کند. مطالعهی کنترلشدهی ۲۰۲۵ نشان داد محرک اصلی موفقیت، تنوع گروه است.
ایجنتی است که موظف میشود قویترین نقد ممکن را علیه پاسخ غالب بسازد و در رأی نهایی شرکت نکند. این الگو از آزمایش همرنگی اَش الهام گرفته، اما برای LLMها یک پیشنهاد طراحی است نه قانون اثباتشده؛ باید اثرش روی دادهی واقعی اندازهگیری شود.
ارزیابی و داوری، و نظارت بر مدلهای تواناتر از ناظر. ارزیابی ذاتاً چندبعدی است و هر ایجنت میتواند بُعد متفاوتی را ببیند. در یک آزمایش، دقت داورهای انسانی غیرمتخصص با مناظره از ۶۰٪ به ۸۸٪ رسید؛ در آزمایش اولیهی OpenAI در ۲۰۱۸ هم دقت داور از ۵۹٫۴٪ به ۸۸٫۹٪ رفت.
در بسیاری موارد بله. پژوهشی در ۲۰۲۴ نشان داد یک ایجنت تکی با پرامپت قوی — شامل مثالهای درونزمینهای و شرح دقیق مسئله — تقریباً به همان عملکرد بهترین روشهای مناظره میرسد. برتری مناظره عمدتاً در حالت بدون مثال (zero-shot) دیده میشود.
با سقف راند متوقف نکنید. چهار سیگنال را ترکیب کنید: پایداری توزیع پاسخها بین دو راند، اجماع زودهنگام در راند اول، سقف سخت ۲ تا ۳ راند بهعنوان محافظ، و سقف بودجهی مستقل. توقف تطبیقی از ۲۰۲۳ بهعنوان یکی از عوامل اصلی سود مناظره شناخته شده است.
واژهنامه
- مناظرهی چندایجنتیMulti-Agent Debate
- پروتکلی که در آن چند مدل زبانی پاسخ یکدیگر را میبینند، نقد میکنند و طی چند راند به پاسخ نهایی میرسند.
- قضیهی کندورسهCondorcet Jury Theorem
- اگر رأیدهندگان مستقل باشند و هرکدام با احتمال بیش از ۵۰٪ درست تصمیم بگیرند، احتمال درستی رأی اکثریت با افزایش تعدادشان به ۱ میل میکند.
- خطای همبستهCorrelated Error
- خطایی که چند ایجنت بهطور مشترک مرتکب میشوند؛ رأیگیری نمیتواند آن را فیلتر کند.
- زوال اندیشهDegeneration-of-Thought
- ناتوانی مدل در تولید فکر تازه پس از تثبیت اطمینان به پاسخ خود، حتی هنگام خودبازبینی.
- خودسازگاریSelf-Consistency
- تولید چند پاسخ مستقل و انتخاب رأی اکثریت، بدون اینکه ایجنتها پاسخ هم را ببینند.
- مارتینگلMartingale
- فرایند تصادفی که بهترین پیشبینی برای مقدار بعدیاش، مقدار فعلی است.
- توقف تطبیقیAdaptive Break
- پایان دادن به مناظره در لحظهی پایداری پاسخها، بهجای اجرای تعداد ثابتی راند.
- سرکوب اقلیتMajority Suppression
- پدیدهای که در آن فشار توافق گروهی، ایجنتِ دارای پاسخ درست را وادار به عقبنشینی میکند.
- مخالفِ کاشتهPlanted Dissenter
- ایجنتی که از پیش موظف است موضع مخالف بگیرد تا اجماع زودهنگام شکسته شود.
- بایاس داورJudge Bias
- گرایش داور LLM به مناظرهکنندهای که همان مدل پایه را دارد.
- نظارت مقیاسپذیرScalable Oversight
- روشهایی برای اینکه ناظر ضعیفتر بتواند خروجی مدل تواناتر را ارزیابی کند؛ مناظره یکی از آنهاست.
- میزان توافقپذیریAgreeableness
- تمایل ایجنت به پذیرش نظر دیگران؛ متغیری که تنظیمش تا ۱۵٪ عملکرد را جابهجا کرد.
منابع
اعداد و یافتههای محوری این مقاله تا حد امکان از مقالهی اصلی، نسخهی رسمی کنفرانس یا انتشار مستقیم سازمان سازنده گرفته شدهاند؛ موارد استنتاجی نیز در متن از نتایج قطعی جدا شدهاند.
- Condorcet's Jury Theorem — قضیهی هیئتمنصفه، و Jury Theorems در دانشنامهی فلسفهی استنفورد.
- Studies of Independence and Conformity — گزارش اصلی آزمایشهای استقلال و همرنگی.
- Society of Mind — نظریهی پیدایش هوش از تعامل عوامل ساده.
- AI Safety via Debate — طرح اولیهی مناظره برای نظارت (شرح OpenAI).
- Improving Factuality and Reasoning in Language Models through Multiagent Debate — مقالهی مرجع، جدولهای ۱ و ۲.
- Multi-AI collaboration helps reasoning and factual accuracy in LLMs — شرح رسمی MIT.
- Encouraging Divergent Thinking in LLMs through Multi-Agent Debate — مفهوم زوال اندیشه و چارچوب فرشته/شیطان.
- Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs — مقایسهی سیستماتیک با روشهای رقیب.
- Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key? — ایجنت تکی با پرامپت قوی.
- Debating with More Persuasive LLMs Leads to More Truthful Answers — دقت داور غیرمتخصص ۶۰ به ۸۸ درصد.
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models? — چارچوب مارتینگل و تفکیک اثر رأی از بحث.
- Voting or Consensus? Decision-Making in Multi-Agent Debate — تفکیک وظایف دانشی و استدلالی.
- Can LLM Agents Really Debate? A Controlled Study of Multi-Agent Debate in Logical Reasoning — تنوع در برابر ساختار، و سرکوب اقلیت.
- ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate — مناظره برای ارزیابی.
- Multi-Agent Debate for LLM Judges with Adaptive Stability Detection — توقف تطبیقی آماری.
- Multi-LLM-Agents Debate — Performance, Efficiency and Scaling Challenges — بررسی روی ۹ محک.
- Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks — اثر ناهمگنی گروه.
- How we built our multi-agent research system — دادهی مصرف توکن سیستمهای چندایجنتی.
- Don't Build Multi-Agents — موضع مقابل دربارهی معماری چندایجنتی.
- Scalable AI Safety via Doubly-Efficient Debate — صورتبندی نظری مناظره در نظارت.