رفتن به محتوای اصلی
هوش مصنوعی · راهنمای مبتدی تا متوسط

مدل‌های زبانی بزرگ (LLM) چطور کار می‌کنن؟ یک توضیح ساده و کامل

هر بار که با ChatGPT حرف می‌زنید یا یک ربات هوشمند جواب‌تان را می‌دهد، پشت پرده یک مدل زبانی بزرگ در حال کار است. اما این موجود واقعاً «فکر» نمی‌کند؛ کاری که می‌کند ساده‌تر و در عین حال شگفت‌انگیزتر از چیزی است که فکرش را می‌کنید. در این راهنما بدون فرمول و اصطلاحات ترسناک، از صفر تا صد طرز کار LLM را مرور می‌کنیم.

س نوشتهٔ تیم فیلتور به‌روزرسانی: تیر ۱۴۰۵ زمان مطالعه: حدود ۱۸ دقیقه
نمایش طرز کار مدل‌های زبانی بزرگ (LLM) و معماری ترنسفورمر

مدل زبانی بزرگ دقیقاً چیست؟

بیایید با یک تعریف خیلی صریح شروع کنیم: مدل زبانی بزرگ یا LLM یک سیستم نرم‌افزاری است که یاد گرفته با دیدن یک رشته متن، حدس بزند محتمل‌ترین کلمهٔ بعدی چیست. همین. تمام آن چیزی که به نظر می‌رسد «هوش» است — نوشتن مقاله، خلاصه‌کردن قرارداد، جواب‌دادن به مشتری — در نهایت از همین یک کار ساده بیرون می‌آید: پیش‌بینی کلمهٔ بعد.

حالا چرا بهش می‌گویند «بزرگ»؟ چون این مدل‌ها روی حجم نجومی‌ای از متن — کتاب، مقاله، سایت، گفت‌وگو — آموزش دیده‌اند و میلیاردها پارامتر دارند؛ پارامتر یعنی همان عددهای قابل‌تنظیمی که الگوهای زبان را در خودشان نگه می‌دارند. وقتی می‌گوییم یک مدل ۷۰ میلیارد پارامتر دارد، یعنی ۷۰ میلیارد عدد ریز کنار هم تصمیم می‌گیرند جملهٔ بعدی شما چطور کامل شود.

نکتهٔ مهمی که از همین ابتدا باید جا بیفتد این است: LLM یک پایگاه دادهٔ حقایق نیست که جواب‌ها را از جایی «بازیابی» کند. مدل، الگوهای زبان را یاد می‌گیرد، نه فهرست واقعیت‌ها را. به همین خاطر است که گاهی با اعتماد به نفس کامل چیزی می‌گوید که اصلاً درست نیست — موضوعی که جلوتر مفصل سراغش می‌رویم.

یک تشبیه ساده

فرض کنید کسی میلیون‌ها کتاب را خوانده، اما حافظهٔ دقیقی از هیچ‌کدام ندارد. در عوض حس فوق‌العاده‌ای پیدا کرده که «بعد از این جمله، معمولاً چه می‌آید». LLM دقیقاً همان آدم است: حسِ زبان دارد، نه بایگانیِ دانش.

سه چیزی که مدل زبانی نیست

برای اینکه از همین اول دچار سوءتفاهم نشویم، بهتر است بدانیم LLM چه چیزهایی نیست. این سه تصور غلط، رایج‌ترین دلیل ناامید‌شدن آدم‌ها از این فناوری است:

جا افتادن همین سه نکته، تفاوت بین کسی است که از هوش مصنوعی سرخورده می‌شود و کسی که می‌داند کجا و چطور از آن استفادهٔ درست بکند.

از کلمه تا عدد: توکن و امبدینگ

کامپیوتر کلمه نمی‌فهمد؛ فقط عدد می‌فهمد. پس اولین کاری که قبل از هر چیز اتفاق می‌افتد این است که متن شما به قطعات کوچک‌تری به اسم توکن شکسته می‌شود. توکن همیشه یک کلمهٔ کامل نیست؛ گاهی یک کلمه، گاهی نیمی از یک کلمه و گاهی فقط یک علامت نگارشی است.

مثلاً جملهٔ «فیلتور ربات می‌سازد» ممکن است به توکن‌هایی مثل «فیلتور»، «ربات»، «می‌»، «سازد» تقسیم شود. در زبان فارسی به‌خاطر چسبیدن پیشوند و پسوند به کلمه، این تکه‌تکه‌شدن گاهی عجیب‌تر از انگلیسی است و دقیقاً یکی از دلایلی است که خروجی مدل‌ها در فارسی گاهی کیفیت متفاوتی دارد.

امبدینگ: وقتی کلمه‌ها مختصات می‌گیرند

هر توکن بعد از این مرحله به یک ردیف طولانی از اعداد تبدیل می‌شود که به آن امبدینگ (embedding) می‌گویند. این اعداد در واقع «مختصات» آن کلمه در یک فضای معنایی عظیم هستند. هرچه دو کلمه از نظر معنا به هم نزدیک‌تر باشند، مختصات‌شان هم به هم نزدیک‌تر است.

در این فضا، «پادشاه» و «ملکه» همسایه‌اند، «تهران» و «اصفهان» در یک محله‌اند و «خوشحال» از «غمگین» فاصله دارد. زیبایی ماجرا اینجاست که مدل این نقشهٔ معنایی را خودش و بدون اینکه کسی به او معنی کلمات را گفته باشد، فقط از روی الگوی کنار هم آمدنشان در میلیون‌ها متن کشف کرده است.

چرا این مهم است؟

همین مفهوم امبدینگ، پایهٔ کارهای پیشرفته‌تری مثل جست‌وجوی معنایی و دانش‌بنیان‌کردن ربات‌هاست. وقتی یک ربات پشتیبانی می‌تواند سؤال مشتری را بفهمد حتی اگر دقیقاً با کلمات سؤالات قبلی یکی نباشد، پشتش همین فضای معنایی نشسته است.

قلب ماجرا: معماری ترنسفورمر و مکانیزم توجه

تا اینجا متن را به توکن و توکن را به عدد تبدیل کردیم. حالا این اعداد وارد قلب اصلی مدل می‌شوند: معماری‌ای به نام ترنسفورمر (Transformer) که از سال ۲۰۱۷ به این طرف کل دنیای هوش مصنوعی زبان را زیر و رو کرد.

قبل از ترنسفورمر، مدل‌ها جمله را کلمه به کلمه و پشت سر هم می‌خواندند؛ مثل کسی که فقط می‌تواند یک کلمه را در یک لحظه ببیند. مشکل اینجا بود که وقتی به آخر یک جملهٔ طولانی می‌رسیدند، عملاً ابتدای جمله را فراموش کرده بودند. ترنسفورمر این مشکل را با یک ایدهٔ درخشان حل کرد: مکانیزم توجه (Attention).

مکانیزم توجه چه می‌کند؟

توجه یعنی مدل، هنگام پردازش هر کلمه، می‌تواند به‌طور همزمان به همهٔ کلمه‌های دیگرِ جمله نگاه کند و تصمیم بگیرد که برای فهمیدن این کلمهٔ خاص، به کدام کلمه‌ها بیشتر «اهمیت» بدهد.

به این جمله دقت کنید: «گربه روی فرش نشست چون خسته بود.» وقتی مدل به کلمهٔ «خسته» می‌رسد، باید بفهمد که این صفت به «گربه» برمی‌گردد نه به «فرش». مکانیزم توجه دقیقاً همین کار را می‌کند؛ یک خط ارتباطی پررنگ بین «خسته» و «گربه» می‌کشد و خط کم‌رنگی به «فرش». این توانایی که مدل بفهمد در یک جمله چه چیزی به چه چیزی ربط دارد، راز اصلی روان و منسجم بودن متن‌های امروزی است.

یک ترنسفورمر این کار را نه یک‌بار، بلکه در ده‌ها لایهٔ روی هم انجام می‌دهد. هر لایه درک کمی عمیق‌تری از متن می‌سازد؛ از تشخیص دستور زبان در لایه‌های اول تا فهم مفاهیم انتزاعی و لحن در لایه‌های بالاتر.

یک تشبیه ساده

مکانیزم توجه را مثل خواندن یک جملهٔ معمایی تصور کنید که برای فهمیدن منظور آخرش، چشم‌تان مدام به عقب برمی‌گردد و کلمه‌های کلیدی قبلی را دوباره نگاه می‌کند. مدل هم دقیقاً همین کار را می‌کند، فقط برای همهٔ کلمه‌ها در آنِ واحد.

قبل از ادامه، یک سؤال

آیندهٔ شغلی شما با هوش مصنوعی کجاست؟

هوش مصنوعی دارد مشاغل را عوض می‌کند. با تست رایگان فیلتور ببینید با علایق و مهارت‌هایتان، کدام مسیر شغلی مرتبط با هوش مصنوعی برای شما مناسب‌تر است.

شروع تست شغل مناسب ←

مدل چطور آموزش می‌بیند؟

تا اینجا فهمیدیم مدل چه ساختاری دارد. اما این میلیاردها عدد از کجا مقدار درست‌شان را پیدا می‌کنند؟ پاسخ در فرایند آموزش است که معمولاً سه مرحله دارد.

۱) پیش‌آموزش (Pre-training)

در این مرحله، حجم عظیمی از متن به مدل داده می‌شود و کار آن فقط یک بازی ساده است: قسمتی از متن را می‌پوشانند و از مدل می‌خواهند حدس بزند کلمهٔ پوشانده‌شده چه بوده. مدل میلیاردها بار حدس می‌زند، اشتباه می‌کند، پارامترهایش کمی تنظیم می‌شوند و دوباره حدس می‌زند. بعد از تعداد نجومی تکرار، آن‌قدر در این بازی قوی می‌شود که الگوهای عمیق زبان را درونی می‌کند.

۲) تنظیم دقیق (Fine-tuning)

مدل بعد از پیش‌آموزش، زبان را خوب بلد است اما لزوماً یک دستیار مؤدب و مفید نیست. در این مرحله با مجموعهٔ کوچک‌تر و باکیفیت‌تری از نمونه‌های «پرسش و پاسخ خوب» آموزش می‌بیند تا یاد بگیرد به جای ادامه‌دادن بی‌هدف متن، واقعاً به سؤال شما جواب بدهد.

۳) یادگیری از بازخورد انسانی (RLHF)

مرحلهٔ آخر جایی است که انسان‌ها وارد می‌شوند. به مدل چند جواب مختلف نشان داده می‌شود و انسان‌ها بهترین را انتخاب می‌کنند. مدل از این ترجیح‌ها یاد می‌گیرد که چه نوع پاسخی برای آدم‌ها قابل‌قبول‌تر، ایمن‌تر و مفیدتر است. همین مرحله است که یک ماشینِ پیش‌بینی کلمه را به دستیاری تبدیل می‌کند که حس می‌کنید با او راحت‌اید.

نکتهٔ کلیدی

این سه مرحله دقیقاً نقطه‌ای است که فهمیدن آن کمک می‌کند بهتر با مدل کار کنید. برای اینکه از مدل بهترین جواب را بگیرید، باید بدانید با چه لحن و ساختاری «پرامپت» بنویسید — موضوعی که در مقالهٔ مهندسی پرامپت چیست به‌طور کامل به آن پرداخته‌ایم.

تولید پاسخ: بازی پیش‌بینی کلمهٔ بعدی

حالا مدل آموزش‌دیده آماده است. وقتی شما سؤالی می‌پرسید، چه اتفاقی می‌افتد؟ بر خلاف تصور خیلی‌ها، مدل کل جواب را یک‌جا در ذهنش نمی‌سازد. بلکه کلمه‌به‌کلمه (دقیق‌تر بگوییم: توکن‌به‌توکن) جلو می‌رود.

مدل به متن شما نگاه می‌کند، محتمل‌ترین توکن بعدی را تولید می‌کند، آن را به انتهای متن اضافه می‌کند، و دوباره از اول کل متن (شامل همان توکن جدید) را می‌خواند تا توکن بعدی را بسازد. این چرخه آن‌قدر تکرار می‌شود تا جمله یا پاسخ کامل شود. به همین دلیل است که وقتی با یک ابزار هوش مصنوعی کار می‌کنید، می‌بینید متن مثل تایپ‌شدن زنده، کلمه‌به‌کلمه ظاهر می‌شود.

چرا هر بار جواب فرق می‌کند؟

مدل برای هر موقعیت، فقط یک گزینه ندارد؛ یک فهرست از توکن‌های محتمل با درصدهای مختلف دارد. یک پارامتر به اسم دما (Temperature) تعیین می‌کند که مدل چقدر «ریسک‌پذیر» باشد:

همین «انتخاب از میان احتمالات» باعث می‌شود اگر یک سؤال را دو بار بپرسید، ممکن است دو جواب کمی متفاوت بگیرید — موضوعی که در طراحی ربات‌های پایدار باید مدیریتش کنید.

پشت پردهٔ یک سؤال ساده، قدم‌به‌قدم

بیایید همهٔ چیزهایی را که تا اینجا گفتیم در یک مثال واقعی کنار هم بگذاریم. فرض کنید به مدل می‌نویسید: «پایتخت ایران کجاست؟» این اتفاق‌ها به‌ترتیب می‌افتد:

  1. جملهٔ شما به توکن شکسته می‌شود؛ مثلاً «پایتخت»، «ایران»، «کجاست»، «؟».
  2. هر توکن به امبدینگ، یعنی همان ردیف اعداد معنایی، تبدیل می‌شود.
  3. این اعداد از لایه‌های ترنسفورمر عبور می‌کنند و مکانیزم توجه می‌فهمد که «کجاست» به دنبال یک مکان می‌گردد و «ایران» موضوع اصلی است.
  4. مدل برای توکن بعدی یک فهرست احتمال می‌سازد: «تهران» با احتمال بسیار بالا، «اصفهان» با احتمال کم، و چند گزینهٔ دیگر با احتمال ناچیز.
  5. توکن «تهران» انتخاب و به جواب اضافه می‌شود؛ بعد مدل دوباره کل متن را می‌خواند تا ببیند آیا باید چیزی بعد از آن بیاید یا جواب تمام شده است.

نکتهٔ جالب اینجاست که مدل هیچ‌وقت در پایگاهی به دنبال «پایتخت ایران» نگشته است. صرفاً چون در میلیون‌ها متنی که خوانده، «تهران» تقریباً همیشه بعد از این سؤال آمده، آن را به‌عنوان محتمل‌ترین ادامه انتخاب کرده. وقتی این واقعیت ساده را درک می‌کنید، هم قدرت و هم ضعف مدل برایتان منطقی می‌شود: در چیزهایی که بارها و بارها در متن‌ها تکرار شده‌اند عالی است، و در جزئیات نادر و تازه، لغزنده.

پنجرهٔ زمینه؛ حافظهٔ کوتاه‌مدت مدل

یک سوءتفاهم رایج این است که فکر می‌کنیم مدل کل گفت‌وگوی ما را «به خاطر می‌سپارد». واقعیت این است که مدل هیچ حافظهٔ دائمی ندارد. تنها چیزی که در هر لحظه می‌بیند، متنی است که داخل پنجرهٔ زمینه (Context Window) جا می‌شود.

پنجرهٔ زمینه یعنی حداکثر تعداد توکنی که مدل می‌تواند در یک لحظه پیش چشمش داشته باشد؛ شامل سؤال شما، دستورالعمل‌ها و کل تاریخچهٔ گفت‌وگو. وقتی این پنجره پر شود، قدیمی‌ترین بخش‌ها از دید مدل خارج می‌شوند و عملاً «فراموش» می‌شوند.

به همین دلیل است که در گفت‌وگوهای خیلی طولانی، مدل گاهی چیزی را که اول گفته بودید از یاد می‌برد. این محدودیت یکی از مهم‌ترین چیزهایی است که در ساخت ربات‌های واقعی باید برایش راهکار داشت — مثلاً با خلاصه‌سازی هوشمند تاریخچه یا اتصال مدل به یک منبع دانش بیرونی.

برای ساخت ربات حرفه‌ای

وقتی یک ربات باید چندین مرحله پشت سر هم کاری را انجام دهد و تصمیم بگیرد، صرفِ یک مدل زبانی کافی نیست. اینجاست که مفهوم عامل هوشمند یا Agent وارد می‌شود؛ سیستمی که می‌تواند فکر کند، ابزار صدا بزند و چند قدم جلوتر را برنامه‌ریزی کند. اگر کنجکاوید، مقالهٔ عامل هوش مصنوعی (AI Agent) چیست را بخوانید.

چرا گاهی اشتباه می‌کند؟ محدودیت‌های واقعی LLM

اگر بخواهیم صادق باشیم — و در فیلتور همیشه ترجیح می‌دهیم صادق باشیم — مدل‌های زبانی با همهٔ قدرت‌شان نقص‌های جدی دارند که اگر ندانیدشان، ممکن است به دردسر بیفتید.

۱) توهم (Hallucination)

چون مدل واقعیت‌ها را بازیابی نمی‌کند بلکه محتمل‌ترین کلمه را می‌سازد، گاهی چیزی تولید می‌کند که از نظر زبانی کاملاً روان و قانع‌کننده است اما کاملاً اشتباه — یک آدرس جعلی، یک آمار ساختگی، یا منبعی که اصلاً وجود ندارد. این پدیده به «توهم» معروف است و خطرناک‌ترین بخشش این است که مدل با همان اعتماد به نفسی که حقیقت را می‌گوید، دروغ هم می‌گوید.

۲) دانش منجمدشده در زمان

مدل فقط تا تاریخ مشخصی آموزش دیده و از اتفاقات بعد از آن خبر ندارد. مگر اینکه به یک منبع زندهٔ اطلاعات (مثل جست‌وجوی وب یا پایگاه دانش شما) وصل شود.

۳) سوگیری

مدل از روی متن‌های نوشتهٔ انسان‌ها یاد گرفته، پس سوگیری‌های موجود در آن متن‌ها را هم — ناخواسته — درون خودش دارد.

محدودیتچرا اتفاق می‌افتدراهکار عملی
توهممدل کلمه می‌سازد، حقیقت را بازیابی نمی‌کنداتصال به پایگاه دانش معتبر
دانش قدیمیآموزش تا تاریخ مشخص متوقف شدهاتصال به جست‌وجوی زنده
فراموشی گفت‌وگوپنجرهٔ زمینه محدود استخلاصه‌سازی هوشمند تاریخچه
سوگیریداده‌های آموزشی سوگیرانه بوده‌اندطراحی دقیق دستورالعمل و نظارت انسانی

خبر خوب این است که تقریباً همهٔ این مشکلات راهکار مهندسی دارند. تفاوت یک ربات اسباب‌بازی با یک ربات قابل‌اتکا برای کسب‌وکار، دقیقاً در همین است که چقدر این محدودیت‌ها هوشمندانه مدیریت شده باشند.

همهٔ مدل‌های زبانی مثل هم نیستند

وقتی از «مدل زبانی بزرگ» حرف می‌زنیم، انگار از یک چیز واحد صحبت می‌کنیم؛ در حالی که خانوادهٔ بزرگ و متنوعی پشت این اسم پنهان است. دانستن این تفاوت‌ها مخصوصاً وقتی می‌خواهید یکی را برای کسب‌وکارتان انتخاب کنید، حیاتی است.

کوچک در برابر بزرگ

هرچه مدل پارامتر بیشتری داشته باشد، معمولاً باهوش‌تر است اما گران‌تر، کندتر و سنگین‌تر هم هست. مدل‌های کوچک‌تر برای کارهای ساده و پرتکرار — مثل دسته‌بندی پیام یا پاسخ به سؤالات متداول — می‌توانند سریع‌تر و به‌صرفه‌تر باشند. همیشه بزرگ‌تر، بهتر نیست؛ انتخاب درست به کاری که می‌خواهید بستگی دارد.

متن‌باز در برابر بسته

بعضی مدل‌ها متن‌باز هستند و می‌توانید آن‌ها را روی سرور خودتان اجرا کنید؛ این یعنی کنترل کامل روی داده و حریم خصوصی. بعضی دیگر بسته‌اند و فقط از طریق سرویس شرکت سازنده در دسترس‌اند؛ معمولاً قوی‌تر اما با وابستگی بیشتر. برای کسب‌وکارهای ایرانی که هم به دادهٔ حساس مشتری اهمیت می‌دهند و هم به محدودیت‌های دسترسی فکر می‌کنند، این انتخاب اصلاً تشریفاتی نیست.

تک‌وجهی در برابر چندوجهی

مدل‌های نسل جدید دیگر فقط متن نمی‌فهمند؛ بعضی‌شان می‌توانند تصویر، صدا و حتی ویدئو را هم پردازش کنند. این مدل‌های «چندوجهی» در ساخت ربات‌هایی که مثلاً باید عکس یک محصول یا رسید پرداخت را بفهمند، دست شما را خیلی بازتر می‌گذارند.

جمع‌بندی این بخش

انتخاب مدل مناسب یک تصمیم مهندسی است، نه صرفاً انتخاب «بهترین مدل دنیا». همان‌طور که در مقالهٔ مهندسی حلقه هم اشاره کرده‌ایم، طراحی درستِ فرایند اطراف مدل، اغلب بیشتر از خودِ مدل روی نتیجهٔ نهایی اثر می‌گذارد.

LLM به درد کسب‌وکار من می‌خورد؟

حالا که می‌دانید پشت پرده چه خبر است، سؤال واقعی این است: این فناوری برای کسب‌وکار شما چه می‌تواند بکند؟ پاسخ کوتاه: خیلی زیاد، اگر درست به‌کار گرفته شود.

یک مدل زبانی به‌تنهایی فقط یک موتور قدرتمند است. ارزش واقعی وقتی ساخته می‌شود که این موتور را داخل یک محصول کاربردی بنشانید: یک ربات پشتیبانی که شبانه‌روز به مشتری‌ها جواب می‌دهد، یک دستیار فروش که سفارش می‌گیرد، یا سیستمی که انبوه پیام‌ها را دسته‌بندی می‌کند. در فیلتور دقیقاً همین کار را می‌کنیم: مدل‌های زبانی را به ابزارهای واقعی برای کسب‌وکارهای ایرانی تبدیل می‌کنیم.

برای مثال، یک ربات هوشمند روی پیام‌رسان‌ها می‌تواند با اتصال به پایگاه دانش شما، به سؤال‌های مشتری دربارهٔ محصولات، قیمت و موجودی جواب دقیق بدهد — بدون توهم، چون پاسخش را از داده‌های واقعی خودِ شما می‌گیرد. این همان جایی است که فهمیدن طرز کار LLM از یک کنجکاوی فنی به یک مزیت رقابتی تبدیل می‌شود.

سه نمونه از کارهایی که همین حالا با مدل‌های زبانی برای کسب‌وکارها قابل انجام است:

نکتهٔ مهم این است که هیچ‌کدام از این‌ها معجزه نیست؛ همه‌شان مهندسی است. کیفیت نتیجه به این بستگی دارد که چقدر مدل را درست انتخاب کرده، درست به داده‌هایتان وصل کرده و فرایند اطرافش را دقیق طراحی کرده باشید.

می‌خواهید عمیق‌تر شوید؟

اگر این مقاله برایتان جذاب بود، احتمالاً از خواندن دربارهٔ بهینه‌سازی برای موتورهای پاسخگوی هوش مصنوعی (GEO) هم لذت می‌برید؛ یعنی اینکه چطور کاری کنید کسب‌وکارتان در پاسخ‌های همین مدل‌های زبانی دیده شود. همهٔ مقالات حوزهٔ هوش مصنوعی ما هم در بخش مقالات فیلتور در دسترس است.

س

تیم فیلتور

بنیان‌گذار فیلتور · توسعهٔ ربات و راهکارهای هوش مصنوعی

چند سالی است روی ساخت ربات‌های هوشمند و پیاده‌سازی مدل‌های زبانی برای کسب‌وکارهای ایرانی کار می‌کنم. تلاشم در این مقاله‌ها این است که مفاهیم پیچیدهٔ هوش مصنوعی را بدون زرق‌وبرق و آن‌طور که واقعاً به درد کار شما می‌خورد، توضیح بدهم.

پرسش‌های پرتکرار دربارهٔ مدل‌های زبانی بزرگ

تفاوت مدل زبانی بزرگ با چت‌بات‌های قدیمی چیست؟

چت‌بات‌های قدیمی بر اساس قانون‌های از پیش نوشته‌شده کار می‌کردند؛ یعنی اگر کاربر دقیقاً جملهٔ خاصی می‌گفت، جواب مشخصی می‌گرفت. مدل‌های زبانی بزرگ اما زبان را به‌صورت آماری یاد گرفته‌اند و می‌توانند به جمله‌هایی که قبلاً اصلاً ندیده‌اند هم پاسخ منسجم بدهند. به همین دلیل انعطاف و کیفیت گفت‌وگوی‌شان قابل‌مقایسه با نسل قبل نیست.

آیا مدل زبانی واقعاً «می‌فهمد» یا فقط حدس می‌زند؟

از نظر فنی، مدل بر اساس الگوهای آماری محتمل‌ترین کلمهٔ بعدی را پیش‌بینی می‌کند و «فهم» به معنای انسانی ندارد. اما این پیش‌بینی آن‌قدر پیچیده و چندلایه است که خروجی‌اش در بسیاری موارد از فهمیدن قابل‌تشخیص نیست. می‌توان گفت مدل، رفتارِ فهمیدن را شبیه‌سازی می‌کند بدون آنکه آگاهی داشته باشد.

توهم (Hallucination) در هوش مصنوعی یعنی چه؟

توهم یعنی مدل پاسخی تولید می‌کند که از نظر زبانی روان و قانع‌کننده است اما از نظر واقعیت نادرست — مثلاً آماری که وجود ندارد یا منبعی ساختگی. علتش این است که مدل واقعیت را بازیابی نمی‌کند بلکه محتمل‌ترین کلمه را می‌سازد. راهکار اصلی، اتصال مدل به یک پایگاه دانش معتبر است.

چرا مدل به سؤالات تکراری گاهی جواب متفاوت می‌دهد؟

چون مدل برای هر موقعیت یک فهرست از کلمات محتمل با درصدهای مختلف دارد و پارامتری به اسم «دما» تعیین می‌کند چقدر از میان این گزینه‌ها ریسک‌پذیر باشد. با دمای بالاتر، تنوع پاسخ‌ها بیشتر می‌شود و همین باعث می‌شود دو بار پرسیدنِ یک سؤال، دو جواب کمی متفاوت بدهد.

برای استفاده از LLM در کسب‌وکار باید برنامه‌نویس باشم؟

نه لزوماً. خیلی از کسب‌وکارها از طریق ربات‌ها و سرویس‌های آماده از قدرت مدل‌های زبانی استفاده می‌کنند بدون آنکه خودشان کدی بزنند. کاری که تیم‌هایی مثل فیلتور انجام می‌دهند این است که این فناوری را به یک ابزار آمادهٔ استفاده برای کسب‌وکار شما تبدیل می‌کنند.

قدم بعدی شما چیست؟

چه کنجکاوِ آینده‌تان باشید چه به دنبال ساختن یک محصول هوشمند، فیلتور همراه شماست.