RAG چیست؟ تولید تقویتشده با بازیابی به زبان ساده
RAG یعنی مدل زبانی نخست منابع واقعی را بازیابی و بر اساس همان شواهد پاسخ بدهد؛ مروری بر لولهپردازش، کیفیت بازیابی و مقایسه با فاینتیونینگ و زمینه بلند.
RAG — تولید تقویتشده با بازیابی (Retrieval-Augmented Generation) — معماریای است که پاسخهای مدل زبانی را به اسناد واقعی لنگر میاندازد: مدل بهجای آنکه فقط از حافظه پاسخ بدهد، ابتدا مواد منبع مرتبط را بازیابی میکند و سپس بر اساس آنها پاسخ میسازد. نخست بازیابی، بعد تولید. نتیجه، روانیِ مدل است که به شواهدی قابل ارجاع تکیه کرده است.
این راهنما مسئلهای را که RAG حل میکند توضیح میدهد، سازوکار لولهپردازش را مرور میکند، نشان میدهد کیفیت در کجا ساخته یا نابود میشود و میگوید چه وقت از جایگزینها مناسبتر است.
#مسئلهای که RAG حل میکند: اتصال به واقعیت
یک مدل زبانی فقط چیزی را میداند که در دادههای آموزشیاش بوده است. آن دانش در تاریخ مشخصی منجمد شده، هیچ چیزی درباره اطلاعات خصوصی کسبوکار شما ندارد و — چون مدل متنِ محتمل تولید میکند نه گزاره راستیآزماییشده — حتی در همان حوزه موجود هم همیشه قابلاعتماد نیست. از یک مدل ساده درباره سیاست بازپرداخت شرکتتان بپرسید؛ یا عذر میخواهد، یا بدتر، پاسخی کلی و مطمئن تولید میکند که شبیه سیاست است، ولی سیاست نیست.
راهحل، اتصال به واقعیت (Grounding) است: فراهم کردن مواد منبع معتبر هنگام پرسش و دستور دادن به مدل که از همانها پاسخ بدهد. این همان سازوکاری است که مشکل توهمِ توصیفشده در هوش مصنوعی مولد چیست را برطرف میکند — مدل بهجای اتکا به الگوهای حفظشده، به شواهدی اتکا میکند که به دستش دادهاند. RAG معماری استاندارد برای انجام خودکار همین کار است.
#لولهپردازش چگونه کار میکند
RAG لولهپردازشی با مراحل مجزاست و هر مرحله خرابیهای مخصوص خودش را دارد:
| مرحله | چه اتفاقی میافتد | خرابی معمول |
|---|---|---|
| دریافت و قطعهبندی | اسناد منبع به قطعههای قابلبازیابی تقسیم میشوند | قطعهها وسط فکر بریده میشوند و بافت از دست میرود |
| امبد کردن | هر قطعه به برداری با معنایش تبدیل میشود | امبدینگ ضعیف واژگان تخصصی را از دست میدهد |
| ذخیره | بردارها برای جستوجوی شباهت سریع ایندکس میشوند | ایندکس بعد از تغییر منابع کهنه میشود |
| بازیابی | پرسش امبد میشود؛ نزدیکترین قطعهها واکشی میشوند | قطعه مهم هرگز واکشی نمیشود |
| غنیسازی | قطعههای بازیابیشده در پرامپت قرار میگیرند | متن کلیدی گم میشود یا پنجره را سرریز میکند |
| تولید | مدل با شواهد دادهشده پاسخ میدهد | مدل از مرز منابع بیرون میزند |
| راستیآزمایی | پاسخها با منابعشان مقایسه میشوند | رد میشود — رایجترین خرابی |
جریان کار عامدانه خستهکننده است: هیچ چیز عجیبی در آن نیست. قدرتش از چیزی میآید که تغییر میدهد — پاسخ مدل حالا به اسنادی محدود است که واقعاً وجود دارند و میتواند به آنها ارجاع بدهد.
#قطعهبندی، امبدینگ و کیفیت بازیابی
بازیابی همان جایی است که کیفیت RAG برنده یا باخته میشود، چون مولد فقط میتواند از چیزی استفاده کند که بازیاب پیدا میکند. قطعهبندی تعیین میکند چقدر بافت زنده میماند: سند سیاستی را تکهتکه کنید و قطعهای که حاوی «اما استثنای پایین را ببینید» است ممکن است نیمه دومش را از دست بدهد. کیفیت امبدینگ تعیین میکند پرسش شما حتی با واژگان متفاوت، قطعه درست را پیدا میکند یا نه — اینکه آیا «میتوانم پول طرح سالانه را پس بگیرم» به بخشی میرسد که فقط گفته اشتراک سالانه بهصورت روزشمار قابل بازپرداخت است.
اندیشیدن صادقانه درباره RAG چنین است: شیوه شکست را عوض میکند، نه اینکه شکست را حذف کند. خطای مشخص یک سیستم متصلشده از «اختراع واقعیت» به «ارجاع مطمئن به واقعیت نادرست یا ناقص» جابهجا میشود — بهتر است، چون حالا خطا ردّ کاغذی دارد؛ اما حلشده نیست، چون ارزش آن رد به اندازه خود ایندکس است.
#یک مثال عملی: پرسشی درباره سیاست خودتان (فرضی)
فرض کنید راهنمای یک شرکت فرضی، در میان دویست صفحه سیاست، بخشی درباره بازپرداخت با قاعده روزشمار 90 روزه برای طرحهای سالانه دارد — و یادداشت جداگانهای استثنای قیمتهای تبلیغاتی را ثبت میکند.
از یک مدل زبانی ساده بپرسید «میتوان طرح سالانه را بعد از 60 روز بازپرداخت کرد؟» و پاسخی محتمل و کلی میگیرید. شاید برای بعضی شرکتها درست باشد و برای این شرکت غلط، و هیچ راهی برای تشخیص نیست.
یک سیستم RAG پرسش را امبد میکند، بخش سیاست بازپرداخت و یادداشت استثنای قیمت تبلیغاتی را بازیابی میکند و به مدل دستور میدهد از همین قطعهها پاسخ بدهد. پاسخ حالا قاعده واقعی را میگوید — بازپرداخت روزشمار تا 90 روز، بهجز قیمتهای تبلیغاتی — و به دو قطعه مبدأ ارجاع میدهد. انسان میتواند در چند ثانیه با خواندن منابع، درستیاش را بررسی کند.
اما حالت مرزی را ببینید: اگر یادداشت استثنا هرگز دریافت نشده باشد، سیستم پاسخی مطمئن اما ناقص برمیگرداند؛ سیاستی واقعی را ارجاع میدهد و استثنایش را از قلم میاندازد. کیفیت بازیابی یک جزئیات پیادهسازی نیست؛ خودِ محصول است.
#RAG، فاینتیونینگ و زمینه بلند
| رویکرد | مناسب برای | راهحلِ چه چیزی نیست |
|---|---|---|
| RAG | پاسخهای متکی به اسناد در حال تغییر یا خصوصی | آموختن مهارت یا لحن جدید به مدل |
| فاینتیونینگ | رفتار پایدار، لحن و روانی حوزهای | حقایق تازه — وزنها خودشان بهروز نمیشوند |
| زمینه بلند | پیکره کوچکی که سرراست در هر پرسش جا میشود | هزینه و تأخیر در مقیاس؛ رقیق شدن توجه |
این سه در عمل ترکیب میشوند، اما برای پرسشهای دانشی معمولاً RAG نخستین ابزار انتخاب است، چون اسناد بسیار بیشتر از مدلها تغییر میکنند. پاسخهای متصلشده با سیستمهای پشتیبانی تصمیم مبتنی بر هوش مصنوعی هم جورند؛ جایی که هر توصیه به رد شواهد قابلمشاهده نیاز دارد.
#محدودیتها و نکات صادقانه
- کیفیت بازیابی سقف کیفیت پاسخ است. زبالهای که بازیابی شود، زباله تولید میشود — حالا با ارجاع، که گاهی خطا را قانعکنندهتر میکند، نه کمتر.
- کنترل دسترسی باید دنبال سند برود. ایندکس بازیابی میتواند قطعههایی را لو بدهد که کاربر هرگز نباید ببیند، مگر آنکه مجوزها در زمان بازیابی اعمال شود، نه فقط در رابط کاربری.
- ارجاع میتواند گمراهکننده باشد. قطعه ارجاعشده ممکن است قدیمی، نیمهمرتبط یا بدخواندهشده باشد؛ ارجاع اشاره است، نه اثبات.
- نگهداری واقعی است. منابع دائماً تغییر میکنند؛ ایندکسی که تازه نشود بهآرامی به آرشیو پاسخهای غلط تبدیل میشود.
- اتصال به واقعیت همان حقیقت نیست. مدل همچنان میتواند قطعه درستِ بازیابیشده را بد تفسیر کند. راستیآزمایی انسانی بخشی از هر استقرار مسئولانه باقی میماند.
#جمعبندی
RAG الگوی استانداردِ کاربردی کردن هوش مصنوعی مولد روی دانش خصوصی و بهروز است: اسناد مرتبط را بازیابی کن، بعد پاسخی بساز که به آنها محدود است. مدلی را که فقط از حافظه پاسخ میدهد («کتاب بسته») به مدلی میبرد که با کتاب باز امتحان میدهد — بار سنگین را به کیفیت داده، دقت بازیابی و راستیآزمایی منتقل میکند؛ و دقیقاً همانجاست که باید باشد.
RAG همچنین یکی از اجزای تعیینکننده محصولات مدرن هوش مصنوعی است؛ جایگاهش در اپلیکیشنهای بومی هوش مصنوعی را ببینید. و پیشنیاز خاموش همه اینها، داده منبعِ ساختاریافته است. ScopeOS — سیستمعامل زنده کسبوکار SCOPE برای حسابداری، صدور فاکتور، حقوق و دستمزد و عملیات — دقیقاً همین پایگاه رکوردهای منظم و قابلبازیابی را نگه میدارد، در حالی که هر قابلیت هوش مصنوعی لایهگذاریشده روی آن تا وقتی صادقانه قابل تحویل نباشد، مسیر پژوهشی تلقی میشود. همچنین میتوانید اکوسیستم کامل SCOPE را ببینید.