Skip to content

RAG چیست؟ تولید تقویت‌شده با بازیابی به زبان ساده

RAG یعنی مدل زبانی نخست منابع واقعی را بازیابی و بر اساس همان شواهد پاسخ بدهد؛ مروری بر لوله‌پردازش، کیفیت بازیابی و مقایسه با فاین‌تیونینگ و زمینه بلند.

ایدین منوری6 دقیقه مطالعههوش مصنوعیEnglish version
RAG چیست؟ تولید تقویت‌شده با بازیابی به زبان ساده

RAG — تولید تقویت‌شده با بازیابی (Retrieval-Augmented Generation) — معماری‌ای است که پاسخ‌های مدل زبانی را به اسناد واقعی لنگر می‌اندازد: مدل به‌جای آنکه فقط از حافظه پاسخ بدهد، ابتدا مواد منبع مرتبط را بازیابی می‌کند و سپس بر اساس آن‌ها پاسخ می‌سازد. نخست بازیابی، بعد تولید. نتیجه، روانیِ مدل است که به شواهدی قابل ارجاع تکیه کرده است.

این راهنما مسئله‌ای را که RAG حل می‌کند توضیح می‌دهد، سازوکار لوله‌پردازش را مرور می‌کند، نشان می‌دهد کیفیت در کجا ساخته یا نابود می‌شود و می‌گوید چه وقت از جایگزین‌ها مناسب‌تر است.

#مسئله‌ای که RAG حل می‌کند: اتصال به واقعیت

یک مدل زبانی فقط چیزی را می‌داند که در داده‌های آموزشی‌اش بوده است. آن دانش در تاریخ مشخصی منجمد شده، هیچ چیزی درباره اطلاعات خصوصی کسب‌وکار شما ندارد و — چون مدل متنِ محتمل تولید می‌کند نه گزاره راستی‌آزمایی‌شده — حتی در همان حوزه موجود هم همیشه قابل‌اعتماد نیست. از یک مدل ساده درباره سیاست بازپرداخت شرکتتان بپرسید؛ یا عذر می‌خواهد، یا بدتر، پاسخی کلی و مطمئن تولید می‌کند که شبیه سیاست است، ولی سیاست نیست.

راه‌حل، اتصال به واقعیت (Grounding) است: فراهم کردن مواد منبع معتبر هنگام پرسش و دستور دادن به مدل که از همان‌ها پاسخ بدهد. این همان سازوکاری است که مشکل توهمِ توصیف‌شده در هوش مصنوعی مولد چیست را برطرف می‌کند — مدل به‌جای اتکا به الگوهای حفظ‌شده، به شواهدی اتکا می‌کند که به دستش داده‌اند. RAG معماری استاندارد برای انجام خودکار همین کار است.

#لوله‌پردازش چگونه کار می‌کند

RAG لوله‌پردازشی با مراحل مجزاست و هر مرحله خرابی‌های مخصوص خودش را دارد:

مرحلهچه اتفاقی می‌افتدخرابی معمول
دریافت و قطعه‌بندیاسناد منبع به قطعه‌های قابل‌بازیابی تقسیم می‌شوندقطعه‌ها وسط فکر بریده می‌شوند و بافت از دست می‌رود
امبد کردنهر قطعه به برداری با معنایش تبدیل می‌شودامبدینگ ضعیف واژگان تخصصی را از دست می‌دهد
ذخیرهبردارها برای جست‌وجوی شباهت سریع ایندکس می‌شوندایندکس بعد از تغییر منابع کهنه می‌شود
بازیابیپرسش امبد می‌شود؛ نزدیک‌ترین قطعه‌ها واکشی می‌شوندقطعه مهم هرگز واکشی نمی‌شود
غنی‌سازیقطعه‌های بازیابی‌شده در پرامپت قرار می‌گیرندمتن کلیدی گم می‌شود یا پنجره را سرریز می‌کند
تولیدمدل با شواهد داده‌شده پاسخ می‌دهدمدل از مرز منابع بیرون می‌زند
راستی‌آزماییپاسخ‌ها با منابعشان مقایسه می‌شوندرد می‌شود — رایج‌ترین خرابی

جریان کار عامدانه خسته‌کننده است: هیچ چیز عجیبی در آن نیست. قدرتش از چیزی می‌آید که تغییر می‌دهد — پاسخ مدل حالا به اسنادی محدود است که واقعاً وجود دارند و می‌تواند به آن‌ها ارجاع بدهد.

#قطعه‌بندی، امبدینگ و کیفیت بازیابی

بازیابی همان جایی است که کیفیت RAG برنده یا باخته می‌شود، چون مولد فقط می‌تواند از چیزی استفاده کند که بازیاب پیدا می‌کند. قطعه‌بندی تعیین می‌کند چقدر بافت زنده می‌ماند: سند سیاستی را تکه‌تکه کنید و قطعه‌ای که حاوی «اما استثنای پایین را ببینید» است ممکن است نیمه دومش را از دست بدهد. کیفیت امبدینگ تعیین می‌کند پرسش شما حتی با واژگان متفاوت، قطعه درست را پیدا می‌کند یا نه — اینکه آیا «می‌توانم پول طرح سالانه را پس بگیرم» به بخشی می‌رسد که فقط گفته اشتراک سالانه به‌صورت روزشمار قابل بازپرداخت است.

اندیشیدن صادقانه درباره RAG چنین است: شیوه شکست را عوض می‌کند، نه اینکه شکست را حذف کند. خطای مشخص یک سیستم متصل‌شده از «اختراع واقعیت» به «ارجاع مطمئن به واقعیت نادرست یا ناقص» جابه‌جا می‌شود — بهتر است، چون حالا خطا ردّ کاغذی دارد؛ اما حل‌شده نیست، چون ارزش آن رد به اندازه خود ایندکس است.

#یک مثال عملی: پرسشی درباره سیاست خودتان (فرضی)

فرض کنید راهنمای یک شرکت فرضی، در میان دویست صفحه سیاست، بخشی درباره بازپرداخت با قاعده روزشمار 90 روزه برای طرح‌های سالانه دارد — و یادداشت جداگانه‌ای استثنای قیمت‌های تبلیغاتی را ثبت می‌کند.

از یک مدل زبانی ساده بپرسید «می‌توان طرح سالانه را بعد از 60 روز بازپرداخت کرد؟» و پاسخی محتمل و کلی می‌گیرید. شاید برای بعضی شرکت‌ها درست باشد و برای این شرکت غلط، و هیچ راهی برای تشخیص نیست.

یک سیستم RAG پرسش را امبد می‌کند، بخش سیاست بازپرداخت و یادداشت استثنای قیمت تبلیغاتی را بازیابی می‌کند و به مدل دستور می‌دهد از همین قطعه‌ها پاسخ بدهد. پاسخ حالا قاعده واقعی را می‌گوید — بازپرداخت روزشمار تا 90 روز، به‌جز قیمت‌های تبلیغاتی — و به دو قطعه مبدأ ارجاع می‌دهد. انسان می‌تواند در چند ثانیه با خواندن منابع، درستی‌اش را بررسی کند.

اما حالت مرزی را ببینید: اگر یادداشت استثنا هرگز دریافت نشده باشد، سیستم پاسخی مطمئن اما ناقص برمی‌گرداند؛ سیاستی واقعی را ارجاع می‌دهد و استثنایش را از قلم می‌اندازد. کیفیت بازیابی یک جزئیات پیاده‌سازی نیست؛ خودِ محصول است.

#RAG، فاین‌تیونینگ و زمینه بلند

رویکردمناسب برایراه‌حلِ چه چیزی نیست
RAGپاسخ‌های متکی به اسناد در حال تغییر یا خصوصیآموختن مهارت یا لحن جدید به مدل
فاین‌تیونینگرفتار پایدار، لحن و روانی حوزه‌ایحقایق تازه — وزن‌ها خودشان به‌روز نمی‌شوند
زمینه بلندپیکره کوچکی که سرراست در هر پرسش جا می‌شودهزینه و تأخیر در مقیاس؛ رقیق شدن توجه

این سه در عمل ترکیب می‌شوند، اما برای پرسش‌های دانشی معمولاً RAG نخستین ابزار انتخاب است، چون اسناد بسیار بیشتر از مدل‌ها تغییر می‌کنند. پاسخ‌های متصل‌شده با سیستم‌های پشتیبانی تصمیم مبتنی بر هوش مصنوعی هم جورند؛ جایی که هر توصیه به رد شواهد قابل‌مشاهده نیاز دارد.

#محدودیت‌ها و نکات صادقانه

  • کیفیت بازیابی سقف کیفیت پاسخ است. زباله‌ای که بازیابی شود، زباله تولید می‌شود — حالا با ارجاع، که گاهی خطا را قانع‌کننده‌تر می‌کند، نه کمتر.
  • کنترل دسترسی باید دنبال سند برود. ایندکس بازیابی می‌تواند قطعه‌هایی را لو بدهد که کاربر هرگز نباید ببیند، مگر آنکه مجوزها در زمان بازیابی اعمال شود، نه فقط در رابط کاربری.
  • ارجاع می‌تواند گمراه‌کننده باشد. قطعه ارجاع‌شده ممکن است قدیمی، نیمه‌مرتبط یا بدخوانده‌شده باشد؛ ارجاع اشاره است، نه اثبات.
  • نگه‌داری واقعی است. منابع دائماً تغییر می‌کنند؛ ایندکسی که تازه نشود به‌آرامی به آرشیو پاسخ‌های غلط تبدیل می‌شود.
  • اتصال به واقعیت همان حقیقت نیست. مدل همچنان می‌تواند قطعه درستِ بازیابی‌شده را بد تفسیر کند. راستی‌آزمایی انسانی بخشی از هر استقرار مسئولانه باقی می‌ماند.

#جمع‌بندی

RAG الگوی استانداردِ کاربردی کردن هوش مصنوعی مولد روی دانش خصوصی و به‌روز است: اسناد مرتبط را بازیابی کن، بعد پاسخی بساز که به آن‌ها محدود است. مدلی را که فقط از حافظه پاسخ می‌دهد («کتاب بسته») به مدلی می‌برد که با کتاب باز امتحان می‌دهد — بار سنگین را به کیفیت داده، دقت بازیابی و راستی‌آزمایی منتقل می‌کند؛ و دقیقاً همان‌جاست که باید باشد.

RAG همچنین یکی از اجزای تعیین‌کننده محصولات مدرن هوش مصنوعی است؛ جایگاهش در اپلیکیشن‌های بومی هوش مصنوعی را ببینید. و پیش‌نیاز خاموش همه این‌ها، داده منبعِ ساختاریافته است. ScopeOS — سیستم‌عامل زنده کسب‌وکار SCOPE برای حسابداری، صدور فاکتور، حقوق و دستمزد و عملیات — دقیقاً همین پایگاه رکوردهای منظم و قابل‌بازیابی را نگه می‌دارد، در حالی که هر قابلیت هوش مصنوعی لایه‌گذاری‌شده روی آن تا وقتی صادقانه قابل تحویل نباشد، مسیر پژوهشی تلقی می‌شود. همچنین می‌توانید اکوسیستم کامل SCOPE را ببینید.

سؤالات متداول

RAG به زبان ساده یعنی چه؟
RAG یا تولید تقویت‌شده با بازیابی، تکنیکی است که مدل زبانی را به اسناد خودتان لنگر می‌اندازد: هنگام پرسش، سیستم مرتبط‌ترین قطعه‌ها را بازیابی و به مدل می‌دهد و مدل بر اساس همان شواهد پاسخ می‌گوید، نه فقط بر اساس آنچه در آموزش حفظ کرده است. نخست بازیابی، بعد تولید — پس پاسخ‌ها به منابع واقعی و قابل ارجاع تکیه می‌کنند، نه به حدس‌های محتمل.
آیا RAG بهتر از فاین‌تیونینگ است؟
این دو مسئله‌های متفاوتی را حل می‌کنند. RAG پاسخ‌ها را به‌روز و آگاه از داده خصوصی نگه می‌دارد، چون اسناد بیرون از مدل زندگی می‌کنند و هر لحظه می‌توانند عوض شوند. فاین‌تیونینگ رفتار، لحن و روانی حوزه‌ای مدل را شکل می‌دهد، اما حقایق تازه را به‌طور قابل‌اعتماد ذخیره نمی‌کند. بیشتر تیم‌ها برای پرسش‌های دانشی با RAG شروع می‌کنند و فقط وقتی گلوگاه رفتار، سبک یا قالب خروجی است — نه واقعیت‌ها — فاین‌تیونینگ اضافه می‌کنند.
مهم‌ترین خرابی‌های RAG کدام‌اند؟
لوله‌پردازش ضعف مراحلش را به ارث می‌برد: قطعه‌بندی بد می‌تواند قاعده را از استثنایش جدا کند، امبدینگ ضعیف قطعه درست را پیدا نمی‌کند، ایندکس کهنه اسناد قدیمی خدمت می‌کند و مدل همچنان می‌تواند قطعه درستِ بازیابی‌شده را بد تفسیر کند. شیوه شکست از اختراع واقعیت به ارجاع مطمئن به واقعیت نادرست یا ناقص جابه‌جا می‌شود — بهبودی با ردّ کاغذی، که همچنان کار روی کیفیت بازیابی و راستی‌آزمایی انسانی را می‌طلبد.

منابع و مطالعه بیشتر

کتابخانه کامل SCOPE شامل ۴۰ راهنمای تخصصی است؛ مجموعه مقالات مرتبط با این راهنما در نسخه انگلیسی موجود است.