اگر امروز از ChatGPT سوالی بپرسید، متنی را با کلود (Claude) تحلیل کنید، کدی را با جمینای (Gemini) بنویسید یا مدلی متن‌باز مانند LLaMA و DeepSeek را روی سرور شرکتتان مستقر کنید، در حقیقت دارید از مغزی استفاده می‌کنید که دی‌ان‌ای آن در ژوئن سال ۲۰۱۷ در یکی از اتاق‌های بخش پژوهشی گوگل متولد شد. این شاید جذاب‌ترین، پرطنزترین و مهم‌ترین داستان در تاریخ علم کامپیوتر مدرن باشد.

۱. طنز بزرگ تاریخ سیلیکون‌ولی

در تاریخ فناوری موارد نادری وجود دارد که در آن شرکتی بستر انقلابی عظیم را اختراع کند، آن را به رایگان در دسترس تمام جهان قرار دهد و سپس خود ناچار شود در یک وضعیت اضطراری موسوم به «وضعیت قرمز» (Code Red)، میلیاردها دلار هزینه کند تا در مسابقه‌ای که خودش قواعد بازی‌اش را نوشته، عقب نماند!

این دقیقاً سرنوشت مقاله مشهور «Attention Is All You Need» بود. گوگل این معماری را برای حل یک مشکل مشخص درون‌سازمانی طراحی کرده بود: بهبود سرعت و کیفیت موتور ترجمه گوگل (Google Translate). اما آنچه پژوهشگران گوگل کشف کردند، نه فقط یک مدل بهتر برای ترجمه، بلکه «دستور زبان عمومی محاسبات برای هر نوع ادراک ماشینی» بود.

۲. قبل از ۲۰۱۷: بن‌بست شبکه‌های بازگشتی (RNN و LSTM)

برای درک نبوغ ترنسفورمر، ابتدا باید بفهمیم قبل از آن کامپیوترها چطور متن را می‌خواندند. در سال‌های ۲۰۱۴ تا ۲۰۱۶، پادشاهان بی‌رقیب پردازش زبان طبیعی (NLP)، شبکه‌های عصبی بازگشتی یعنی RNN و فرزند پیشرفته‌تر آن یعنی LSTM (حافظه طولانی کوتاه-مدت) بودند.

روش کار RNN بسیار شهودی بود؛ درست شبیه انسانی که یک کتاب را خط به خط می‌خواند:

  • کلمه اول خوانده می‌شد و بردار حالت ذهنی مدل تغییر می‌کرد.
  • کلمه دوم با در نظر گرفتن خروجی کلمه اول خوانده می‌شد.
  • کلمه سوم با در نظر گرفتن کلمه دوم خوانده می‌شد، و این زنجیره تا انتهای جمله ادامه پیدا می‌کرد.
SEQUENTIAL BOTTLENECK (RNN / LSTM) پردازش زنجیروار و تک‌به‌تک کلمات (معطل واژه قبلی) کلمه ۱ کلمه ۲ کلمه ۳ معایب: خفگی کارت گرافیک (نبود موازی‌سازی) فراموشی کلمات ابتدایی در متون طولانی (کلاغ‌پر) PARALLEL TRANSFORMER (2017) ورود هم‌زمان کل جمله به ماتریس‌های توجه موازی کلمه ۱ کلمه ۲ کلمه ۳ ...N مزایا: موازی‌سازی ۱۰۰٪ روی ده‌ها هزار GPU درک کامل ارتباط کلمات دوردست بدون افت کیفیت
نمودار مقایسه ساختاری پردازش ترتیبی در شبکه‌های بازگشتی با پردازش تمام‌موازی در معماری ترنسفورمر

اما این روش دو نقص فاجعه‌بار داشت که توسعه هوش مصنوعی را عملاً قفل کرده بود:

بن‌بست اول: تنگنای سخت‌افزاری (Hardware Bottleneck)

پردازنده‌های گرافیکی (GPUs) و تراشه‌های هوش مصنوعی گوگل (TPUs) برای یک کار ساخته شده‌اند: محاسبات موازی عظیم در یک لحظه. وقتی ساختار شبکه شما می‌گوید «کلمه پنجم را تا کلمه چهارم تمام نشده نخوان»، تمام آن چندهزار هسته پردازشی معطل یک ریسمان خطی می‌مانند. شما نمی‌توانستید از قدرت سخت‌افزار مدرن برای آموزش روی کل متن‌های وب استفاده کنید؛ چون ماه‌ها و سال‌ها طول می‌کشید!

بن‌بست دوم: سندروم بازی کلاغ‌پر (Vanishing Gradient & Forgetting)

هر بار که یک کلمه خوانده می‌شد، معنای آن باید در یک بردار فشرده می‌شد. تصور کنید در جمله‌ای با ۱۰۰ کلمه، کلمه صدم به کلمه دوم ارجاع داشته باشد؛ مثلاً ضمیری که فاعل اول جمله را هدف قرار داده. اطلاعات کلمه دوم آن‌قدر در طول ۹۸ مرحله دست‌به‌دست شده بود که محو و مخدوش می‌شد!

۳. مقاله ۲۰۱۷ گوگل: «تنها چیزی که نیاز دارید، توجه است»

در دسامبر سال ۲۰۱۷، هشت دانشمند در تیم تحقیقاتی گوگل برین مقاله‌ای تحت عنوان Attention Is All You Need ارائه کردند. نویسندگان این مقاله عبارت بودند از: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin.

پیش از این مقاله، پژوهشگرانی مثل دیمیتری بهدانائو (Bahdanau) سازوکاری به نام «توجه» را به عنوان یک دستیار جانبی به شبکه‌های RNN اضافه کرده بودند. اما شاهکار جسورانه تیم گوگل این بود:

«چرا شبکه‌های بازگشتی و پیچیدگی توالی را به طور کامل دور نریزیم؟ ما مکانیزم توجه را از صندلی شاگرد به صندلی راننده منتقل می‌کنیم. تنها چیزی که برای درک زبان نیاز دارید، خودِ توجه است!»

نام ترنسفورمر (Transformer) نیز از انیمیشن معروف تبدیل‌شوندگان نیامده است؛ بلکه برآمده از قابلیت ریاضی این مدل در دگرگون‌سازی (Transform کردن) یک بردار معنایی به بردار معنایی زمینه‌ای دیگر بدون از دست دادن اطلاعات بود.

۴. خود-توجهی (Self-Attention) واقعاً چطور کار می‌کند؟

بیایید به ساده‌ترین شکل ممکن، هسته مرکزی این جادو را کالبدشکافی کنیم. به این دو جمله نگاه کنید:

جمله اول: «حیوان از خیابان رد نشد، چون خیلی خسته بود.»
جمله دوم: «حیوان از خیابان رد نشد، چون خیلی عریض بود.»

در جمله اول، عبارت «بود / خسته بود» بدون شک به «حیوان» برمی‌گردد؛ چون خیابان خسته نمی‌شود! اما در جمله دوم، فقط با عوض شدن یک صفت، عبارت «عریض بود» به «خیابان» برمی‌گردد.

یک انسان با عقل سلیم این را در یک هزارم ثانیه می‌فهمد؛ اما یک کامپیوتر که فقط اعداد ریاضی را می‌بیند چطور این ارتباط را پیدا می‌کند؟ پاسخ ترنسفورمر این است: محاسبه میزان توجه متقابل بین تمام کلمات.

۵. سه تفنگدار: بردار‌های Query و Key و Value

در ترنسفورمر، هر کلمه به جای یک متغیر ساده، سه نقاب ریاضی بر چهره می‌زند. این سیستم دقیقاً از موتورهای جستجو و پایگاه‌های داده الهام گرفته است:

کلمه: «بانک» Query (پرسش) Key (کلید هویت) Value (محتوای ارزش) DOT PRODUCT SIMILARITY Q_bank · K_river ضرب داخلی بردارها / رادیکال d Softmax Weight = 0.88 کلمه: «رودخانه» Query (پرسش) Key (تطابق بالا!) Value (محتوای ساحل)
نحوه همپوشانی و تعیین وزن توجه از طریق ضرب بردار Query در Key کلمات مجاور
  1. بردار پرسش (Query): کلمه به بقیه جمله اعلام می‌کند: «من دنبال چه چیزی می‌گردم تا معنای دقیقم مشخص شود؟»
  2. بردار کلید (Key): هر کلمه در جمله می‌گوید: «من چه هویت و ویژگی‌هایی در این جمله دارم؟»
  3. بردار ارزش (Value): محتوای خالص معنایی هر کلمه است که اگر کلمه‌ای به آن توجه کرد، آن بار معنایی منتقل می‌شود.

سپس این فرمول شگفت‌انگیز اجرا می‌شود:

Attention(Q, K, V) = softmax( (Q × Kᵀ) / √d_k ) × V

وقتی کلمه «بانک» در جمله «قایق را در بانک رودخانه بستیم» ظاهر می‌شود، ضرب بردار پرسش (Query) کلمه «بانک» در بردار کلید (Key) کلمه «رودخانه»، عددی بسیار بالا تولید می‌کند. تابع Softmax این عدد را به وزن ۸۵٪ تبدیل می‌کند. در نتیجه، بردار ارزش کلمه «رودخانه» روی «بانک» بارگذاری می‌شود و شبکه می‌فهمد اینجا بانک به معنای ساحل و دیواره رودخانه است، نه بانک مالی و حساب بانکی!

۶. توجه چندگانه و کدگذاری موقعیت

انسان‌ها هنگام خواندن یک متن، فقط به یک زاویه توجه نمی‌کنند. شما هم‌زمان لحن جمله، روابط فاعل و مفعول، حالت طنز و زمان افعال را درک می‌کنید.

گوگل برای شبیه‌سازی این توانایی، مفهوم Multi-Head Attention (توجه چندگانه) را معرفی کرد. به جای یک مکانیزم توجه، معمولاً ۸ تا ۱۲۸ «سرِ توجه» موازی در کنار هم کار می‌کنند. یک سر روابط گرامری را بررسی می‌کند، دیگری مراجع ضمایر را وصل می‌کند و سر دیگر تضادها را می‌سنجد.

راز کدگذاری مکانی (Positional Encoding)

یک سوال هوشمندانه پیش می‌آید: وقتی ما تمام کلمات یک کتاب را هم‌زمان و موازی وارد ترنسفورمر می‌کنیم، شبکه چطور می‌فهمد کدام کلمه اول بوده و کدام آخر؟ آیا جمله «سگ گربه را دید» با «گربه سگ را دید» یکسان دیده نمی‌شود؟

پاسخ مهندسان گوگل فوق‌العاده ظریف بود: آن‌ها یک بردار موجی فرکانسی (با توابع سینوس و کسینوس در طول موج‌های مختلف) ساختند و آن را به هر کلمه چسباندند. این بردار مثل یک برچسب مهر زمانی است که به مدل می‌گوید: «من کلمه اول هستم»، «من کلمه هفتاد و دوم هستم».

۷. یک مدل زبانی (LLM) چطور متولد می‌شود؟

داشتن معماری ترنسفورمر، مانند داشتن یک پردازنده پرقدرت و یک اسکلت مغزی پیشرفته است که هنوز هیچ خاطره‌ای در آن نوشته نشده است. برای تبدیل این فرمول ریاضی به ابزاری مثل ChatGPT یا Gemini، یک فرآیند ۳ مرحله‌ای مهندسی عظیم اجرا می‌شود:

STEP 1: MASSIVE PRE-TRAINING (پیش‌آموزش بر روی اینترنت) بلعیدن تریلیون‌ها توکن متنی با هدف تک‌خطی: «حدس زدن کلمه بعدی» (Next-Token Prediction) STEP 2: SUPERVISED FINE-TUNING (تنظیم دقیق نظارت‌شده) آموزش با صدها هزار گفتگوی سوال و جواب توسط متخصصان برای تبدیل به دستیار مودب STEP 3: ALIGNMENT & RLHF هم‌خط‌سازی انسانی: فیلتر کردن دروغ و هذیان
هرم سه سطحی تکامل و تولید مدل‌های زبانی عظیم (LLM) از داده‌های خام تا دستیار هوشمند

مرحله اول: پیش‌آموزش عظیم (Pre-training)

در این مرحله، مدل ترنسفورمر روی صدها میلیارد تا چند تریلیون کلمه متن (شامل کل مقالات ویکی‌پدیا، کتاب‌های علمی، سوالات ردیت، کدهای منبع گیت‌هاب و وب‌آرشیو) قرار می‌گیرد.

اما تمرین مدل چیست؟ آیا کسی به او گرامر یاد می‌دهد؟ خیر! تمام این فرآیند عظیم فقط بر پایه یک وظیفه بی‌نهایت ساده انجام می‌شود: «پیش‌بینی کلمه بعدی» (Next-Token Prediction).

مدل یک متن را می‌بیند که کلمه آخرش پوشانده شده است. کلمه بعدی را حدس می‌زند؛ اگر اشتباه بود، با فرآیندی به نام پس‌انتشار گرادیان (Backpropagation)، میلیاردها وزن ریاضی خود را کمی تصحیح می‌کند. با تکرار این کار در چند میلیون ساعت پردازش GPU، مدل برای آنکه بتواند کلمه بعدی متون تخصصی پزشکی، حقوقی یا برنامه‌نویسی را درست حدس بزند، مجبور می‌شود جهان، منطق و علم را درون بردارهای ریاضی‌اش مدل‌سازی کند!

مرحله دوم: تنظیم دقیق نظارت‌شده (Supervised Fine-Tuning - SFT)

مدلی که فقط پیش‌آموزش دیده، شبیه یک «تکمیل‌کننده خودکار عجیب» است! اگر از او بپرسید: «پایتخت ایران کجاست؟»، ممکن است به جای پاسخ، سوال بعدی را حدس بزند و بنویسد: «پایتخت اسپانیا کجاست؟»؛ چون در اینترنت دیده است که سوالات امتحانی پشت سر هم می‌آیند!

در مرحله SFT، هزاران مکالمه بی‌نقص شامل ساختار [User Query] و [Assistant Response] توسط انسان‌های حرفه‌ای نوشته می‌شود و به مدل آموزش داده می‌شود تا یاد بگیرد نقش یک «دستیار پاسخ‌گو» را ایفا کند.

مرحله سوم: هم‌خط‌سازی با بازخورد انسانی (RLHF & DPO)

یک هوش مصنوعی نباید دستور ساخت سلاح شیمیایی بدهد، به کاربران توهین کند یا وقتی پاسخ سوالی را در اسناد پیدا نمی‌کند، از خودش دروغ ببافد (توهم یا Hallucination).

با روش RLHF (Reinforcement Learning from Human Feedback)، انسان‌ها به پاسخ‌های مختلف مدل نمره می‌دهند و یک «مدل پاداش» رفتار هوش مصنوعی را در راستای مفید بودن، صداقت و ایمنی جهت‌دهی می‌کند.

۸. قانون مقیاس (Scaling Laws) و ظهور هوش

چرا شرکت‌هایی مانند OpenAI، گوگل و آنتروپیک ده‌ها میلیارد دلار خرج خوشه‌های ۵۰ هزارتایی تراشه‌های H100 می‌کنند؟ آیا ترنسفورمر سقفی برای یادگیری ندارد؟

در سال ۲۰۲۰، جرد کاپلان و همکارانش مقاله‌ای منتشر کردند که نشان داد ترنسفورمرها از قانونی پیروی می‌کنند به نام قوانین مقیاس (Scaling Laws). اگر سه متغیر را بالا ببرید:

  • تعداد پارامترهای مدل (ابعاد مغز ریاضی)
  • حجم داده‌های تمیز آموزشی
  • میزان انرژی و توان پردازشی (Compute)

خطای مدل به صورت کاملاً خطی و قابل پیش‌بینی پایین می‌آید. شگفت‌انگیزتر از آن، پدیده‌ای به نام «توانایی‌های نوظهور» (Emergent Abilities) است: مدل‌هایی که در مقیاس ۱ میلیارد پارامتر هیچ درکی از حل مسائل حسابداری یا استعاره ادبی نداشتند، با رسیدن به مقیاس ۷۰ میلیارد یا ۴۰۰ میلیارد پارامتر، ناگهان این توانایی‌ها را بدون آموزش مستقیم از خود بروز دادند!

۹. زمان اجرا: چرا مدل واژه‌به‌واژه تایپ می‌کند؟

شاید دیده باشید وقتی با چت‌بات‌ها صحبت می‌کنید، آن‌ها تمام پاسخ را یکجا به شما تحویل نمی‌دهند؛ بلکه کلمه‌به‌کلمه و به صورت استریمینگ تایپ می‌کنند. این یک افکت نمایشی نیست؛ این خودِ ذات مکانیک تولید مدل‌های زبانی است که به آن تولید خود-بازگشتی (Autoregressive Generation) می‌گویند.

مدل کل سوال شما را می‌گیرد، با توجه به ترنسفورمر کلمه اول پاسخ را پیش‌بینی می‌کند. سپس کلمه اول را به سوال شما اضافه می‌کند و دوباره کل متن را به درون خودش می‌فرستد تا کلمه دوم را پیش‌بینی کند! این حلقه آن‌قدر تکرار می‌شود تا مدل به نشانه پایان متن موسوم به <|endoftext|> برسد.

۱۰. دیدگاه مهندسی ژیار و راهکارهای سازمانی

در شرکت ژیار سامانه گستر، ما هوش مصنوعی را یک شعبده‌بازی یا ابزار سرگرمی نمی‌دانیم؛ این یک زیرساخت محاسباتی دقیق مهندسی است. اما برای یک سازمان، چت‌بات‌های عمومی با چالش‌های جدی روبرو هستند:

  • خطر نشت داده‌ها (Data Privacy): اطلاعات محرمانه مالی و مشتریان سازمان نباید روی سرورهای اشتراکی خارج از کشور ارسال شوند.
  • توهم (Hallucination): در اسناد حساس حقوقی و مهندسی، یک پاسخ غلط با اطمینان بالا می‌تواند فاجعه‌بار باشد.
  • عدم تسلط بر دانش بومی: مدل‌های عمومی با قوانین، پایگاه داده‌ها و مستندات ویژه هر سازمان آشنا نیستند.

به همین دلیل، تیم مهندسی هوش مصنوعی ژیار تمرکز خود را بر روی سه لایه تخصصی قرار داده است:

  1. تنظیم دقیق (Fine-Tuning): بهینه‌سازی مدل‌های قدرتمند متن‌باز (Open Weights) بر روی زبان، اصطلاحات و داده‌های بومی سازمان شما.
  2. معماری Agentic RAG: ایجاد پایپ‌لاین‌های بازیابی که مدل زبانی را مجبور می‌کند ۱۰۰٪ پاسخ خود را با ارجاع دقیق به مستندات داخلی شما تولید کند؛ بدون حتی یک کلمه توهم.
  3. استقرار محلی (On-Premise Deployment): اجرای مدل‌های زبانی روی سرورهای سخت‌افزاری ایزوله درون سازمان شما، کاملاً امن و مستقل از اینترنت بین‌الملل.
مطالعه مقاله Jev ↗

آماده‌اید هوش مصنوعی را به قلب کسب‌وکار خود بیاورید؟

برای بررسی امکان‌سنجی فنی، تنظیم دقیق مدل‌های زبانی یا استقرار ایمن محلی روی داده‌های سازمانی خود، با متخصصان ژیار گفتگو کنید.

درخواست جلسه مشاوره تخصصی هوش مصنوعی آشنایی با راهکارهای AI ژیار