اگر امروز از ChatGPT سوالی بپرسید، متنی را با کلود (Claude) تحلیل کنید، کدی را با جمینای (Gemini) بنویسید یا مدلی متنباز مانند LLaMA و DeepSeek را روی سرور شرکتتان مستقر کنید، در حقیقت دارید از مغزی استفاده میکنید که دیانای آن در ژوئن سال ۲۰۱۷ در یکی از اتاقهای بخش پژوهشی گوگل متولد شد. این شاید جذابترین، پرطنزترین و مهمترین داستان در تاریخ علم کامپیوتر مدرن باشد.
۱. طنز بزرگ تاریخ سیلیکونولی
در تاریخ فناوری موارد نادری وجود دارد که در آن شرکتی بستر انقلابی عظیم را اختراع کند، آن را به رایگان در دسترس تمام جهان قرار دهد و سپس خود ناچار شود در یک وضعیت اضطراری موسوم به «وضعیت قرمز» (Code Red)، میلیاردها دلار هزینه کند تا در مسابقهای که خودش قواعد بازیاش را نوشته، عقب نماند!
این دقیقاً سرنوشت مقاله مشهور «Attention Is All You Need» بود. گوگل این معماری را برای حل یک مشکل مشخص درونسازمانی طراحی کرده بود: بهبود سرعت و کیفیت موتور ترجمه گوگل (Google Translate). اما آنچه پژوهشگران گوگل کشف کردند، نه فقط یک مدل بهتر برای ترجمه، بلکه «دستور زبان عمومی محاسبات برای هر نوع ادراک ماشینی» بود.
۲. قبل از ۲۰۱۷: بنبست شبکههای بازگشتی (RNN و LSTM)
برای درک نبوغ ترنسفورمر، ابتدا باید بفهمیم قبل از آن کامپیوترها چطور متن را میخواندند. در سالهای ۲۰۱۴ تا ۲۰۱۶، پادشاهان بیرقیب پردازش زبان طبیعی (NLP)، شبکههای عصبی بازگشتی یعنی RNN و فرزند پیشرفتهتر آن یعنی LSTM (حافظه طولانی کوتاه-مدت) بودند.
روش کار RNN بسیار شهودی بود؛ درست شبیه انسانی که یک کتاب را خط به خط میخواند:
- کلمه اول خوانده میشد و بردار حالت ذهنی مدل تغییر میکرد.
- کلمه دوم با در نظر گرفتن خروجی کلمه اول خوانده میشد.
- کلمه سوم با در نظر گرفتن کلمه دوم خوانده میشد، و این زنجیره تا انتهای جمله ادامه پیدا میکرد.
اما این روش دو نقص فاجعهبار داشت که توسعه هوش مصنوعی را عملاً قفل کرده بود:
پردازندههای گرافیکی (GPUs) و تراشههای هوش مصنوعی گوگل (TPUs) برای یک کار ساخته شدهاند: محاسبات موازی عظیم در یک لحظه. وقتی ساختار شبکه شما میگوید «کلمه پنجم را تا کلمه چهارم تمام نشده نخوان»، تمام آن چندهزار هسته پردازشی معطل یک ریسمان خطی میمانند. شما نمیتوانستید از قدرت سختافزار مدرن برای آموزش روی کل متنهای وب استفاده کنید؛ چون ماهها و سالها طول میکشید!
هر بار که یک کلمه خوانده میشد، معنای آن باید در یک بردار فشرده میشد. تصور کنید در جملهای با ۱۰۰ کلمه، کلمه صدم به کلمه دوم ارجاع داشته باشد؛ مثلاً ضمیری که فاعل اول جمله را هدف قرار داده. اطلاعات کلمه دوم آنقدر در طول ۹۸ مرحله دستبهدست شده بود که محو و مخدوش میشد!
۳. مقاله ۲۰۱۷ گوگل: «تنها چیزی که نیاز دارید، توجه است»
در دسامبر سال ۲۰۱۷، هشت دانشمند در تیم تحقیقاتی گوگل برین مقالهای تحت عنوان Attention Is All You Need ارائه کردند. نویسندگان این مقاله عبارت بودند از: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin.
پیش از این مقاله، پژوهشگرانی مثل دیمیتری بهدانائو (Bahdanau) سازوکاری به نام «توجه» را به عنوان یک دستیار جانبی به شبکههای RNN اضافه کرده بودند. اما شاهکار جسورانه تیم گوگل این بود:
«چرا شبکههای بازگشتی و پیچیدگی توالی را به طور کامل دور نریزیم؟ ما مکانیزم توجه را از صندلی شاگرد به صندلی راننده منتقل میکنیم. تنها چیزی که برای درک زبان نیاز دارید، خودِ توجه است!»
نام ترنسفورمر (Transformer) نیز از انیمیشن معروف تبدیلشوندگان نیامده است؛ بلکه برآمده از قابلیت ریاضی این مدل در دگرگونسازی (Transform کردن) یک بردار معنایی به بردار معنایی زمینهای دیگر بدون از دست دادن اطلاعات بود.
۴. خود-توجهی (Self-Attention) واقعاً چطور کار میکند؟
بیایید به سادهترین شکل ممکن، هسته مرکزی این جادو را کالبدشکافی کنیم. به این دو جمله نگاه کنید:
در جمله اول، عبارت «بود / خسته بود» بدون شک به «حیوان» برمیگردد؛ چون خیابان خسته نمیشود! اما در جمله دوم، فقط با عوض شدن یک صفت، عبارت «عریض بود» به «خیابان» برمیگردد.
یک انسان با عقل سلیم این را در یک هزارم ثانیه میفهمد؛ اما یک کامپیوتر که فقط اعداد ریاضی را میبیند چطور این ارتباط را پیدا میکند؟ پاسخ ترنسفورمر این است: محاسبه میزان توجه متقابل بین تمام کلمات.
۵. سه تفنگدار: بردارهای Query و Key و Value
در ترنسفورمر، هر کلمه به جای یک متغیر ساده، سه نقاب ریاضی بر چهره میزند. این سیستم دقیقاً از موتورهای جستجو و پایگاههای داده الهام گرفته است:
- بردار پرسش (Query): کلمه به بقیه جمله اعلام میکند: «من دنبال چه چیزی میگردم تا معنای دقیقم مشخص شود؟»
- بردار کلید (Key): هر کلمه در جمله میگوید: «من چه هویت و ویژگیهایی در این جمله دارم؟»
- بردار ارزش (Value): محتوای خالص معنایی هر کلمه است که اگر کلمهای به آن توجه کرد، آن بار معنایی منتقل میشود.
سپس این فرمول شگفتانگیز اجرا میشود:
وقتی کلمه «بانک» در جمله «قایق را در بانک رودخانه بستیم» ظاهر میشود، ضرب بردار پرسش (Query) کلمه «بانک» در بردار کلید (Key) کلمه «رودخانه»، عددی بسیار بالا تولید میکند. تابع Softmax این عدد را به وزن ۸۵٪ تبدیل میکند. در نتیجه، بردار ارزش کلمه «رودخانه» روی «بانک» بارگذاری میشود و شبکه میفهمد اینجا بانک به معنای ساحل و دیواره رودخانه است، نه بانک مالی و حساب بانکی!
۶. توجه چندگانه و کدگذاری موقعیت
انسانها هنگام خواندن یک متن، فقط به یک زاویه توجه نمیکنند. شما همزمان لحن جمله، روابط فاعل و مفعول، حالت طنز و زمان افعال را درک میکنید.
گوگل برای شبیهسازی این توانایی، مفهوم Multi-Head Attention (توجه چندگانه) را معرفی کرد. به جای یک مکانیزم توجه، معمولاً ۸ تا ۱۲۸ «سرِ توجه» موازی در کنار هم کار میکنند. یک سر روابط گرامری را بررسی میکند، دیگری مراجع ضمایر را وصل میکند و سر دیگر تضادها را میسنجد.
یک سوال هوشمندانه پیش میآید: وقتی ما تمام کلمات یک کتاب را همزمان و موازی وارد ترنسفورمر میکنیم، شبکه چطور میفهمد کدام کلمه اول بوده و کدام آخر؟ آیا جمله «سگ گربه را دید» با «گربه سگ را دید» یکسان دیده نمیشود؟
پاسخ مهندسان گوگل فوقالعاده ظریف بود: آنها یک بردار موجی فرکانسی (با توابع سینوس و کسینوس در طول موجهای مختلف) ساختند و آن را به هر کلمه چسباندند. این بردار مثل یک برچسب مهر زمانی است که به مدل میگوید: «من کلمه اول هستم»، «من کلمه هفتاد و دوم هستم».
۷. یک مدل زبانی (LLM) چطور متولد میشود؟
داشتن معماری ترنسفورمر، مانند داشتن یک پردازنده پرقدرت و یک اسکلت مغزی پیشرفته است که هنوز هیچ خاطرهای در آن نوشته نشده است. برای تبدیل این فرمول ریاضی به ابزاری مثل ChatGPT یا Gemini، یک فرآیند ۳ مرحلهای مهندسی عظیم اجرا میشود:
مرحله اول: پیشآموزش عظیم (Pre-training)
در این مرحله، مدل ترنسفورمر روی صدها میلیارد تا چند تریلیون کلمه متن (شامل کل مقالات ویکیپدیا، کتابهای علمی، سوالات ردیت، کدهای منبع گیتهاب و وبآرشیو) قرار میگیرد.
اما تمرین مدل چیست؟ آیا کسی به او گرامر یاد میدهد؟ خیر! تمام این فرآیند عظیم فقط بر پایه یک وظیفه بینهایت ساده انجام میشود: «پیشبینی کلمه بعدی» (Next-Token Prediction).
مدل یک متن را میبیند که کلمه آخرش پوشانده شده است. کلمه بعدی را حدس میزند؛ اگر اشتباه بود، با فرآیندی به نام پسانتشار گرادیان (Backpropagation)، میلیاردها وزن ریاضی خود را کمی تصحیح میکند. با تکرار این کار در چند میلیون ساعت پردازش GPU، مدل برای آنکه بتواند کلمه بعدی متون تخصصی پزشکی، حقوقی یا برنامهنویسی را درست حدس بزند، مجبور میشود جهان، منطق و علم را درون بردارهای ریاضیاش مدلسازی کند!
مرحله دوم: تنظیم دقیق نظارتشده (Supervised Fine-Tuning - SFT)
مدلی که فقط پیشآموزش دیده، شبیه یک «تکمیلکننده خودکار عجیب» است! اگر از او بپرسید: «پایتخت ایران کجاست؟»، ممکن است به جای پاسخ، سوال بعدی را حدس بزند و بنویسد: «پایتخت اسپانیا کجاست؟»؛ چون در اینترنت دیده است که سوالات امتحانی پشت سر هم میآیند!
در مرحله SFT، هزاران مکالمه بینقص شامل ساختار [User Query] و [Assistant Response] توسط انسانهای حرفهای نوشته میشود و به مدل آموزش داده میشود تا یاد بگیرد نقش یک «دستیار پاسخگو» را ایفا کند.
مرحله سوم: همخطسازی با بازخورد انسانی (RLHF & DPO)
یک هوش مصنوعی نباید دستور ساخت سلاح شیمیایی بدهد، به کاربران توهین کند یا وقتی پاسخ سوالی را در اسناد پیدا نمیکند، از خودش دروغ ببافد (توهم یا Hallucination).
با روش RLHF (Reinforcement Learning from Human Feedback)، انسانها به پاسخهای مختلف مدل نمره میدهند و یک «مدل پاداش» رفتار هوش مصنوعی را در راستای مفید بودن، صداقت و ایمنی جهتدهی میکند.
۸. قانون مقیاس (Scaling Laws) و ظهور هوش
چرا شرکتهایی مانند OpenAI، گوگل و آنتروپیک دهها میلیارد دلار خرج خوشههای ۵۰ هزارتایی تراشههای H100 میکنند؟ آیا ترنسفورمر سقفی برای یادگیری ندارد؟
در سال ۲۰۲۰، جرد کاپلان و همکارانش مقالهای منتشر کردند که نشان داد ترنسفورمرها از قانونی پیروی میکنند به نام قوانین مقیاس (Scaling Laws). اگر سه متغیر را بالا ببرید:
- تعداد پارامترهای مدل (ابعاد مغز ریاضی)
- حجم دادههای تمیز آموزشی
- میزان انرژی و توان پردازشی (Compute)
خطای مدل به صورت کاملاً خطی و قابل پیشبینی پایین میآید. شگفتانگیزتر از آن، پدیدهای به نام «تواناییهای نوظهور» (Emergent Abilities) است: مدلهایی که در مقیاس ۱ میلیارد پارامتر هیچ درکی از حل مسائل حسابداری یا استعاره ادبی نداشتند، با رسیدن به مقیاس ۷۰ میلیارد یا ۴۰۰ میلیارد پارامتر، ناگهان این تواناییها را بدون آموزش مستقیم از خود بروز دادند!
۹. زمان اجرا: چرا مدل واژهبهواژه تایپ میکند؟
شاید دیده باشید وقتی با چتباتها صحبت میکنید، آنها تمام پاسخ را یکجا به شما تحویل نمیدهند؛ بلکه کلمهبهکلمه و به صورت استریمینگ تایپ میکنند. این یک افکت نمایشی نیست؛ این خودِ ذات مکانیک تولید مدلهای زبانی است که به آن تولید خود-بازگشتی (Autoregressive Generation) میگویند.
مدل کل سوال شما را میگیرد، با توجه به ترنسفورمر کلمه اول پاسخ را پیشبینی میکند. سپس کلمه اول را به سوال شما اضافه میکند و دوباره کل متن را به درون خودش میفرستد تا کلمه دوم را پیشبینی کند! این حلقه آنقدر تکرار میشود تا مدل به نشانه پایان متن موسوم به <|endoftext|> برسد.
۱۰. دیدگاه مهندسی ژیار و راهکارهای سازمانی
در شرکت ژیار سامانه گستر، ما هوش مصنوعی را یک شعبدهبازی یا ابزار سرگرمی نمیدانیم؛ این یک زیرساخت محاسباتی دقیق مهندسی است. اما برای یک سازمان، چتباتهای عمومی با چالشهای جدی روبرو هستند:
- خطر نشت دادهها (Data Privacy): اطلاعات محرمانه مالی و مشتریان سازمان نباید روی سرورهای اشتراکی خارج از کشور ارسال شوند.
- توهم (Hallucination): در اسناد حساس حقوقی و مهندسی، یک پاسخ غلط با اطمینان بالا میتواند فاجعهبار باشد.
- عدم تسلط بر دانش بومی: مدلهای عمومی با قوانین، پایگاه دادهها و مستندات ویژه هر سازمان آشنا نیستند.
به همین دلیل، تیم مهندسی هوش مصنوعی ژیار تمرکز خود را بر روی سه لایه تخصصی قرار داده است:
- تنظیم دقیق (Fine-Tuning): بهینهسازی مدلهای قدرتمند متنباز (Open Weights) بر روی زبان، اصطلاحات و دادههای بومی سازمان شما.
- معماری Agentic RAG: ایجاد پایپلاینهای بازیابی که مدل زبانی را مجبور میکند ۱۰۰٪ پاسخ خود را با ارجاع دقیق به مستندات داخلی شما تولید کند؛ بدون حتی یک کلمه توهم.
- استقرار محلی (On-Premise Deployment): اجرای مدلهای زبانی روی سرورهای سختافزاری ایزوله درون سازمان شما، کاملاً امن و مستقل از اینترنت بینالملل.
آمادهاید هوش مصنوعی را به قلب کسبوکار خود بیاورید؟
برای بررسی امکانسنجی فنی، تنظیم دقیق مدلهای زبانی یا استقرار ایمن محلی روی دادههای سازمانی خود، با متخصصان ژیار گفتگو کنید.