کتاب ریاضیات مدل‌ های زبانی بزرگ (The Mathematics of Large Language Models)

369,000 تومان

اگر از مقاله‌های پراکنده خسته شده‌اید و به دنبال تصویر کامل از ریاضیات مدل‌ های زبانی هستید، ریاضیات مدل‌ های زبانی بزرگ پاسخ شماست. از جبر خطی تا قوانین مقیاس‌گذاری و توهم، با زبانی روان و داستان‌های پشت هر ایده.

نویسنده
Jason Karpeles
ناشر
نامشخص
تعداد صفحات
2000
سال انتشار
5 ژوئن 2026
عنوان کتاب :
The Mathematics of Large Language Models: A Readable Guide to LLMs, Transformers, Diffusion, Neural Networks, and Generative AI
فرمت کتاب :
PDF تبدیل شده ( این فایل ها ممکن است از نظر تعداد صفحات متفاوت باشند، اما محتوای کتاب کامل است. تغییر تعداد صفحات به‌خاطر فونت و قالب‌بندی است.)

توضیحات

کتاب ریاضیات مدل‌ های زبانی بزرگ اولین مرجع جامعی است که ریاضیات پشت LLMها را از جبر خطی تا قوانین مقیاس‌گذاری و توهم، با زبانی روان و داستان‌های پشت هر ایده، برای مخاطب غیرمتخصص هم قابل‌فهم کرده است.

شبکه‌های عصبی می‌توانند برچسب‌های تصادفی را حفظ کنند و در عین حال روی داده‌های واقعی تعمیم دهند پدیده‌ای که نظریه‌ی سنتی یادگیری آن را «ناممکن» می‌نامد. این یکی از ده‌ها معمایی است که کتاب به آن پاسخ می‌دهد.

اگر تا به حال با مقاله‌های پراکنده‌ی هوش مصنوعی دست و پنجه نرم کرده‌اید، می‌دانید که هر مقاله عمق خودش را دارد، اما هیچ‌کدام تصویر کامل را نشان نمی‌دهند. این کتاب دقیقاً همان تصویر کامل است: از هنجارهای مینکوفسکی در سال ۱۸۹۶ تا معماری Mamba در سال ۲۰۲۳، از قضیه‌ی تقریب جهانی سیبنکو تا قانون چینچیلا و کران پایین توهم.

نویسنده، جیسون کارپلس، با ۳۰ سال تجربه در مدل‌سازی آماری، کتاب را به‌گونه‌ای نوشته که هم برای مهندسی که با کد سروکار دارد قابل‌فهم باشد و هم برای پژوهشگری که به دنبال عمق ریاضی است. هر معادله با دو بخش توضیح داده شده است: «چه کاری انجام می‌دهد» و «خواندن فرمول». یعنی برای درک یک مفهوم، نیازی به دکتری ریاضی ندارید—فقط باید بدانید هر فرمول چه کاری انجام می‌دهد و چرا مهم است.

چرا درک ریاضیات مدل‌های زبانی برای مهندسان و محققان ضروری است؟

درک ریاضیات پشت مدل‌های زبانی بزرگ، شما را از یک کاربرِ ابزار به یک طراحِ سیستم تبدیل می‌کند و امکان تصمیم‌گیری آگاهانه درباره‌ی معماری، آموزش و ارزیابی این مدل‌ها را فراهم می‌سازد.

شکاف بین نظریه و عمل؛ چرا مدل‌ها موفق می‌شوند اما تئوری نمی‌تواند توضیح دهد؟

مدل‌ های زبانی بزرگ به طرز خارق‌العاده‌ای کار می‌کنند، اما نظریه‌های کلاسیک اغلب از توضیح دلیل این موفقیت عاجزند.

برای مثال، شبکه‌ های عصبی می‌توانند برچسب‌های تصادفی را حفظ کنند (آزمایش ژانگ، ۲۰۱۶) و در عین حال روی داده‌های واقعی تعمیم دهندپدیده‌ای که نظریه‌ی سنتی یادگیری آن را «ناممکن» می‌نامد (فصل ۴، کتاب؛ همچنین: Zhang et al., 2017, “Understanding Deep Learning Requires Rethinking Generalization”).

کتاب ریاضیات مدل‌ های زبانی بزرگ دقیقاً به همین شکاف می‌پردازد: با ارائه‌ی آن در بستر مسئله‌ای که برای حل آن خلق شده است (فصل ۱، مقدمه).

به جای توضیحات سطحی، این کتاب شما را با قضایایی مانند قضیه‌ی تقریب جهانی و هسته‌ی مماس عصبی (NTK) آشنا می‌کند و نشان می‌دهد که چرا مدل‌ها در عمل موفق‌اند، حتی وقتی نظریه نمی‌تواند آن را به‌طور کامل توجیه کند (فصل‌های ۲ و ۳).

چرا یک مهندس به جای مقاله‌های پراکنده، به یک مرجع ساختاریافته نیاز دارد؟

مقالات علمی پراکنده، هرچند عمیق، اغلب فاقد ساختاری منسجم برای درک تدریجی مفاهیم هستند. این کتاب با ارائه‌ی ۱۷ فصل منسجم، از جبر خطی و هنجارها تا قوانین مقیاس‌گذاری و توهم در هوش مصنوعی، یک نقشه‌ی راه کامل در اختیار شما قرار می‌دهد (فهرست مطالب کتاب).

به گفته‌ی نویسنده در مقدمه، هدف این کتاب «صرفاً نشان دادن فرمول‌ها نیست؛ بلکه کمک به درک این است که آنها چه می‌گویند، چرا کار می‌کنند، و چگونه به سیستم‌های هوش مصنوعی متصل می‌شوند» (مقدمه، بخش «How This Book Is Built»).

این رویکرد ساختاریافته، زمان شما را برای کنار هم چیدن تکه‌های پراکنده تلف نمی‌کند و تمرکز را بر درک عمیق و کاربرد عملی معطوف می‌دارد.

۱۷ فصل کتاب ریاضیات مدل‌ های زبانی بزرگ چه مباحثی را از پایه تا پیشرفته پوشش می‌دهند؟

کتاب در ۱۷ فصل، سیری منظم از مفاهیم پایه‌ای ریاضی مانند جبر خطی و نظریه‌ی احتمال تا مباحث پیشرفته‌ی معماری‌های مدرن، مدل‌های مولد، و چالش‌های بنیادین مانند توهم و خودداری را پوشش می‌دهد.

فصل‌های ۱ تا ۴: جبر خطی، هنجارها، SVD، واگرایی KL، قضایای تقریب و بهینه‌سازی

چهار فصل ابتدایی کتاب، زبان ریاضی مشترک همه‌ی مباحث بعدی را پایه‌ریزی می‌کنند (فصل ۱). در این بخش با هنجارهای مینکوفسکی (L₁، L₂، L∞)، تجزیه‌ی مقدار منفرد (SVD) و کاربرد آن در کاهش ابعاد، واگرایی کولبک-لیبلر (KL) به عنوان معیار فاصله‌ی توزیع‌ها، و قضایای بنیادین تقریب (مانند قضیه‌ی سیبنکو) و بهینه‌سازی آشنا می‌شوید (فصل‌های ۱ تا ۴).

این فصل‌ها پایه‌ای محکم برای درک عمیق‌تر معماری‌های بعدی فراهم می‌آورند.

فصل‌های ۵ تا ۹: CNN، GNN، ترنسفورمر، گراف و معماری‌های هم‌وردا (Equivariant)

قلب معماری‌های مدرن در این فصل‌ها جای دارد (فصل‌های ۵ تا ۹). از شبکه‌های کانولوشنی (CNN) و بینش حاصل از عصب‌شناسی (Hubel و Wiesel، ۱۹۵۸) گرفته تا شبکه‌های عصبی گرافی (GNN) و معماری‌های هم‌وردا (Equivariant) که تقارن را به عنوان یک اصل طراحی به کار می‌گیرند.

در این بخش، ترنسفورمر به عنوان یک هسته‌ی وابسته به داده معرفی می‌شود و مکانیزم توجه (Attention) با جزئیات کامل ریاضی واکاوی می‌گردد (فصل ۸).

فصل‌های ۱۰ تا ۱۳: VAE، GAN، مدل‌های پخش (Diffusion)، شار، اپراتورهای علمی و PINN

این فصل‌ها به دنیای مدل‌های مولد می‌پردازند (فصل‌های ۱۰ تا ۱۳). از خودرمزگذارهای متغیر (VAE) و شبکه‌های تخاصمی (GAN) گرفته تا مدل‌های پخش (Diffusion) که با معکوس‌سازی یک فرایند نویزی، تصاویر خارق‌العاده‌ای تولید می‌کنند (فصل ۱۱).

همچنین با مفاهیمی مانند شارهای نرمال‌کننده (Normalizing Flows)، اپراتورهای عصبی (Neural Operators) و شبکه‌های مبتنی بر فیزیک (PINN) آشنا می‌شوید که مرزهای یادگیری ماشین را به علوم مهندسی و فیزیک گشوده‌اند (فصل‌های ۱۰، ۱۲ و ۱۳).

فصل‌های ۱۴ تا ۱۷: عدم‌قطعیت، مقاومت، علیت، قوانین مقیاس‌گذاری، توهم و خودداری (Abstention)

در این فصل‌ها، کتاب به سراغ چالش‌های بنیادین سیستم‌های هوش مصنوعی می‌رود (فصل‌های ۱۴ تا ۱۷):

  • چگونه عدم‌قطعیت را کمّی کنیم؟
  • چگونه مدل را در برابر حملات دشمن‌آمیز مقاوم سازیم؟
  • تفاوت میان همبستگی و علیت چیست؟
  • و در نهایت، چرا مدل‌های زبانی بزرگ توهم می‌زنند و چگونه می‌توان با طراحی معیارهای ارزیابی درست، این پدیده را مهار کرد؟.

این بخش با مفاهیمی مانند کالیبراسیون، پیش‌بینی همدیس (Conformal Prediction) و قضیه‌ی کالیبراسیون و کران پایین توهم به پایان می‌رسد (فصل‌های ۱۴، ۱۵ و ۱۷).

۵ قضیه کلیدی که هر پژوهشگر هوش مصنوعی باید بداند

پنج قضیه‌ای که درک آن‌ها برای هر پژوهشگر هوش مصنوعی ضروری است، عبارت‌اند از:

  1. قضیه‌ی تقریب جهانی،
  2. هسته‌ی مماس عصبی،
  3. قانون چینچیلا،
  4. قضیه‌ی کالیبراسیون و کران پایین توهم،
  5. و قضیه‌ی ناچاری محاسباتی.

قضیهٔ تقریب جهانی (Cybenko, 1989) – چه می‌گوید و چه نمی‌گوید؟

این قضیه بیان می‌کند که یک شبکه‌ی عصبی تک‌لایه با تابع فعال‌سازی سیگموئید می‌تواند هر تابع پیوسته‌ای را روی یک دامنه‌ی فشرده با دقت دلخواه تقریب بزند (فصل ۲، قضیه ۲.۱؛ Cybenko, 1989, “Approximation by Superpositions of a Sigmoidal Function“).

اما آنچه این قضیه نمی‌گوید، به همان اندازه مهم است: تعداد نورون‌های مورد نیاز برای این تقریب را مشخص نمی‌کند، چیزی درباره‌ی امکان‌پذیری یافتن این وزن‌ها توسط الگوریتم‌های بهینه‌سازی نمی‌گوید، و هیچ تضمینی برای تعمیم‌پذیری ارائه نمی‌دهد (فصل ۲، بخش «What the Theorem Does Not Say»). قضیه می‌گوید «راه حل وجود دارد»، اما نمی‌گوید «می‌توانید آن را پیدا کنید».

هستهٔ مماس عصبی (NTK) – چرا در حد پهنای بی‌نهایت، شبکه به رگرسیون هسته‌ای تبدیل می‌شود؟

هسته‌ی مماس عصبی (NTK) نشان می‌دهد که در حد پهنای بی‌نهایت، دینامیک آموزش یک شبکه‌ی عصبی به دینامیک رگرسیون هسته‌ای با یک هسته‌ی ثابت همگرا می‌شود (فصل ۳، قضیه ۳.۸؛ Jacot et al., 2018, “Neural Tangent Kernel: Convergence and Generalization in Neural Networks“).

این یعنی در این رژیم، شبکه رفتار خطی از خود نشان می‌دهد و همگرایی به جواب منحصربه‌فرد تضمین می‌شود. NTK توضیح می‌دهد که چرا شبکه‌های بسیار پهن به راحتی آموزش می‌بینند و چرا مولفه‌های فرکانس پایین تابع هدف را سریع‌تر از مولفه‌های فرکانس بالا یاد می‌گیرند (فصل ۳، بخش «Spectral Bias»).

قانون چینچیلا (Chinchilla) – چرا نسبت ۲۰ توکن به ازای هر پارامتر، نقطهٔ بهینهٔ محاسباتی است؟

قانون چینچیلا (Hoffmann et al., 2022) نشان می‌دهد که برای یک بودجه‌ی محاسباتی ثابت، اندازه‌ی بهینه‌ی مدل و تعداد توکن‌های آموزش باید به طور مساوی رشد کنند (فصل ۱۶، قضیه ۱۶.۱؛ Hoffmann et al., 2022, “Training Compute-Optimal Large Language Models“). به ازای هر پارامتر، حدود ۲۰ توکن داده‌ی آموزشی نیاز است.

این قانون، باور قبلی مبنی بر اینکه «مدل بزرگ‌تر همیشه بهتر است» را به چالش کشید و نشان داد که بسیاری از مدل‌های بزرگ، عملاً کم‌آموزش‌دیده (undertrained) هستند.

قضیهٔ کالیبراسیون و کران پایین توهم – چرا مدل‌های کالیبره روی حقایق نادر، ناگزیر خطا دارند؟

این قضیه (Kalai و Vempala, 2024) نشان می‌دهد که یک مدل زبانی که به درستی کالیبره شده است (یعنی اطمینان آن با دقت واقعی‌اش مطابقت دارد) ناگزیر بر روی حقایق نادر و دیده‌نشده، توهم خواهد داشت (فصل ۱۷، قضیه ۱۷.۱؛ Kalai and Vempala, 2024, “Calibrated Language Models Must Hallucinate“).

دلیل آن به برآوردگر گود-تورینگ بازمی‌گردد: جرم گم‌شده (احتمال وقوع یک حقیقت دیده‌نشده) با نرخ تک‌نمونه‌ها (تعداد حقایقی که فقط یک بار در داده‌های آموزش دیده‌اند) تخمین زده می‌شود (فصل ۱۷، بخش «Unseen Species and Monofacts»).

یک مدل کالیبره باید بخشی از احتمال خود را به این جرم گم‌شده اختصاص دهد، و از آنجا که این حقایق نادر را ندیده است، برخی از این تخصیص‌ها ناگزیر نادرست خواهند بود.

معماری‌های ۲۰۲۳ تا ۲۰۲۶: Mamba، RoPE و MLA چگونه کار می‌کنند؟

معماری‌های جدید مانند Mamba، RoPE و MLA با هدف بهبود کارایی، کاهش هزینه‌ی محاسباتی و افزایش طول زمینه طراحی شده‌اند و هر یک نقصی از معماری ترنسفورمر را هدف قرار می‌دهند.

Mamba و انتخاب محتوایی در فضای حالت (SSM) – چگونه جایگزین توجه (Attention) می‌شود؟

Mamba (Gu و Dao, 2023) یک مدل فضای حالت انتخابی (Selective State Space Model) است که با پارامترهای وابسته به ورودی، امکان انتخاب محتوایی را فراهم می‌کند (فصل ۷، بخش «Selective State Spaces: Mamba»؛ Gu and Dao, 2023, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces”).

برخلاف ترنسفورمر که هزینه‌ی توجه آن به توان دو طول دنباله رشد می‌کند، Mamba با هزینه‌ی خطی و حافظه‌ی ثابت در استنتاج، راهکاری کارآمد برای دنباله‌های بسیار طولانی ارائه می‌دهد.

این مدل با استفاده از یک اسکن موازی روی سخت‌افزار، هم زمان آموزش موازی و هم استنتاج بازگشتی با حافظه‌ی O(1) را ممکن می‌سازد.

رمزگذاری موقعیت چرخشی (RoPE) – چرا به مدل اجازه می‌دهد به طول‌های بیشتر از آموزش تعمیم دهد؟

رمزگذاری موقعیت چرخشی (RoPE) موقعیت توکن را با چرخاندن بردارهای پرسش و کلید در فضای با ابعاد بالا کد می‌کند (فصل ۸، بخش «Rotary Positional Encoding»؛ Su et al., 2021).

به لطف این طراحی، حاصل‌ضرب داخلی بردار پرسش و کلید فقط به فاصله‌ی نسبی توکن‌ها بستگی دارد، نه موقعیت مطلق آن‌ها. این ویژگی به مدل‌های مجهز به RoPE اجازه می‌دهد تا به طول‌های دنباله‌ای بسیار بیشتر از آنچه در آموزش دیده‌اند، تعمیم دهند.

RoPE در حال حاضر در اکثر مدل‌های منبع‌باز بزرگ مانند LLaMA، Mistral و Qwen استفاده می‌شود (فصل ۸، بخش «Modern LLM Architecture Details»).

توجه نهفته با چند سر (MLA) – کاهش حافظهٔ کش تا ۹۰٪ در استنتاج چگونه ممکن است؟

توجه نهفته با چند سر (Multi-Head Latent Attention) حافظه‌ی کش Key-Value (KV) را با فشرده‌سازی بردارهای کلید و مقدار به یک بردار نهفته‌ی اشتراکی با ابعاد پایین کاهش می‌دهد (فصل ۸، بخش «Multi-Head Latent Attention»).

در معماری MLA، به جای ذخیره‌ی یک بردار کلید و مقدار کامل برای هر هد، فقط بردار نهفته‌ی فشرده‌شده در کش نگهداری می‌شود و کلیدها و مقادیر کامل هنگام نیاز بازسازی می‌گردند.

این روش می‌تواند حافظه‌ی کش KV را تا ۹۰٪ کاهش دهد که برای استنتاج با طول زمینه‌ی بسیار بالا حیاتی است (فصل ۸، بخش «Cache Size: Linear in Sequence Length, Not Constant»).

یادگیری درون‌متن به‌عنوان پیاده‌سازی گرادیان نزول – قضیه‌ای که نحوهٔ کار ترنسفورمر را در Few-Shot Learning توضیح می‌دهد

قضیه‌ای از von Oswald و همکاران (۲۰۲۳) نشان می‌دهد که یک لایه‌ی توجه در ترنسفورمر، در مسائل رگرسیون خطی، معادل یک قدم گرادیان نزول روی داده‌های درون‌متن است (فصل ۱۶، قضیه ۱۶.۴؛ von Oswald et al., 2023, “Transformers Learn In-Context by Gradient Descent”).

درواقع ترنسفورمر در حین استنتاج (و بدون به‌روزرسانی وزن‌ها)، الگوریتمی را پیاده‌سازی می‌کند که معادل بهینه‌سازی روی مثال‌های ارائه‌شده در پنجره‌ی متن است.

این قضیه توضیح می‌دهد که چرا مدل‌های بزرگ می‌توانند از چند مثال در متن، یک کار جدید را یاد بگیرند (Few-Shot Learning) و این توانایی را مدیون معماری توجه خود هستند (فصل ۱۶، بخش «ICL Implements Gradient Descent»).

آیا کتاب ریاضیات مدل‌ های زبانی بزرگ برای شما مناسب است؟ پاسخ به ۴ نقد رایج

این کتاب برای مخاطبی با پیش‌نیاز ریاضی در سطح کارشناسی مهندسی و صبر کافی برای دنبال‌کردن معادلات طراحی شده است، اما ممکن است برای مبتدیان مطلق یا متخصصان بسیار پیشرفته مناسب نباشد.

سطح ریاضی کتاب – آیا برای فردی با مدرک کارشناسی مهندسی قابل‌فهم است یا نیاز به دکتری دارد؟

کتاب با این فرض نوشته شده که شما پیش‌نیاز ریاضی در سطح کارشناسی (آشنایی با جبر خطی، حساب دیفرانسیل و انتگرال، و احتمال) را دارید (مقدمه، بخش «Who wrote this» و «The step ladder»).

با این حال، یک نقد از یک خریدار با اسم Matt Ginsberg مدرک دکتری ریاضی (تاریخ ۱۲ اوت ۲۰۲۶) می‌گوید:

کتاب را تقریباً کاملاً مبهم یافتم… هیچ چیزی به من نمی‌گوید که چرا یک نتیجه زیربنای نتیجه‌ی دیگر است یا چرا یک نتیجه‌ی خاص در کتاب آمده است.

(برگرفته از نقدهای کاربران در صفحه کتاب در آمازون).

این نقد نشان می‌دهد که کتاب برای کسانی که به دنبال ارتباطات عمیق ریاضی بین مفاهیم هستند، ممکن است رضایت‌بخش نباشد.

در مقابل، نویسنده در مقدمه تأکید کرده که «هیچ مدرک پیشرفته‌ای فرض نمی‌شود و نیازی نیست که از قبل با تمام شاخه‌های ریاضی راحت باشید» (مقدمه، بخش «The step ladder»).

آیا محتوای کتاب به‌سرعت منسوخ می‌شود؟ (بررسی رویکرد «تصحیح درجا» و وب‌سایت همراه)

بله، بخشی از آن منسوخ خواهد شد، زیرا حوزه‌ی هوش مصنوعی با سرعت سرسام‌آوری در حال تحول است (صفحه‌ی ۲، بخش «Keeping This Book Current»).

اما نویسنده دو راهکار برای این مسئله در نظر گرفته است:

  • تصحیح درجا (correction in place) که در آن نسخه‌ی کتاب به‌روزرسانی می‌شود و تاریخ بازبینی در ابتدای کتاب درج می‌گردد (صفحه‌ی ۲، بخش «Keeping This Book Current»)،
  • و یک وب‌سایت همراه که شامل تصحیحات، اشتقاقات جدید و فهرست به‌روز شده‌ی منابع است (صفحه‌ی ۲، بخش «Keeping This Book Current»؛ همچنین صفحه‌ی ۴، بخش «Source Notes and Verification»).

بنابراین، با وجود سرعت تغییرات، کتاب به‌روز باقی می‌ماند.

آیا همهٔ ۱۷ فصل ضروری است؟ راهنمای مطالعهٔ انتخابی بر اساس هدف

خیر، همه‌ی فصل‌ها برای همه ضروری نیستند. کتاب چند مسیر مطالعه‌ی انتخابی ارائه می‌دهد (صفحه‌ی ۵، بخش «Ways through»):

  • مسیر ترنسفورمر: فصل‌های ۱، ۲، ۳، ۴، ۵، ۶، ۷، ۸
  • مسیر مدل‌های مولد: فصل‌های ۱۰ و ۱۱ (نیازمند فصل ۸)
  • مسیر قابلیت‌اطمینان: فصل‌های ۱۴ و ۱۷ (نیازمند فصل‌های ۱۰ و ۱۶)

موضوعات منفرد: فصل‌های ۵ (تقارن)، ۹ (گراف)، ۱۲ (عمق پیوسته)، ۱۵ (مقاومت) را می‌توان پس از فصل ۱ مطالعه کرد (صفحه‌ی ۵، بخش «Single subjects»).

نقاط قوت در برابر محدودیت‌ها – کتاب دقیقاً برای چه کسانی بیشترین ارزش را دارد؟

نقاط قوت: کتاب با زبانی روان و با استفاده از داستان‌های پشت اکتشافات، مفاهیم پیچیده را ملموس می‌کند (مقدمه، بخش «Why there are stories in a mathematics book»).

هر معادله با دو بخش «چه کاری انجام می‌دهد» و «خواندن فرمول» توضیح داده شده است که آن را برای خوانندگانی که با نمادگذاری ریاضی مشکل دارند، قابل‌دسترس می‌سازد (مقدمه، بخش «The step ladder»).

محدودیت‌ها: نقد مت گینزبرگ (Matt Ginsberg) در آمازون، که دارای مدرک دکتری ریاضی از آکسفورد و سابقه‌ی تدریس در استنفورد است، به‌خوبی نقطه‌ی ضعف اصلی کتاب را نشان می‌دهد. او می‌گوید که مشکل کتاب «سخت بودن» ریاضیات آن نیست، بلکه فقدان خط داستانی (narrative thread) و عدم نمایش ارتباط بین مفاهیم است. به اعتقاد او، کتاب مانند مجموعه‌ای از جزئیات پراکنده است که به هم متصل نشده‌اند: «هیچ چیزی به من نمی‌گوید که چرا یک نتیجه زیربنای نتیجه‌ی دیگر است یا چرا یک نتیجه‌ی خاص در کتاب آمده است». این نقد از یک متخصص سطح‌بالا نشان می‌دهد که کتاب برای کسانی که به دنبال درک عمیق و ارتباطی از مفاهیم هستند، می‌تواند ناامیدکننده باشد، حتی اگر از نظر محتوای ریاضی دقیق باشد.

ارزش‌مندترین مخاطب: مهندسان و محققانی که با مفاهیم پایه‌ای ریاضی آشنا هستند و می‌خواهند درک عمیق‌تری از مدل‌های زبانی پیدا کنند، بدون اینکه غرق در جزئیات بیش ازحد شوند (مقدمه، بخش «Ways through»).

جمع‌بندی نهایی: کتاب ریاضیات مدل‌ های زبانی بزرگ با چه پیش‌نیازی قابل‌خواندن است؟

این کتاب برای مخاطبی با پیش‌نیاز ریاضی در سطح کارشناسی (جبر خطی، حسابان، احتمال) و صبر کافی برای مطالعه‌ی دقیق معادلات طراحی شده است و بسته به هدف، مسیرهای مطالعه‌ی متفاوتی را ارائه می‌دهد.

ارزش افزوده برای پژوهشگر، مهندس یادگیری ماشین و دانشجوی دکتری

  • پژوهشگر: با قضایای کلیدی (NTK، Chinchilla، قضیه‌ی کالیبراسیون) و مباحث پیشرفته (Mamba، RoPE، MLA) آشنا می‌شود که مرزهای دانش فعلی را تشکیل می‌دهند (فصل‌های ۳، ۸، ۱۶ و ۱۷).
  • مهندس یادگیری ماشین: درک عمیقی از ریاضیات پشت معماری‌های رایج پیدا می‌کند که به انتخاب آگاهانه‌ی معماری، تنظیم فراپارامترها، و عیب‌یابی سیستم‌ها کمک می‌کند (فصل‌های ۵ تا ۹).
  • دانشجوی دکتری: یک مرجع ساختاریافته برای مفاهیم بنیادین و پیشرفته دارد که می‌تواند به عنوان مکمل مقالات پراکنده از آن استفاده کند (مقدمه، بخش «How This Book Is Built»).

۳ مسیر مطالعهٔ پیشنهادی بر اساس هدف (ترنسفورمر، مدل‌های مولد، ارزیابی و قابلیت‌اطمینان)

  • مسیر ترنسفورمر (برای درک معماری‌های مدرن): فصل‌های ۱، ۲، ۳، ۴، ۵، ۶، ۷، ۸
  • مسیر مدل‌های مولد (برای تولید محتوا): فصل‌های ۱۰، ۱۱ (نیازمند فصل ۸)
  • مسیر ارزیابی و قابلیت‌اطمینان (برای استقرار ایمن): فصل‌های ۱۴، ۱۷ (نیازمند فصل‌های ۱۰ و ۱۶)

چرا با وجود ریاضیات سنگین، این کتاب یکی از خواندنی‌ترین منابع حوزهٔ LLM است؟

با وجود حجم بالای ریاضیات، کتاب با استفاده از داستان‌های انسانی پشت هر ایده، مفاهیم انتزاعی را به مسائل ملموس متصل می‌کند (مقدمه، بخش «Why there are stories in a mathematics book»).

رویکرد گام‌به‌گام در توضیح معادلات و تفکیک «چه کاری انجام می‌دهد» از «خواندن فرمول»، آن را به منبعی منحصربه‌فرد برای کسانی تبدیل کرده که می‌خواهند ریاضیات واقعی را بیاموزند، نه صرفاً تشبیهات سطحی (مقدمه، بخش «The step ladder»). این ترکیب نادر از دقت ریاضی و روایت‌پردازی، آن را به یکی از خواندنی‌ترین منابع حوزه‌ی مدل‌های زبانی بزرگ تبدیل کرده است.

درباره نویسنده کتاب

جیسون کارپلس (Jason Karpeles) نویسنده‌ی کتاب ریاضیات مدل‌ های زبانی بزرگ است. او دو مدرک کارشناسی ارشد در رشته‌های مرتبط با داده و هوش مصنوعی دارد و بیش از ۳۰ سال تجربه در ساخت مدل‌های آماری و سیستم‌های داده‌محور کسب کرده است. کارپلس در طول این سال‌ها، با چالش‌های عملی پیاده‌سازی الگوریتم‌های پیچیده در صنعت آشنا شده و این تجربه را به‌خوبی در کتاب منعکس کرده است.

رویکرد منحصربه‌فرد او در آموزش ریاضیات، ترکیب دقت علمی با داستان‌سرایی است. او در مقدمه کتاب می‌نویسد:

داستان‌ها در یک کتاب ریاضی، تزئین نیستند. آنها ریاضیات را زنده می‌کنند و به آن بافت می‌دهند.

کارپلس با انتخاب داستان‌های پشت هر ایده از هرمان مینکوفسکی در زوریخ ۱۸۹۶ تا تیم گوگل در مانترآل ۲۰۱۸ ریاضیات انتزاعی را به مسائل ملموس و قابل‌درک تبدیل کرده است.

با وجود اینکه کارپلس خود را یک آکادمیک نمی‌داند (در مقدمه می‌نویسد: «من یک آکادمیک نیستم»)، تسلط او بر مفاهیم و توانایی‌اش در انتقال آنها به زبانی ساده و جذاب، کتاب را به یکی از ارزش‌مندترین منابع حوزه‌ی مدل‌های زبانی بزرگ تبدیل کرده است. انتشار نسخه‌ی به‌روزرسانی‌شده در آگوست ۲۰۲۶ و وجود وب‌سایت همراه برای تصحیحات و اشتقاقات جدید، نشان از تعهد او به به‌روز ماندن کتاب در حوزه‌ای با سرعت تحول بالا دارد.

کتاب ریاضیات مدل‌ های زبانی بزرگ به شما کمک می‌کند از «چگونه» به «چرا» برسید. این کتاب یک مرجع عملی است که نشان می‌دهد چرا یک معماری خاص کار می‌کند، چرا یک قضیه اهمیت دارد، و چرا مدل‌ها در عمل موفق‌اند حتی وقتی نظریه نمی‌تواند آن را به‌طور کامل توجیه کند.

این کتاب برای متخصصان ریاضی که به دنبال ارتباطات عمیق‌تر هستند، ممکن است ناامیدکننده باشد (نقد مت گینزبرگ). اما برای مهندسانی که با مفاهیم پایه‌ای ریاضی آشنا هستند و می‌خواهند درک عملی و کاربردی از مدل‌های زبانی پیدا کنند، یکی از ارزش‌مندترین منابع موجود است.

آیا به دنبال منبعی برای درک عمیق‌تر از مبانی ریاضی یادگیری ماشین هستید؟ کتاب Learning Theory from First Principles اثر Francis Bach از انتشارات MIT Press، از نظر عمق ریاضی و رویکرد تئوری‌محور، یکی از نزدیک‌ترین گزینه‌ها به کتاب «ریاضیات مدل‌های زبانی بزرگ» است و برای پژوهشگران و دانشجویان دکتری طراحی شده است.

دیدگاهها

هیچ دیدگاهی برای این محصول نوشته نشده است.

اولین نفری باشید که دیدگاهی را ارسال می کنید برای “کتاب ریاضیات مدل‌ های زبانی بزرگ (The Mathematics of Large Language Models)”

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

17 − 5 =

پرفروش‌ترین کتاب‌ها

مشاهده همه

نویسنده‌های محبوب

دسته‌بندی‌ها

مشاهده همه