کتاب Build a Reasoning Model

289,000 تومان

با رویکردی کاملاً عملی و کد‑محور، کتاب Build a Reasoning Model شما را از بارگذاری یک مدل پایه تا پیاده‌سازی یک مدل استدلالی کامل با PyTorch همراهی می‌کند و با استفاده از مدل Qwen3 0.6B، تکنیک‌های روزی مانند GRPO و تقطیر را روی سخت‌افزار معمولی قابل اجرا می‌سازد.

نویسنده
Sebastian Raschka
ناشر
Manning
تعداد صفحات
440
سال انتشار
11 آگوست 2026
عنوان کتاب :
Build a Reasoning Model (From Scratch)
فرمت کتاب :
PDF اورجینال

توضیحات

در دنیای مدل‌های زبانی بزرگ، مرز میان «تولید متن» و «استدلال» در حال محو شدن است. کتاب Build a Reasoning Model نوشته‌ی سباستین راشکا، نقشه‌ی راهی است برای درک این مرز و عبور از آن. این کتاب با زبانی دقیق و رویکردی کاملاً عملی، شما را از مرحله‌ی بارگذاری یک مدل پایه تا پیاده‌سازی یک مدل استدلالی کامل همراهی می‌کند و در این مسیر، نه تنها «چگونگی» بلکه «چرایی» هر تصمیم را با استناد به کد و مثال آشکار می‌سازد.

چرا مدل‌های استدلالی، آیندهٔ هوش مصنوعی را دگرگون می‌کنند؟

پرسشی که کتاب با آن آغاز می‌شود، پرسشی بنیادین است: «استدلال» در بستر مدل‌های زبانی بزرگ دقیقاً به چه معناست؟ نویسنده در فصل اول، با لحنی دقیق و بی‌طرفانه، این مفهوم را از دو زاویه بررسی می‌کند:

تفاوت مدل‌های زبانی معمولی با مدل‌های استدلالی در چیست؟

مدل‌های زبانی معمولی، بر اساس الگوهای آماری، توکن بعدی را پیش‌بینی می‌کنند. در مقابل، مدل‌های استدلالی، گام‌های میانی را قبل از ارائه‌ی پاسخ نهایی تولید می‌کنند. این گام‌ها، که گاه در تگ‌هایی مانند <think>…</think> پنهان می‌شوند، به مدل اجازه می‌دهند تا مسائل پیچیده را به چند مرحله تجزیه کند و دقت خود را در حوزه‌هایی مانند ریاضیات، کدنویسی و حل مسئله افزایش دهد.

نویسنده در صفحه‌ی ۴ کتاب تأکید می‌کند که این فرآیند، با «استدلال انسانی» تفاوت بنیادین دارد:

استدلال در مدل‌های زبانی بزرگ، احتمالاتی است و نه قطعی؛ به این معنا که توکن‌ها را بر اساس الگوهای آماری داده‌های آموزشی تولید می‌کند، بدون هیچ تضمینی برای سازگاری منطقی.

این تفاوت، هسته‌ی اصلی کتاب را شکل می‌دهد که چگونه می‌توان با تکنیک‌های آموزشی و مهندسی، این «تولید الگویی» را به سمت «استدلال کارآمد» هدایت کرد؟

سه رویکرد اصلی برای بهبود reasoning: استنتاج، یادگیری تقویتی و تقطیر

کتاب، سه راهبرد کلان را برای بهبود استدلال در مدل‌های زبانی معرفی می‌کند (صفحه‌ی ۸):

  • افزایش محاسبات در زمان استنتاج (Inference-Time Scaling): تکنیک‌هایی مانند زنجیره‌اندیشه (Chain-of-Thought) و خودهمسانی (Self-Consistency) که بدون تغییر وزن مدل، دقت را افزایش می‌دهند.
  • یادگیری تقویتی (Reinforcement Learning): آموزش مدل با استفاده از سیگنال‌های پاداش قابل راستی‌آزمایی (مانند بررسی پاسخ ریاضی).
  • تقطیر (Distillation): انتقال توانایی‌های استدلالی از یک مدل بزرگ‌تر (معلم) به مدلی کوچک‌تر (دانش‌آموز).

این سه رویکرد، ستون‌های فقرات کتاب را تشکیل می‌دهند و هر یک در فصل‌های جداگانه، با جزییات کامل پیاده‌سازی می‌شوند.

از صفر تا یک مدل استدلالی کارآمد: کتاب Build a Reasoning Model چه مسیری را طی می‌کند؟

کتاب با این پیش‌فرض آغاز می‌شود که شما با یک مدل پایه‌ی ازپیش‌آموزش‌دیده سروکار دارید و نیازی به هزینه‌ی گزاف آموزش مجدد ندارید. این رویکرد، کتاب را برای خوانندگانی با منابع محدود (سخت‌افزار معمولی) قابل‌دسترس می‌کند. مسیر کتاب، شامل پنج ایستگاه اصلی است:

شروع با یک مدل پایه و تولید متن (فصل ۲)

در این فصل، شما با مدل Qwen3 0.6B آشنا می‌شوید؛ مدلی که علیرغم اندازه‌ی کوچک، معماری مدرنی دارد. نویسنده با راهنمایی گام‌به‌گام، فرآیند بارگذاری مدل، توکن‌سازی، و تولید متن دنباله‌ای (autoregressive) را از صفر پیاده‌سازی می‌کند.

نقطه‌ی عطف این فصل، معرفی دو تکنیک برای افزایش سرعت استنتاج است: KV caching که سرعت تولید را از ۵ توکن بر ثانیه به ۲۹ توکن بر ثانیه می‌رساند (صفحه‌ی ۴۹) و کامپایل مدل با PyTorch که این عدد را به ۶۸ توکن در ثانیه افزایش می‌دهد (صفحه‌ی ۵۴).

ساخت ابزار ارزیابی دقیق برای مسائل ریاضی (فصل ۳)

ارزیابی، هسته‌ی هر پروژه‌ی یادگیری ماشین است. نویسنده در این فصل، یک راستی‌آزمای ریاضی (math verifier) از صفر می‌سازد. فرآیند شامل استخراج پاسخ از داخل \boxed{}، نرمال‌سازی عبارات LaTeX (تبدیل \frac به (a)/(b)) و بررسی برابری ریاضی با کمک کتابخانه‌ی SymPy است.

آنچه این فصل را متمایز می‌کند، توجه به موارد مرزی است؛ مثلاً مدیریت پاسخ‌های چندبخشی مانند (14/3, 2/3) که در صفحه‌ی ۷۹ به آن پرداخته شده. این راستی‌آزمای ساخته‌شده، بعدها به عنوان سیگنال پاداش در یادگیری تقویتی (فصل ۶) استفاده می‌شود.

افزایش دقت بدون تغییر وزن مدل (فصل‌های ۴ و ۵)

فصل چهارم به تکنیک‌های افزایش محاسبات در زمان استنتاج اختصاص دارد. سه روش اصلی در این فصل پیاده‌سازی می‌شوند:

  • زنجیره‌اندیشه (Chain-of-Thought): با افزودن عبارت “Explain step by step.” به پرامپت، دقت مدل پایه روی دیتاست MATH-500 از ۱۵.۲٪ به ۴۰.۶٪ افزایش می‌یابد (جدول صفحه‌ی ۱۳۳).
  • خودهمسانی (Self-Consistency): با تولید چندین پاسخ و انتخاب پاسخ اکثریت، دقت به ۵۲٪ می‌رسد، هرچند زمان اجرا به شدت افزایش می‌یابد.
  • خودبهبودی (Self-Refinement): در فصل پنجم، نویسنده نشان می‌دهد که چگونه مدل می‌تواند پاسخ اولیه‌ی خود را نقد کرده و آن را اصلاح کند. این فرآیند، مبتنی بر امتیازدهی با log-probability است که در صفحه‌ی ۱۶۲ توضیح داده شده.

توانمندسازی مدل با یادگیری تقویتی و GRPO (فصل‌های ۶ و ۷)

در این فصل ها نویسنده پس از معرفی کوتاه RLHF (یادگیری تقویتی با بازخورد انسانی)، به سراغ RLVR (یادگیری تقویتی با پاداش قابل راستی‌آزمایی) می‌رود و الگوریتم GRPO را به عنوان روشی کارآمد برای این کار معرفی می‌کند (صفحه‌ی ۱۸۶).

مراحل GRPO با دقت تمام شرح داده می‌شود: تولید چندین پاسخ (rollout) برای یک پرامپت، محاسبه‌ی پاداش (۱ برای پاسخ صحیح و ۰ برای نادرست)، محاسبه‌ی مزیت (advantage) با نرمال‌سازی پاداش‌ها در گروه، و در نهایت به‌روزرسانی وزن‌ها با تلفات سیاست (policy gradient loss). اما حتی با ۵۰ مرحله آموزش، مدل به دقتی نزدیک به مدل استدلالی مرجع (۴۷.۴٪ در برابر ۴۸.۲٪) دست می‌یابد (جدول صفحه‌ی ۲۲۲).

فصل هفتم، به بهبود GRPO اختصاص دارد و موضوعاتی مانند ردیابی معیارهای عملکرد (آنتروپی، انحراف معیار مزیت) و پایدارسازی آموزش با نسبت سیاست بریده (clipped policy ratio) را پوشش می‌دهد.بحث در مورد جمله‌ی KL (Kullback-Leibler) است که در صفحه‌ی ۲۵۵، نویسنده اشاره می‌کند که در برخی کارهای ریاضی، حذف این جمله عملکرد بهتری به همراه دارد.

الگوریتم GRPO که در این کتاب به آن پرداخته شده، همچنان یکی از روش‌های پیشرو در پژوهش‌های ۲۰۲۶ است. نسخه‌ی بهبودیافته‌ی آن با نام iGRPO، با افزودن یک مرحله‌ی خود-بازتابی، توانسته است نتایج پیشرفته‌ای روی مجموعه‌داده‌های AIME به دست آورد. (مطالعه‌ی کامل‌تر: مقاله‌ی iGRPO: Self-Feedback-Driven LLM Reasoning، منتشرشده در arXiv، ۹ فوریه ۲۰۲۶)

تقطیر reasoning از مدل‌های بزرگ‌تر به مدل کوچک (فصل ۸)

در آخرین فصل، کتاب به سراغ تقطیر سخت (hard distillation) می‌رود. ایده ساده است که از یک مدل بزرگ (مانند DeepSeek-R1 با ۶۷۱ میلیارد پارامتر) برای تولید reasoning trace و پاسخ استفاده می‌کنیم و سپس یک مدل کوچک (Qwen3 0.6B) را با این داده‌ها آموزش می‌دهیم. نتیجه، مدلی است که با هزینه‌ای بسیار کمتر، بخش قابل‌توجهی از توانایی استدلالی مدل بزرگ را کسب می‌کند.

به عنوان مثال، تقطیر با مدل Qwen3 235B-A22B (هم‌خانواده با دانش‌آموز) دقتی برابر با ۴۴.۲٪ روی MATH-500 به دست می‌دهد که بسیار نزدیک به مدل مرجع (۴۸.۲٪) است (جدول صفحه‌ی ۲۹۹).

این فصل، نشان می‌دهد که چگونه می‌توان از داده‌های تولیدشده توسط مدل‌های بزرگ برای ساخت مدل‌های کارآمد و مقیاس‌پذیر استفاده کرد.

چگونه کتاب Build a Reasoning Model، پیچیده‌ترین مباحث LLM را برای شما ملموس می‌کند؟

مهم‌ترین ویژگی این کتاب، رویکرد «از صفر» و «کد-محور» آن است. نویسنده، مفاهیم انتزاعی را با کدهای اجرایی گره می‌زند و خواننده را در موقعیتی قرار می‌دهد که نه تنها تئوری را بفهمد، بلکه آن را اجرا کند.

سبک کد-محور: هر مفهوم با یک پیاده‌سازی عملی همراه است

به عنوان مثال، در فصل ۲، فرآیند تولید متن نه به عنوان یک تابع کتابخانه‌ای، بلکه به صورت یک حلقه‌ی for پیاده‌سازی می‌شود که توکن‌ها را یکی یکی تولید می‌کند. همین رویکرد در سراسر کتاب ادامه دارد: از پیاده‌سازی KV caching (صفحه‌ی ۴۶) تا پیاده‌سازی GRPO در فصل ۶.

نویسنده حتی توکنایزر مدل Qwen3 را نیز از صفر بازنویسی کرده است (ضمیمه‌ی C) تا وابستگی به کتابخانه‌های خارجی به حداقل برسد.

استفاده از مدل Qwen3 0.6B؛ اجرای مثال‌ها روی سخت‌افزار معمولی

انتخاب مدل Qwen3 0.6B، یک تصمیم استراتژیک است. این مدل به قدری کوچک است که روی اکثر لپ‌تاپ‌های امروزی قابل اجراست (فصل ۲)، اما به قدری مدرن است که معماری‌های روز مانند Grouped Query Attention و RoPE را پشتیبانی می‌کند.

نویسنده در مقدمه‌ی کتاب می‌نویسد:

من مدل را عمداً کوچک انتخاب کردم تا خوانندگان بتوانند تمام مثال‌ها را روی سخت‌افزار شخصی خود اجرا کنند و درک عمیق‌تری از فرآیند به دست آورند.

این ویژگی، کتاب را از بسیاری از منابع مشابه که صرفاً بر روی کاغذ به تئوری می‌پردازند، متمایز می‌کند.

نقشهٔ راه بصری و خلاصه‌های تکرارشونده برای درک بهتر جریان

ساختار کتاب به گونه‌ای طراحی شده که خواننده هرگز گم نشود. تقریباً در ابتدای هر فصل، یک نقشه‌ی راه (مانند شکل ۲.۹ در صفحه‌ی ۴۰) قرار دارد که جایگاه آن فصل را در کل پروژه نشان می‌دهد.

همچنین هر فصل با خلاصه‌ای جامع به پایان می‌رسد که نکات کلیدی را مرور می‌کند. این ساختار، به ویژه برای خوانندگانی که با موضوع آشنا نیستند، بسیار ارزشمند است و به درک بهتر جریان اصلی کتاب کمک می‌کند.

با مطالعهٔ این کتاب دقیقاً چه مهارت‌هایی به دست می‌آورید؟

این کتاب، یک کارگاه عملی برای تبدیل شدن به یک متخصص مدل‌های استدلالی است. مهارت‌هایی که پس از مطالعه کسب می‌کنید، فراتر از یکسری دانش تئوری است و می‌توانید آن‌ها را در پروژه‌های واقعی به کار بگیرید:

پیاده‌سازی کامل یک مدل استدلالی از صفر با PyTorch

شما یاد می‌گیرید که چگونه با استفاده از PyTorch، یک مدل زبانی را بارگذاری کنید، متن تولید کنید، آن را ارزیابی کنید و سپس با تکنیک‌های پیشرفته، آن را به یک مدل استدلالی تبدیل کنید. تمام کدهای کتاب در مخزن GitHub موجود است و می‌توانید آنها را به عنوان پایه‌ای برای پروژه‌های خود استفاده کنید.

تسلط بر تکنیک‌های زنجیره‌اندیشه، خودهمسانی و خودبهبودی

شما نه تنها با این تکنیک‌ها آشنا می‌شوید، بلکه آن‌ها را از صفر پیاده‌سازی می‌کنید. به عنوان مثال، در فصل ۴، تابع self_consistency_vote را می‌نویسید که با استفاده از نمونه‌برداری با دما و top-p، چندین پاسخ تولید کرده و با رأی‌گیری اکثریت، پاسخ نهایی را انتخاب می‌کند (صفحه‌ی ۱۲۹). این مهارت‌ها به شما امکان می‌دهد تا بدون نیاز به آموزش مجدد مدل، دقت آن را افزایش دهید.

اجرای الگوریتم GRPO برای آموزش با پاداش قابل راستی‌آزمایی

یکی از ارزشمندترین مهارت‌هایی که کسب می‌کنید، پیاده‌سازی الگوریتم GRPO است. شما یاد می‌گیرید که چگونه یک حلقه‌ی آموزش یادگیری تقویتی را از صفر بنویسید؛ از تولید rollout و محاسبه‌ی پاداش تا محاسبه‌ی مزیت و به‌روزرسانی وزن‌ها. این مهارت، شما را در خط مقدم پژوهش‌های روز مدل‌های استدلالی قرار می‌دهد.

استفاده از تقطیر برای انتقال توانایی استدلال به مدل‌های سبک‌تر

در فصل ۸، شما با فرآیند تقطیر آشنا می‌شوید و یاد می‌گیرید که چگونه از داده‌های تولیدشده توسط یک مدل بزرگ (معلم) برای آموزش مدل کوچک‌تر (دانش‌آموز) استفاده کنید. این مهارت، در دنیای واقعی که منابع محاسباتی محدود است، کاربرد فراوانی دارد.

کتاب Build a Reasoning Model دقیقاً برای چه کسانی نوشته شده است؟

بر اساس مقدمه و ساختار کتاب، مخاطبان اصلی این اثر عبارتند از:

مهندسان ماشین‌لرنینگ و توسعه‌دهندگان نرم‌افزار آشنا با Python

اگر با Python آشنایی دارید و می‌خواهید درک عمیق‌تری از نحوه‌ی کار مدل‌های استدلالی پیدا کنید، این کتاب منبعی بی‌نظیر است.

پیش‌نیاز کتاب، آشنایی اولیه با PyTorch است، اما نویسنده در مقدمه (صفحه‌ی xix) تأکید می‌کند که حتی با دانش مقدماتی نیز می‌توانید از کتاب بهره ببرید و در صورت نیاز، به آموزش‌های رایگان نویسنده ارجاع می‌دهد.

محققانی که به دنبال درک داخلی reasoning models هستند

برای محققانی که مقالات را می‌خوانند اما درک عمیقی از پیاده‌سازی ندارند، این کتاب یک پل ارتباطی است. نویسنده با پیاده‌سازی از صفر، جزئیاتی را آشکار می‌کند که در مقالات علمی معمولاً نادیده گرفته می‌شوند.

به عنوان مثال، پیاده‌سازی RoPE (صفحه‌ی ۳۴۴) یا Grouped Query Attention (صفحه‌ی ۳۴۶) در ضمیمه‌ی C، برای درک دقیق معماری مدل‌های جدید بسیار مفید است.

دانشجویانی که می‌خواهند فراتر از مفاهیم تئوری، دست به کدنویسی بزنند

دانشجویان رشته‌های هوش مصنوعی و یادگیری ماشین، با مطالعه‌ی این کتاب می‌توانند آموخته‌های تئوری خود را به عمل تبدیل کنند. ساختار گام‌به‌گام و تمرین‌های انتهای هر فصل (که پاسخ‌های آن‌ها در ضمیمه‌ی B آمده است)، این کتاب را به یک منبع درسی کامل تبدیل کرده است.

نویسندهٔ کتاب چه اعتباری دارد و چرا می‌توان به او اعتماد کرد؟

اعتبار یک کتاب فنی، تا حد زیادی به اعتبار نویسنده‌ی آن گره خورده است. سباستین راشکا، با بیش از یک دهه سابقه درخشان در حوزه‌ی هوش مصنوعی، یکی از شناخته‌شده‌ترین چهره‌های آموزشی این حوزه است.

راشکا به عنوان محقق ارشد در شرکت Lightning AI فعالیت داشته و تجربه‌ی عملی گسترده‌ای در پیاده‌سازی و استقرار مدل‌های زبانی بزرگ دارد. تخصص او در حوزه‌ی سیستم‌های هوش مصنوعی با کارایی بالا، در کتاب به وضوح قابل مشاهده است.

راشکا علاوه بر فعالیت‌های صنعتی، سابقه‌ی تدریس به عنوان استاد آمار در دانشگاه ویسکانسین-مدیسن را نیز دارد. این ترکیب از تجربه‌ی آکادمیک و صنعتی، به او امکان داده است تا مطالب را با زبانی دقیق و در عین حال قابل‌فهم برای طیف وسیعی از خوانندگان ارائه دهد.

نویسندهٔ کتاب پرفروش Build a Large Language Model (From Scratch)

کتاب قبلی او، که به آموزش ساخت یک مدل زبانی از صفر اختصاص داشت، به یکی از پرفروش‌ترین کتاب‌های حوزه‌ی LLM تبدیل شد و تحسین منتقدان و خوانندگان را برانگیخت. این کتاب نیز دنباله‌ای بر همان رویکرد است و بر روی «استدلال» متمرکز شده است. در مقدمه‌ی کتاب (صفحه‌ی xiv)، راشکا اشاره می‌کند که این کتاب، ادامه‌ی طبیعی کتاب قبلی است، اما برای خواندن آن نیازی به مطالعه‌ی کتاب پیشین نیست.

مقایسهٔ کتاب Build a Reasoning Model با سایر منابع آموزشی؛ چه تفاوتی دارد؟

در بازار انبوه کتاب‌ های آموزشی هوش مصنوعی، چه چیزی این کتاب را متمایز می‌کند؟ سه ویژگی کلیدی، پاسخگوی این پرسش است:

رویکرد «از صفر» به‌جای استفاده از کتابخانه‌های آماده

بسیاری از منابع آموزشی، مفاهیم را با استفاده از کتابخانه‌های سطح بالا (مانند Hugging Face Transformers) آموزش می‌دهند. اما کتاب راشکا، رویکردی کاملاً متفاوت دارد. او تمام مؤلفه‌ها، از توکنایزر گرفته تا حلقه‌های آموزش GRPO را از صفر پیاده‌سازی می‌کند. این کار، هرچند زمان‌برتر است، اما درک عمیق‌تری از جزئیات ارائه می‌دهد. همانطور که نویسنده در مقدمه (صفحه‌ی xv) می‌گوید: «بهترین راه برای درک مدل‌های استدلالی، این است که خودتان یکی را بسازید.»

تمرکز بر روش‌های روز (GRPO، RLVR، distillation) نه فقط مفاهیم پایه

در حالی که بسیاری از کتاب‌ها، بر روی مفاهیم پایه‌ای مانند توجه (attention) و معماری ترنسفورمر متمرکز می‌شوند، این کتاب به سراغ جدیدترین روش‌های بهبود استدلال می‌رود.

الگوریتم GRPO که در سال ۲۰۲۴ معرفی شده (صفحه‌ی ۱۸۷) و روش تقطیر که در DeepSeek-R1 به کار رفته (صفحه‌ی ۲۶۸)، از جمله موضوعات پیشرویی هستند که در این کتاب به طور کامل پوشش داده شده‌اند.

پژوهش‌های اخیر نشان می‌دهند که صرفاً بررسی صحت پاسخ نهایی کافی نیست و باید کیفیت فرآیند استدلال نیز ارزیابی شود. رویکرد TRACELIFT که در می ۲۰۲۶ منتشر شده، دقیقاً به همین موضوع پرداخته است. (مقاله‌ی TRACELIFT: Correct Is Not Enough، منتشرشده در arXiv، ۵ می ۲۰۲۶)

ارائهٔ مثال‌های قابل اجرا با مدل واقعی Qwen3 به‌جای کدهای تکه‌تکه

برخلاف کتاب‌هایی که با قطعات کد نامرتبط به مفاهیم می‌پردازند، این کتاب از یک مدل واقعی (Qwen3 0.6B) در سراسر فصل‌ها استفاده می‌کند. این پیوستگی، به خواننده اجازه می‌دهد تا تأثیر هر تغییر را بر روی یک مدل واحد مشاهده کند و درک بهتری از تعامل روش‌های مختلف به دست آورد.

پس از خواندن کتاب Build a Reasoning Model، چه دستاوردی خواهید داشت؟

خواندن این کتاب، یک سرمایه‌گذاری بلندمدت بر روی دانش فنی شماست. نتایج ملموسی که انتظار می‌رود، عبارتند از:

  • توانایی طراحی، ارزیابی و بهبود یک مدل استدلالی متناسب با پروژهٔ خود
    شما با چارچوبی جامع آشنا می‌شوید که به شما امکان می‌دهد برای هر پروژه‌ای، بهترین ترکیب از روش‌های استدلالی را انتخاب کنید. دیگر برایتان سوال نیست که آیا باید از self-consistency استفاده کنید یا self-refinement؛ با توجه به هزینه‌ها و مزایا، تصمیم‌گیری خواهید کرد.
  • درک هزینه‌ها، مصالحه‌های سرعت و دقت در روش‌های مختلف reasoning
    یکی از نقاط قوت کتاب، توجه به مصالحه‌های عملی است. در سراسر کتاب، جداول و نمودارهایی وجود دارد که تأثیر هر روش را بر روی سرعت و دقت نشان می‌دهد (برای نمونه، جدول ۴.۱ در صفحه‌ی ۱۳۳). این آگاهی، به شما کمک می‌کند تا در پروژه‌های واقعی، بهترین تصمیم را بر اساس منابع موجود بگیرید.

پرسش‌های متداول درباره کتاب Build a Reasoning Model

چرا کتاب از مدل Qwen3 استفاده کرده و نه مدل‌های پرطرفدار دیگری مثل Llama؟

نویسنده در صفحه‌ی ۲۹ سه دلیل اصلی برای این انتخاب ذکر می‌کند:

  1. اندازه‌ی کوچک و در عین حال توانمند مدل،
  2. وجود نسخه‌ی پایه و نسخه‌ی استدلالی برای مقایسه،
  3. و امکان اجرا روی سخت‌افزار معمولی.

این انتخاب، کتاب را برای طیف وسیع‌تری از خوانندگان قابل‌دسترس می‌کند.

آیا برای خواندن این کتاب، نیاز به دانش قبلی در مورد ترنسفورمرها دارم؟

خیر. نویسنده در مقدمه (صفحه‌ی xiv) به صراحت می‌گوید که این کتاب، خودکفا است و حتی اگر با جزییات معماری LLM آشنا نباشید، می‌توانید از آن بهره ببرید. البته، آشنایی با PyTorch توصیه می‌شود و نویسنده برای تازه‌کاران، به آموزش‌های رایگان خود ارجاع می‌دهد.

آیا کدهای کتاب قابل اجرا روی GPUهای ضعیف یا CPU هستند؟

بله. اکثر کدهای فصل‌های ابتدایی (۲ تا ۵) روی CPU به خوبی اجرا می‌شوند. برای فصل‌های ۶ تا ۸ که به آموزش مدل مربوط می‌شوند، داشتن GPU توصیه می‌شود، اما نویسنده راهکارهایی برای کاهش مصرف حافظه (مانند کاهش تعداد rolloutها) ارائه داده است (صفحه‌ی ۲۱۹). همچنین در ضمیمه‌ی E، نسخه‌های بهینه‌شده‌ی کدها با قابلیت پردازش دسته‌ای (batching) ارائه شده است.

تفاوت اصلی این کتاب با کتاب قبلی نویسنده (Build a Large Language Model) در چیست؟

کتاب قبلی بر روی «ساخت» یک مدل زبانی از صفر (معماری، پیش‌آموزش و تنظیم دقیق) متمرکز بود، در حالی که این کتاب بر روی «استدلال» و روش‌های بهبود آن پس از مرحله‌ی پیش‌آموزش تمرکز دارد. کتاب قبلی به شما یاد می‌دهد که چگونه موتور را بسازید، و این کتاب به شما یاد می‌دهد که چگونه با همان موتور، مسائل پیچیده‌تر را حل کنید.

اگر پرسش‌هایی که در اینجا مطرح شد، با دغدغه‌های شما همخوانی دارد، کتاب Build a Reasoning Model (From Scratch) می‌تواند نقشه‌ی راهی باشد که برای ورود به دنیای مدل‌های استدلالی به آن نیاز دارید.

دیدگاهها

هیچ دیدگاهی برای این محصول نوشته نشده است.

اولین نفری باشید که دیدگاهی را ارسال می کنید برای “کتاب Build a Reasoning Model”

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

پنج × دو =

پرفروش‌ترین کتاب‌ها

مشاهده همه

نویسنده‌های محبوب

دسته‌بندی‌ها

مشاهده همه