دوره جامع و تخصصی پردازش زبان طبیعی (NLP Masterclass)

مسیری ۶ ترمه و کاملاً حرفه‌ای برای تبدیل شدن به متخصص ارشد NLP و مدل‌های بزرگ زبانی (LLMs)؛ از متن‌کاوی کلاسیک تا شبکه‌های عمیق، Transformerها، سیستم‌های RAG و توسعه چت‌بات‌های هوشمند.

این دوره چه مهارت‌هایی به شما می‌دهد؟

  • تسلط کامل بر پیش‌پردازش تخصصی متون فارسی و انگلیسی (Normalization, Stemming, Lemmatization)
  • توانایی پیاده‌سازی متدهای پیشرفته بازنمایی برداری متن (Word2Vec, FastText, GloVe)
  • طراحی شبکه‌های عصبی عمیق برای متن (RNN, LSTM, GRU) در PyTorch و TensorFlow
  • تسلط بر معماری Transformerها و کار حرفه‌ای با اکوسیستم Hugging Face (BERT, RoBERTa, ParsBERT)
  • فاین‌تیون (Fine-Tuning) مدل‌های بزرگ زبانی (LLMs) مانند LLaMA و Mistral با تکنیک‌های LoRA / QLoRA
  • توسعه پروژه‌های چت‌بات سازمانی مبتنی بر RAG، پایگاه‌های داده برداری (Vector DBs) و فریم‌ورک‌های LangChain و LlamaIndex

سرفصل‌های جامع دوره (۶ ترم / ۶۰ جلسه)

این دوره شامل ۶ ترم آموزشی کاملاً هدفمند و پروژه‌محور است. هر ترم شامل ۱۰ جلسه ۱ ساعت و ۱۵ دقیقه‌ای به همراه پروژه پایانی جامع می‌باشد:

ترم اول: پیش‌پردازش متون، متون فارسی و متن‌کاوی کلاسیک

جلسه ۰۱: معرفی دنیای NLP و چالش‌های زبان‌های طبیعی کاربردهای NLP، معماری پروژه‌های متنی و بررسی چالش‌های اختصاصی خط و زبان فارسی
جلسه ۰۲: نرمال‌سازی متون (Text Normalization) اصلاح حروف، نیم‌فاصله، حذف کاراکترهای زائد و معرفی ابزارهای Hazm و Parsivar
جلسه ۰۳: توکن‌سازی (Tokenization) و لمت‌سازی روش‌های Tokenization در سطح کلمه و زیرکلمه، Stemming و Lemmatization متون
جلسه ۰۴: عبارت‌های منظم (Regex) در پردازش متون استخراج الگوهای متنی پیچیده، شماره‌ها، ایمیل‌ها و پاک‌سازی داده‌های ناخالص وب
جلسه ۰۵: بردارسازی پایه (Bag of Words & N-Grams) مفهوم BoW، ساخت ماتریس شمارشی، مدل‌سازی N-Gram و محاسبه احتمالات زبانی
جلسه ۰۶: تکنیک وزن‌دهی TF-IDF مفاهیم Term Frequency و Inverse Document Frequency و کاربرد آن در سنجش اهمیت کلمات
جلسه ۰۷: دسته‌بندی متون با ماشین لرنینگ کلاسیک الگوریتم‌های Naive Bayes و SVM برای دسته‌بندی خبرها و متون با Scikit-Learn
جلسه ۰۸: تحلیل احساسات پایه (Sentiment Analysis) برچسب‌گذاری کلمات، استفاده از Lexiconها و تشخیص پلاریته مثبت/منفی نظرات کاربران
جلسه ۰۹: ارزیابی مدل‌های متنی و ماتریس درهم‌ریختگی معیارهای Precision, Recall, F1-Score, ROC-AUC و ارزیابی خطای مدل‌ها
جلسه ۱۰: پروژه پایانی ترم اول 🎯 ساخت سیستم خودکار دسته‌بندی و تحلیل احساسات نظرات خریداران فروشگاه اینترنتی با متون فارسی

ترم دوم: بردارهای معنایی کلمات (Word Embeddings) و مدل‌سازی آماری

جلسه ۱۱: چالش‌های ابعاد و محدودیت‌های روش‌های یک‌داغ (One-Hot) چرا به فضای برداری پیوسته نیاز داریم؟ مفهوم تشابه معنایی در فضای چندبعدی
جلسه ۱۲: مدل Word2Vec (معماری Skip-gram) پیش‌بینی کلمات همسایه، توابع هزینه و آموزش الگوریتم Skip-gram
جلسه ۱۳: مدل Word2Vec (معماری CBOW) و بهینه‌سازی معماری Continuous Bag of Words و تکنیک Negative Sampling برای افزایش سرعت آموزش
جلسه ۱۴: کار با کتابخانه Gensim بارگذاری بردارهای پیش‌آموزش‌دیده، آموزش Word2Vec روی دیتاست اختصاصی فارسی
جلسه ۱۵: بردارهای GloVe (Global Vectors) تلفیق آمار کلی پیکره متنی با روش‌های بهینه‌سازی محلی و مقایسه GloVe با Word2Vec
جلسه ۱۶: مدل FastText و حل مشکل کلمات خارج از واژه‌نامه (OOV) استفاده از Subword Embeddings برای پشتیبانی از کلمات جدید و غلط‌های املایی
جلسه ۱۷: کاهش ابعاد و بصری‌سازی بردارهای متنی استفاده از تکنیک‌های t-SNE و PCA برای نمایش ۳ بعدی و ۲ بعدی ارتباط کلمات
جلسه ۱۸: محاسبات ریاضی تشابه متن (Cosine Similarity) محاسبه زاویه بردارها، فاصله اقلیدسی و جستجوی کلمات و جملات مشابه در دیتابیس
جلسه ۱۹: مدل‌سازی موضوعی (Topic Modeling) با LDA کشف هوشمند موضوعات پنهان در میان میلیون‌ها سند متنی با Latent Dirichlet Allocation
جلسه ۲۰: پروژه پایانی ترم دوم 🎯 پیاده‌سازی موتور پیشنهاددهنده مقالات و اخبار مشابه بر اساس تشابه برداری معنایی (FastText/Gensim)

ترم سوم: یادگیری عمیق در NLP (PyTorch, RNN, LSTM, GRU)

جلسه ۲۱: یادگیری عمیق تخصصی برای متون با PyTorch مفاهیم Tensors، ساخت طبقات سفارشی و مدیریت GPU در شبکه عصبی PyTorch
جلسه ۲۲: لایه‌های Embedding در شبکه‌های عصبی تفاوت لایه Embedding با بردارهای ثابت و آموزش وزنی بردارهای متنی همراه با شبکه
جلسه ۲۳: شبکه‌های عصبی بازگشتی (RNN) مفهوم حافظه در توالی‌ها، جریان داده زمان‌بندی‌شده و چالش‌های پردازش متن
جلسه ۲۴: مشکل محو شدگی گرادیان (Vanishing Gradient) چرا RNN معمولی در متون طولانی شکست می‌خورد؟ بررسی ریاضی و علت‌های افت کارایی
جلسه ۲۵: شبکه‌های حافظه کوتاه‌مدت طولانی (LSTM) معماری درگاه‌ها (Input, Forget, Output Gate)، سلول حافظه و حل مشکل توالی‌های بلند
جلسه ۲۶: واحدهای بازگشتی دروازه‌ای (GRU) ساده‌سازی ساختار LSTM با Update و Reset Gate و مقایسه سرعت/دقت GRU و LSTM
جلسه ۲۷: شبکه‌های بازگشتی دوطرفه (Bi-Directional RNNs) خواندن متن از چپ به راست و راست به چپ برای درک بهتر بافت جملات در زبان‌های مختلف
جلسه ۲۸: استخراج موجودیت‌های نام‌دار (NER) با LSTM-CRF شناسایی اسامی اشخاص، سازمان‌ها و مکان‌ها در متن با شبکه‌های توالی به توالی
جلسه ۲۹: مدل‌های Sequence-to-Sequence (Seq2Seq) معماری کدگذار-کدگشا (Encoder-Decoder) برای ترجمه ماشینی و خلاصه سازی
جلسه ۳۰: پروژه پایانی ترم سوم 🎯 طراحی و آموزش سیستم ترجمه خودکار متن یا چت‌بات پاسخگویی به سوالات با Bi-LSTM و PyTorch

ترم چهارم: مکانیزم توجه (Attention) و انقلاب Transformerها (BERT & GPT)

جلسه ۳۱: مکانیزم توجه (Attention Mechanism) چیست؟ مقاله تاریخی Bahdanau Attention و نحوه وزن‌دهی هوشمند به کلمات کلیدی متن
جلسه ۳۲: معماری انقلابی Transformer (Attention Is All You Need) بررسی دقیق معماری اولیه سال ۲۰۱۷، حذف شبکه‌های بازگشتی و پردازش کاملا موازی
جلسه ۳۳: توجه به خود چندسر (Multi-Head Self-Attention) محاسبات ریاضی Query, Key, Value و درک ارتباط همزمان کلمات مختلف سند
جلسه ۳۴: کدگذاری موقعیتی (Positional Encoding) تزریق اطلاعات ترتیب و موقعیت کلمات به فرمول‌های ترنسفورمر با توابع سینوسی
جلسه ۳۵: خانواده مدل‌های کدگذار (Encoder-Only): BERT پیش‌آموزش BERT با Masked Language Modeling (MLM) و Next Sentence Prediction (NSP)
جلسه ۳۶: مدل‌های بومی فارسی (ParsBERT & WikiBERT) بررسی اکوسیستم ترنسفورمرهای فارسی و نحوه استفاده از مدل‌های آماده بومی
جلسه ۳۷: اکوسیستم Hugging Face Transformers استفاده از Pipeline ها، AutoModel، AutoTokenizer و بارگذاری هزاران مدل open-source
جلسه ۳۸: خانواده مدل‌های کدگشا (Decoder-Only): GPT مدل‌سازی زبانی مولد (Causal Language Modeling) و نحوه تولید کلمه به کلمه متن
جلسه ۳۹: فاین‌تیون (Fine-Tuning) مدل BERT بر روی داده‌های سفارشی آموزش لایه‌های نهایی ترنسفورمر برای وظایف تخصصی مانند تشخیص اسپم و دسته‌بندی پزشکی
جلسه ۴۰: پروژه پایانی ترم چهارم 🎯 فاین‌تیون مدل ParsBERT با Hugging Face برای سیستم تحلیل هوشمند حس متون خبری و مالی فارسی

ترم پنجم: مدل‌های بزرگ زبانی (LLMs)، مهندسی پرامپت و Fine-Tuning پیشرفته

جلسه ۴۱: معماری مدل‌های غول‌پیکر زبانی (LLMs) تکامل مدل‌های چندمیلیاردی از GPT-3 تا GPT-4، LLaMA 3، Mistral و Claude
جلسه ۴۲: مهندسی پرامپت پیشرفته (Advanced Prompt Engineering) تکنیک‌های Few-Shot, Chain-of-Thought (CoT), ReAct و بهینه‌سازی خروجی مدل‌ها
جلسه ۴۳: کار با APIهای تجاری (OpenAI API, Anthropic) مدیریت Tokenها، پارامترهای Temperature, Top-p و کنترل هزینه‌ها در فراخوانی سرویس‌ها
جلسه ۴۴: مدل‌های متن باز (Open-Source LLMs) و اجرای محلی اجرای مدل‌های LLaMA 3 و Mistral روی سیستم شخصی و سرور اختصاصی با Ollama و vLLM
جلسه ۴۵: کوانتیزاسیون (Quantization) مدل‌های بزرگ کاهش حجم مدل از FP16 به INT8 و INT4 برای اجرا روی سخت‌افزارهای محدود
جلسه ۴۶: تکنیک‌های بهینه فاین‌تیون (PEFT & LoRA) آموزش مدل‌های ۷۰ میلیاردی با کمترین حافظه GPU با Low-Rank Adaptation
جلسه ۴۷: بهینه‌سازی QLoRA و ساخت Dataset تخصصی آماده‌سازی داده‌های ساختاریافته دستورالعملی (Instruction Tuning) و فاین‌تیون با QLoRA
جلسه ۴۸: همراستاسازی مدل با انسان (RLHF & DPO) یادگیری تقویتی با بازخورد انسانی و Direct Preference Optimization برای ایمن‌سازی چت‌بات
جلسه ۴۹: ارزیابی LLMها و بنچمارک‌های متنی معیارهای ROUGE, BLEU, Perplexity و سنجش دقیق خروجی مدل‌های زبانی
جلسه ۵۰: پروژه پایانی ترم پنجم 🏆 فاین‌تیون یک مدل open-source مانند LLaMA 3 برای پاسخگویی تخصصی به حقوقی یا پزشکی به زبان فارسی

ترم ششم: معماری پیشرفته RAG، دیتابیس‌های برداری و MLOps تولیدی

جلسه ۵۱: معرفی معماری تولید متکی بر بازیابی (RAG) حل مشکل توهم مدل‌ها (Hallucination) و اتصال مدل‌های زبانی به پایگاه‌های دانش سازمانی
جلسه ۵۲: پایگاه‌های داده برداری (Vector Databases) آموزش دیتابیس‌های تخصصی ChromaDB, Qdrant, Pinecone و FAISS برای ذخیره Embeddingها
جلسه ۵۳: تکه‌تکه‌سازی متون (Text Chunking Strategies) استراتژی‌های قطعه‌قطعه کردن اسناد PDF و وب‌سایت‌ها (Fixed-size, Semantic, Recursive)
جلسه ۵۴: فریم‌ورک LangChain - مفاهیم پایه و زنجیره‌ها مدیریت Prompts، Chains، Memory و اتصال لایه‌های مختلف برنامه‌های کاربردی AI
جلسه ۵۵: فریم‌ورک LlamaIndex برای دیتاهای پیچیده ساخت ایندکس‌های ساختاریافته از فایل‌های Excel, PDF, Notion و پایگاه‌های داده SQL
جلسه ۵۶: تکنیک‌های RAG پیشرفته (Advanced RAG) استفاده از Re-ranking، Query Rewriting، Hybrid Search (BM25 + Vector) برای دقت ۱۰۰٪
جلسه ۵۷: عامل‌های هوشمند مستقل (AI Agents & LangGraph) طراحی Agentهایی با قابلیت اجرای کد، جستجو در گوگل و استفاده از ابزارهای خاریجی
جلسه ۵۸: ارزیابی سیستم‌های RAG با Ragas Framework محاسبه شاخص‌های Faithfulness, Answer Relevance و Context Recall در محیط واقعی
جلسه ۵۹: استقرار و سرویس‌دهی مدل‌های NLP (LLM Ops) توسعه API با FastAPI، داکرایز کردن پروژه‌ها، بهینه‌سازی سرعت پاسخ‌دهی و Streaming
جلسه ۶۰: پروژه نهایی و شبیه‌سازی مصاحبه کاری 🏆 پیاده‌سازی و استقرار کامل دستیار هوشمند پشتیبانی سازمانی مبتنی بر RAG + LangChain + VectorDB + Docker به همراه رزومه‌نویسی حرفه‌ای

شیوه برگزاری و پشتیبانی کلاس‌ها

این دوره به دو صورتحضوریدر فضایی کاملاً مجهز وآنلاین (زنده)برگزار می‌شود. همچنین هر دانشجو زیر نظر منتور اختصاصی پروژه، پشتیبانی برای رفع اشکال خواهد داشت.