دوره جامع و تخصصی پردازش زبان طبیعی (NLP Masterclass)
مسیری ۶ ترمه و کاملاً حرفهای برای تبدیل شدن به متخصص ارشد NLP و مدلهای بزرگ زبانی (LLMs)؛ از متنکاوی کلاسیک تا شبکههای عمیق، Transformerها، سیستمهای RAG و توسعه چتباتهای هوشمند.
این دوره چه مهارتهایی به شما میدهد؟
- تسلط کامل بر پیشپردازش تخصصی متون فارسی و انگلیسی (Normalization, Stemming, Lemmatization)
- توانایی پیادهسازی متدهای پیشرفته بازنمایی برداری متن (Word2Vec, FastText, GloVe)
- طراحی شبکههای عصبی عمیق برای متن (RNN, LSTM, GRU) در PyTorch و TensorFlow
- تسلط بر معماری Transformerها و کار حرفهای با اکوسیستم Hugging Face (BERT, RoBERTa, ParsBERT)
- فاینتیون (Fine-Tuning) مدلهای بزرگ زبانی (LLMs) مانند LLaMA و Mistral با تکنیکهای LoRA / QLoRA
- توسعه پروژههای چتبات سازمانی مبتنی بر RAG، پایگاههای داده برداری (Vector DBs) و فریمورکهای LangChain و LlamaIndex
سرفصلهای جامع دوره (۶ ترم / ۶۰ جلسه)
این دوره شامل ۶ ترم آموزشی کاملاً هدفمند و پروژهمحور است. هر ترم شامل ۱۰ جلسه ۱ ساعت و ۱۵ دقیقهای به همراه پروژه پایانی جامع میباشد:
ترم اول: پیشپردازش متون، متون فارسی و متنکاوی کلاسیک
جلسه ۰۱: معرفی دنیای NLP و چالشهای زبانهای طبیعی
کاربردهای NLP، معماری پروژههای متنی و بررسی چالشهای اختصاصی خط و زبان فارسی
جلسه ۰۲: نرمالسازی متون (Text Normalization)
اصلاح حروف، نیمفاصله، حذف کاراکترهای زائد و معرفی ابزارهای Hazm و Parsivar
جلسه ۰۳: توکنسازی (Tokenization) و لمتسازی
روشهای Tokenization در سطح کلمه و زیرکلمه، Stemming و Lemmatization متون
جلسه ۰۴: عبارتهای منظم (Regex) در پردازش متون
استخراج الگوهای متنی پیچیده، شمارهها، ایمیلها و پاکسازی دادههای ناخالص وب
جلسه ۰۵: بردارسازی پایه (Bag of Words & N-Grams)
مفهوم BoW، ساخت ماتریس شمارشی، مدلسازی N-Gram و محاسبه احتمالات زبانی
جلسه ۰۶: تکنیک وزندهی TF-IDF
مفاهیم Term Frequency و Inverse Document Frequency و کاربرد آن در سنجش اهمیت کلمات
جلسه ۰۷: دستهبندی متون با ماشین لرنینگ کلاسیک
الگوریتمهای Naive Bayes و SVM برای دستهبندی خبرها و متون با Scikit-Learn
جلسه ۰۸: تحلیل احساسات پایه (Sentiment Analysis)
برچسبگذاری کلمات، استفاده از Lexiconها و تشخیص پلاریته مثبت/منفی نظرات کاربران
جلسه ۰۹: ارزیابی مدلهای متنی و ماتریس درهمریختگی
معیارهای Precision, Recall, F1-Score, ROC-AUC و ارزیابی خطای مدلها
جلسه ۱۰: پروژه پایانی ترم اول
🎯 ساخت سیستم خودکار دستهبندی و تحلیل احساسات نظرات خریداران فروشگاه اینترنتی با متون فارسی
ترم دوم: بردارهای معنایی کلمات (Word Embeddings) و مدلسازی آماری
جلسه ۱۱: چالشهای ابعاد و محدودیتهای روشهای یکداغ (One-Hot)
چرا به فضای برداری پیوسته نیاز داریم؟ مفهوم تشابه معنایی در فضای چندبعدی
جلسه ۱۲: مدل Word2Vec (معماری Skip-gram)
پیشبینی کلمات همسایه، توابع هزینه و آموزش الگوریتم Skip-gram
جلسه ۱۳: مدل Word2Vec (معماری CBOW) و بهینهسازی
معماری Continuous Bag of Words و تکنیک Negative Sampling برای افزایش سرعت آموزش
جلسه ۱۴: کار با کتابخانه Gensim
بارگذاری بردارهای پیشآموزشدیده، آموزش Word2Vec روی دیتاست اختصاصی فارسی
جلسه ۱۵: بردارهای GloVe (Global Vectors)
تلفیق آمار کلی پیکره متنی با روشهای بهینهسازی محلی و مقایسه GloVe با Word2Vec
جلسه ۱۶: مدل FastText و حل مشکل کلمات خارج از واژهنامه (OOV)
استفاده از Subword Embeddings برای پشتیبانی از کلمات جدید و غلطهای املایی
جلسه ۱۷: کاهش ابعاد و بصریسازی بردارهای متنی
استفاده از تکنیکهای t-SNE و PCA برای نمایش ۳ بعدی و ۲ بعدی ارتباط کلمات
جلسه ۱۸: محاسبات ریاضی تشابه متن (Cosine Similarity)
محاسبه زاویه بردارها، فاصله اقلیدسی و جستجوی کلمات و جملات مشابه در دیتابیس
جلسه ۱۹: مدلسازی موضوعی (Topic Modeling) با LDA
کشف هوشمند موضوعات پنهان در میان میلیونها سند متنی با Latent Dirichlet Allocation
جلسه ۲۰: پروژه پایانی ترم دوم
🎯 پیادهسازی موتور پیشنهاددهنده مقالات و اخبار مشابه بر اساس تشابه برداری معنایی (FastText/Gensim)
ترم سوم: یادگیری عمیق در NLP (PyTorch, RNN, LSTM, GRU)
جلسه ۲۱: یادگیری عمیق تخصصی برای متون با PyTorch
مفاهیم Tensors، ساخت طبقات سفارشی و مدیریت GPU در شبکه عصبی PyTorch
جلسه ۲۲: لایههای Embedding در شبکههای عصبی
تفاوت لایه Embedding با بردارهای ثابت و آموزش وزنی بردارهای متنی همراه با شبکه
جلسه ۲۳: شبکههای عصبی بازگشتی (RNN)
مفهوم حافظه در توالیها، جریان داده زمانبندیشده و چالشهای پردازش متن
جلسه ۲۴: مشکل محو شدگی گرادیان (Vanishing Gradient)
چرا RNN معمولی در متون طولانی شکست میخورد؟ بررسی ریاضی و علتهای افت کارایی
جلسه ۲۵: شبکههای حافظه کوتاهمدت طولانی (LSTM)
معماری درگاهها (Input, Forget, Output Gate)، سلول حافظه و حل مشکل توالیهای بلند
جلسه ۲۶: واحدهای بازگشتی دروازهای (GRU)
سادهسازی ساختار LSTM با Update و Reset Gate و مقایسه سرعت/دقت GRU و LSTM
جلسه ۲۷: شبکههای بازگشتی دوطرفه (Bi-Directional RNNs)
خواندن متن از چپ به راست و راست به چپ برای درک بهتر بافت جملات در زبانهای مختلف
جلسه ۲۸: استخراج موجودیتهای نامدار (NER) با LSTM-CRF
شناسایی اسامی اشخاص، سازمانها و مکانها در متن با شبکههای توالی به توالی
جلسه ۲۹: مدلهای Sequence-to-Sequence (Seq2Seq)
معماری کدگذار-کدگشا (Encoder-Decoder) برای ترجمه ماشینی و خلاصه سازی
جلسه ۳۰: پروژه پایانی ترم سوم
🎯 طراحی و آموزش سیستم ترجمه خودکار متن یا چتبات پاسخگویی به سوالات با Bi-LSTM و PyTorch
ترم چهارم: مکانیزم توجه (Attention) و انقلاب Transformerها (BERT & GPT)
جلسه ۳۱: مکانیزم توجه (Attention Mechanism) چیست؟
مقاله تاریخی Bahdanau Attention و نحوه وزندهی هوشمند به کلمات کلیدی متن
جلسه ۳۲: معماری انقلابی Transformer (Attention Is All You Need)
بررسی دقیق معماری اولیه سال ۲۰۱۷، حذف شبکههای بازگشتی و پردازش کاملا موازی
جلسه ۳۳: توجه به خود چندسر (Multi-Head Self-Attention)
محاسبات ریاضی Query, Key, Value و درک ارتباط همزمان کلمات مختلف سند
جلسه ۳۴: کدگذاری موقعیتی (Positional Encoding)
تزریق اطلاعات ترتیب و موقعیت کلمات به فرمولهای ترنسفورمر با توابع سینوسی
جلسه ۳۵: خانواده مدلهای کدگذار (Encoder-Only): BERT
پیشآموزش BERT با Masked Language Modeling (MLM) و Next Sentence Prediction (NSP)
جلسه ۳۶: مدلهای بومی فارسی (ParsBERT & WikiBERT)
بررسی اکوسیستم ترنسفورمرهای فارسی و نحوه استفاده از مدلهای آماده بومی
جلسه ۳۷: اکوسیستم Hugging Face Transformers
استفاده از Pipeline ها، AutoModel، AutoTokenizer و بارگذاری هزاران مدل open-source
جلسه ۳۸: خانواده مدلهای کدگشا (Decoder-Only): GPT
مدلسازی زبانی مولد (Causal Language Modeling) و نحوه تولید کلمه به کلمه متن
جلسه ۳۹: فاینتیون (Fine-Tuning) مدل BERT بر روی دادههای سفارشی
آموزش لایههای نهایی ترنسفورمر برای وظایف تخصصی مانند تشخیص اسپم و دستهبندی پزشکی
جلسه ۴۰: پروژه پایانی ترم چهارم
🎯 فاینتیون مدل ParsBERT با Hugging Face برای سیستم تحلیل هوشمند حس متون خبری و مالی فارسی
ترم پنجم: مدلهای بزرگ زبانی (LLMs)، مهندسی پرامپت و Fine-Tuning پیشرفته
جلسه ۴۱: معماری مدلهای غولپیکر زبانی (LLMs)
تکامل مدلهای چندمیلیاردی از GPT-3 تا GPT-4، LLaMA 3، Mistral و Claude
جلسه ۴۲: مهندسی پرامپت پیشرفته (Advanced Prompt Engineering)
تکنیکهای Few-Shot, Chain-of-Thought (CoT), ReAct و بهینهسازی خروجی مدلها
جلسه ۴۳: کار با APIهای تجاری (OpenAI API, Anthropic)
مدیریت Tokenها، پارامترهای Temperature, Top-p و کنترل هزینهها در فراخوانی سرویسها
جلسه ۴۴: مدلهای متن باز (Open-Source LLMs) و اجرای محلی
اجرای مدلهای LLaMA 3 و Mistral روی سیستم شخصی و سرور اختصاصی با Ollama و vLLM
جلسه ۴۵: کوانتیزاسیون (Quantization) مدلهای بزرگ
کاهش حجم مدل از FP16 به INT8 و INT4 برای اجرا روی سختافزارهای محدود
جلسه ۴۶: تکنیکهای بهینه فاینتیون (PEFT & LoRA)
آموزش مدلهای ۷۰ میلیاردی با کمترین حافظه GPU با Low-Rank Adaptation
جلسه ۴۷: بهینهسازی QLoRA و ساخت Dataset تخصصی
آمادهسازی دادههای ساختاریافته دستورالعملی (Instruction Tuning) و فاینتیون با QLoRA
جلسه ۴۸: همراستاسازی مدل با انسان (RLHF & DPO)
یادگیری تقویتی با بازخورد انسانی و Direct Preference Optimization برای ایمنسازی چتبات
جلسه ۴۹: ارزیابی LLMها و بنچمارکهای متنی
معیارهای ROUGE, BLEU, Perplexity و سنجش دقیق خروجی مدلهای زبانی
جلسه ۵۰: پروژه پایانی ترم پنجم
🏆 فاینتیون یک مدل open-source مانند LLaMA 3 برای پاسخگویی تخصصی به حقوقی یا پزشکی به زبان فارسی
ترم ششم: معماری پیشرفته RAG، دیتابیسهای برداری و MLOps تولیدی
جلسه ۵۱: معرفی معماری تولید متکی بر بازیابی (RAG)
حل مشکل توهم مدلها (Hallucination) و اتصال مدلهای زبانی به پایگاههای دانش سازمانی
جلسه ۵۲: پایگاههای داده برداری (Vector Databases)
آموزش دیتابیسهای تخصصی ChromaDB, Qdrant, Pinecone و FAISS برای ذخیره Embeddingها
جلسه ۵۳: تکهتکهسازی متون (Text Chunking Strategies)
استراتژیهای قطعهقطعه کردن اسناد PDF و وبسایتها (Fixed-size, Semantic, Recursive)
جلسه ۵۴: فریمورک LangChain - مفاهیم پایه و زنجیرهها
مدیریت Prompts، Chains، Memory و اتصال لایههای مختلف برنامههای کاربردی AI
جلسه ۵۵: فریمورک LlamaIndex برای دیتاهای پیچیده
ساخت ایندکسهای ساختاریافته از فایلهای Excel, PDF, Notion و پایگاههای داده SQL
جلسه ۵۶: تکنیکهای RAG پیشرفته (Advanced RAG)
استفاده از Re-ranking، Query Rewriting، Hybrid Search (BM25 + Vector) برای دقت ۱۰۰٪
جلسه ۵۷: عاملهای هوشمند مستقل (AI Agents & LangGraph)
طراحی Agentهایی با قابلیت اجرای کد، جستجو در گوگل و استفاده از ابزارهای خاریجی
جلسه ۵۸: ارزیابی سیستمهای RAG با Ragas Framework
محاسبه شاخصهای Faithfulness, Answer Relevance و Context Recall در محیط واقعی
جلسه ۵۹: استقرار و سرویسدهی مدلهای NLP (LLM Ops)
توسعه API با FastAPI، داکرایز کردن پروژهها، بهینهسازی سرعت پاسخدهی و Streaming
جلسه ۶۰: پروژه نهایی و شبیهسازی مصاحبه کاری
🏆 پیادهسازی و استقرار کامل دستیار هوشمند پشتیبانی سازمانی مبتنی بر RAG + LangChain + VectorDB + Docker به همراه رزومهنویسی حرفهای
شیوه برگزاری و پشتیبانی کلاسها
این دوره به دو صورتحضوریدر فضایی کاملاً مجهز وآنلاین (زنده)برگزار میشود. همچنین هر دانشجو زیر نظر منتور اختصاصی پروژه، پشتیبانی برای رفع اشکال خواهد داشت.