دوره جامع و تخصصی بینایی ماشین (Computer Vision Masterclass)

مسیری ۶ ترمه و کاملاً حرفه‌ای برای تبدیل شدن به متخصص بینایی ماشین؛ از پردازش تصویر دیجیتال و OpenCV تا شبکه‌های عصبی کانولوشنی (CNN)، الگوریتم‌های YOLO، ترنسفورمرهای تصویری (ViT)، سیستم‌های پردازش ویدیو و هوش مصنوعی مولد.

این دوره چه مهارت‌هایی به شما می‌دهد؟

  • تسلط بر الگوریتم‌ها و تکنیک‌های بنیادی پردازش تصویر با OpenCV و NumPy
  • طراحی و آموزش شبکه‌های عصبی پیچشی (CNN) برای کلاس‌بندی تصاویر در PyTorch
  • پیاده‌سازی سیستم‌های آشکارسازی و ردیابی لحظه‌ای اشیاء با خانواده الگوریتم‌های YOLO و DeepSORT
  • قطعه‌بندی تصویر (Image Segmentation) با شبکه‌های U-Net و Mask R-CNN برای مصارف پزشکی و صنعتی
  • تسلط بر معماری‌های مدرن Vision Transformers (ViT) و مدل‌های چندوجهی (Multimodal Models) مانند CLIP
  • استقرار پروژه‌های Computer Vision روی سخت‌افزارهای لبه (Edge AI) و بهینه‌سازی سرعت با TensorRT

سرفصل‌های جامع دوره (۶ ترم / ۶۰ جلسه)

این دوره شامل ۶ ترم آموزشی کاملاً هدفمند و پروژه‌محور است. هر ترم شامل ۱۰ جلسه ۱ ساعت و ۱۵ دقیقه‌ای به همراه پروژه پایانی جامع می‌باشد:

ترم اول: مبانی پردازش تصویر دیجیتال و کار با OpenCV

جلسه ۰۱: معرفی بینایی ماشین و مفاهیم اولیه تصویر دیجیتال ماتریس پیکسل‌ها، کانال‌های رنگی (RGB, BGR, HSV, Gray Scale) و نصب محیط OpenCV
جلسه ۰۲: عملیات پایه روی تصاویر و هندسه تصویر تغییر اندازه‌، چرخش، برش (Crop)، انتقال و اعمال جابه‌جایی هندسی در OpenCV
جلسه ۰۳: دستکاری پیکسل‌ها و عملیات ریاضی/منطقی ترکیب تصاویر، ماسک‌گذاری (Masking)، عملیات AND/OR/XOR و تغییر کنتراست و روشنایی
جلسه ۰۴: هیستوگرام تصویر و تعدیل آن (Histogram Equalization) تحلیل توزیع روشنایی پیکسل‌ها و بهبود کیفیت تصاویر کم‌نور با CLAHE
جلسه ۰۵: فیلترگذاری و هموارسازی تصویر (Blurring & Filtering) فیلترهای خطی و غیرخطی: Gaussian Blur, Median Blur و Bilateral Filter برای حذف نویز
جلسه ۰۶: لبه‌یابی و تشخیص مرزها (Edge Detection) الگوریتم‌های Sobel, Laplacian و آشکارساز لبه Canny برای استخراج ساختارهای تصویری
جلسه ۰۷: حدآستانه‌گذاری (Thresholding) و آستانه‌گذاری تطبیقی روش‌های Simple, Otsu Binarization و Adaptive Thresholding برای جداسازی پیش‌زمینه
جلسه ۰۸: عملیات ریخت‌شناسی (Morphological Operations) کاربرد عملگرهای Erosion, Dilation, Opening و Closing در پاک‌سازی نویزهای ماسک
جلسه ۰۹: استخراج کانتورها (Contours) و ویژگی‌های هندسی یافتن محیط، مساحت، مرکز ثقل، Bounding Box و Bounding Circle اشکال در تصویر
جلسه ۱۰: پروژه پایانی ترم اول 🎯 طراحی سیستم خودکار اسکن مدارک، تصحیح زاویه برگه و جداسازی هوشمند متون سند

ترم دوم: استخراج ویژگی‌های کلاسیک، بینایی هندسی و پردازش ویدیو

جلسه ۱۱: استخراج نقاط کلیدی و توصیف‌گرها (Corner Detection) الگوریتم‌های Harris Corner Detection و Shi-Tomasi برای یافتن نقاط برجسته تصویر
جلسه ۱۲: توصیف‌گرهای کلیدی پیشرفته (SIFT & SURF) مفهوم مقیاس‌پذیری و استخراج ویژگی‌های مقاوم در برابر دوران و تغییر نور
جلسه ۱۳: الگوریتم‌های سریع ORB و FAST استخراج سریع ویژگی‌ها برای کاربردهای پردازش ویدیو و سیستم‌های real-time
جلسه ۱۴: تطبیق ویژگی‌ها (Feature Matching) روش‌های Brute-Force Matcher و FLANN Matcher به همراه RANSAC برای حذف تطبیق‌های نادرست
جلسه ۱۵: چسباندن تصاویر و دوخت پانوراما (Image Stitching) محاسبه ماتریس ماتریس هموگرافی (Homography) و ساخت تصاویر عریض پانوراما
جلسه ۱۶: تبدیل هاف (Hough Transform) تشخیص خطوط و دایره‌ها در تصویر؛ کاربرد در شناسایی خطوط جاده و اشیاء هندسی
جلسه ۱۷: پردازش ویدیو و تحلیل فریم‌ها مدیریت فریم‌های ویدیو، ذخیره‌سازی، تفریق پس‌زمینه (Background Subtraction) و تفکیک متحرک‌ها
جلسه ۱۸: ردیابی حرکت با جریان نوری (Optical Flow) الگوریتم‌های Lucas-Kanade و Farneback برای تحلیل بردار حرکت اشیاء در ویدیو
جلسه ۱۹: آشکارسازی کلاسیک اشیاء با کسکیدها (Haar Cascades) شناسایی چهره و چشم با Haar Cascadeها و بررسی نقاط ضعف و قوت روش‌های کلاسیک
جلسه ۲۰: پروژه پایانی ترم دوم 🎯 ساخت سیستم شمارش خودروهای عبوری در جاده و تشخیص انحراف از بین خطوط با ترکیب Hough و Optical Flow

ترم سوم: یادگیری عمیق در بینایی ماشین (PyTorch & CNNs)

جلسه ۲۱: ورود به Deep Learning برای تصاویر با PyTorch بارگذاری دیتاست‌های تصویری، ساخت Dataset و DataLoader سفارشی و پیکربندی GPU
جلسه ۲۲: معماری شبکه‌های عصبی کانولوشنی (CNN) مفاهیم لایه کانولوشن (Convolution Layer)، فیلترها، Stride و Padding
جلسه ۲۳: لایه‌های کاهش ابعاد (Pooling) و لایه‌های متراکم بررسی Max Pooling, Average Pooling، Flattening و جلوگیری از بیش‌برازش با Dropout
جلسه ۲۴: آموزش نخستین شبکه CNN اختصاصی تعریف تابع زیان (Loss Function)، بهینه‌سازها (Adam/SGD) و چرخه آموزش و ارزیابی
جلسه ۲۵: افزایش داده‌های تصویری (Data Augmentation) تکنیک‌های چرخش، تغییر نور، برش تصادفی و استفاده از کتابخانه قدرتمند Albumentations
جلسه ۲۶: معماری‌های کلاسیک عمیق (LeNet, AlexNet, VGG) بررسی سیر تکامل شبکه‌های عمیق تصویری و تحلیل نقش عمیق‌تر شدن شبکه‌ها
جلسه ۲۷: شبکه‌های با اتصالات باقیمانده (ResNet) و Inception مفهوم Skip Connections برای حل مشکل نابودی گرادیان در شبکه‌های بسیار عمیق
جلسه ۲۸: انتقال یادگیری (Transfer Learning) و Fine-Tuning استفاده از وزن‌های پیش‌آموزش‌دیده ImageNet و تنظیم دقیق لایه‌ها برای دیتای سفارشی
جلسه ۲۹: بصری‌سازی تصمیمات شبکه (Grad-CAM) تفسیرپذیری شبکه‌ها و مشاهده مناطقی از تصویر که شبکه بر اساس آن‌ها تصمیم‌گیری کرده است
جلسه ۳۰: پروژه پایانی ترم سوم 🎯 پیاده‌سازی سیستم هوشمند تشخیص بیماری‌های گیاهی یا رادیولوژی پزشکی با ResNet و تکنیک Transfer Learning

ترم چهارم: تشخیص اشیاء (Object Detection) و قطعه‌بندی (Segmentation)

جلسه ۳۱: مفاهیم بنیادی Object Detection Bounding Boxes، معیارهای IoU (Intersection over Union) و Non-Maximum Suppression (NMS)
جلسه ۳۲: آشکارسازهای دو مرحله‌ای (R-CNN, Fast R-CNN, Faster R-CNN) شبکه‌های پیشنهاد منطقه (RPN) و نحوه کار آشکارسازهای دقیق دو مرحله‌ای
جلسه ۳۳: آشکارسازهای تک مرحله‌ای (SSD & YOLO) چرا به مدل‌های تک مرحله‌ای نیاز داریم؟ معماری و نحوه عملکرد سری اول YOLO
جلسه ۳۴: تسلط بر YOLOv8 / YOLOv11 و فریم‌ورک Ultralytics ساخت دیتاست اختصاصی با فرمت YOLO، برچسب‌گذاری و آموزش مدل روی داده‌های سفارشی
جلسه ۳۵: ردیابی چند جسمی در ویدیو (Multi-Object Tracking) ترکیب تشخیص اشیاء با الگوریتم‌های ردیابی SORT, DeepSORT و ByteTRACK
جلسه ۳۶: قطعه‌بندی معنایی (Semantic Segmentation) و شبکه U-Net پیش‌بینی بایت‌به‌بایت پیکسل‌ها، معماری Encoder-Decoder U-Net برای تصاویر پزشکی و صنعتی
جلسه ۳۷: قطعه‌بندی نمونه‌ای (Instance Segmentation) تفکیک اشیاء هم‌نوع از یکدیگر با معماری Mask R-CNN و YOLO-Seg
جلسه ۳۸: تخمین وضعیت بدن (Pose Estimation) شناسایی مفاصل و نقاط کلیدی بدن انسان با MediaPipe و YOLO-Pose
جلسه ۳۹: بازشناسایی چهره و ویژگی‌های بیومتریک (Face Recognition) استخراج Embedding چهره با ArcFace / FaceNet و سنجش تشابه با دیتابیس
جلسه ۴۰: پروژه پایانی ترم چهارم 🎯 ساخت سیستم هوشمند کنترل کیفیت خط تولید صنعتی به همراه ردیابی خودکار و قطعه‌بندی قطعات معیوب

ترم پنجم: Vision Transformers، مدل‌های چندوجهی و 3D Vision

جلسه ۴۱: ورود ترنسفورمرها به دنیای تصویر (Vision Transformers - ViT) نحوه تبدیل Patchهای تصویری به Token و مقایسه ViT با شبکه‌های کانولوشنی سنتی
جلسه ۴۲: معماری‌های پیشرفته ترنسفورمری (Swin Transformer & DeiT) پنجره‌های متحرک برای پردازش بهینه تصاویر با ابعاد بزرگ و دقت بالا
جلسه ۴۳: مدل‌های قطعه‌بندی همه‌منظوره (Segment Anything Model - SAM) کار با مدل انقلابی SAM محصول Meta برای قطعه‌بندی تعاملی هر نوع تصویر بدون آموزش مجدد
جلسه ۴۴: مدل‌های چندوجهی تصویر و متن (CLIP) اتصال متن و تصویر، Zero-Shot Image Classification و جستجوی تصویری بر اساس توضیحات متنی
جلسه ۴۵: توصیف‌گری تصویر (Image Captioning) ترکیب CNN/ViT با مدل‌های متنی برای تولید خودکار شرح تصویر و توضیحات تصویری
جلسه ۴۶: پرسش و پاسخ تصویری (Visual Question Answering - VQA) پاسخ به سوالات متنی کاربران در مورد جزئیات و محتوای موجود درون یک تصویر
جلسه ۴۷: بینایی سه بعدی (3D Computer Vision) و ابر نقاط (Point Clouds) درک عمق (Depth Estimation)، پردازش داده‌های LiDAR و کار با ابر نقاط سه بعدی
جلسه ۴۸: بازسازی سه بعدی (3D Reconstruction & NeRF) معرفی Neural Radiance Fields برای بازسازی فضاهای ۳ بعدی واقعی از روی چند عکس ۲ بعدی
جلسه ۴۹: ارزیابی مدل‌های بینایی ماشین در سناریوهای پیچیده ارزیابی نویز، شرایط نوری سخت، افت فریم و سنجش پایداری مدل‌های مدرن
جلسه ۵۰: پروژه پایانی ترم پنجم 🏆 طراحی موتور جستجوی تصویری هوشمند بر پایه CLIP به همراه قطعه‌بندی خودکار با SAM

ترم ششم: هوش مصنوعی مولد تصویر (Generative AI) و CVOps/Edge Deployment

جلسه ۵۱: شبکه‌های مولد متخاصم (GANs) معماری Generator و Discriminator، شبکه‌های DCGAN و چالش‌های آموزش GANها
جلسه ۵۲: تبدیل تصویر به تصویر (CycleGAN & Pix2Pix) تغییر سبک تصاویر، تبدیل عکس روز به شب و افزایش کیفیت تصاویر رزولوشن پایین (Super Resolution)
جلسه ۵۳: مدل‌های انتشار (Diffusion Models) مبانی ریاضی فرایند نویزدهی و بازسازی در Stable Diffusion و Midjourney
جلسه ۵۴: کنترل دقیق تولید تصویر (ControlNet & LoRA) هدایت تولید تصاویر با استفاده از لبه‌ها، ژست‌های حرکتی و نقشه عمق
جلسه ۵۵: فشرده‌سازی و فشرده‌سازی مدل‌ها برای اجرا روی Edge تکنیک‌های Pruning, Quantization و Knowledge Distillation برای کاهش حجم مدل‌ها
جلسه ۵۶: بهینه‌سازی مدل‌ها با ONNX و TensorRT تبدیل مدل‌های PyTorch به فرمت ONNX و افزایش چندین برابری سرعت اجرا روی کارت‌های گرافیک Nvidia
جلسه ۵۷: استقرار بینایی ماشین روی پردازنده‌های لبه (Raspberry Pi & Jetson Nano) تنظیم و اجرای مدل‌های سبک بینایی ماشین روی بورد‌های سخت‌افزاری نهفته (Embedded AI)
جلسه ۵۸: استریم ویدیو با لیتنسی پایین (RTSP Streaming & WebRTC) اتصال مدل‌های بینایی ماشین به دوربین‌های مداربسته IP Camera و مدیریت پردازش موازی
جلسه ۵۹: ساخت API تولیدی بینایی ماشین با FastAPI و Docker سرویس‌دهی سیستم‌های پردازش تصویر در قالب Microservice داکرایز شده با قابلیت مقیاس‌پذیری
جلسه ۶۰: پروژه نهایی و شبیه‌سازی مصاحبه کاری 🏆 استقرار یک سیستم کامل نظارت تصویری هوشمند و پردازش ویدیوهای جریان زنده روی داکر با قابلیت ارسال هشدار لحظه‌ای

شیوه برگزاری و پشتیبانی کلاس‌ها

این دوره به دو صورتحضوریدر فضایی کاملاً مجهز وآنلاین (زنده)برگزار می‌شود. همچنین هر دانشجو زیر نظر منتور اختصاصی پروژه، پشتیبانی برای رفع اشکال خواهد داشت.