دوره جامع و تخصصی بینایی ماشین (Computer Vision Masterclass)
مسیری ۶ ترمه و کاملاً حرفهای برای تبدیل شدن به متخصص بینایی ماشین؛ از پردازش تصویر دیجیتال و OpenCV تا شبکههای عصبی کانولوشنی (CNN)، الگوریتمهای YOLO، ترنسفورمرهای تصویری (ViT)، سیستمهای پردازش ویدیو و هوش مصنوعی مولد.
این دوره چه مهارتهایی به شما میدهد؟
- تسلط بر الگوریتمها و تکنیکهای بنیادی پردازش تصویر با OpenCV و NumPy
- طراحی و آموزش شبکههای عصبی پیچشی (CNN) برای کلاسبندی تصاویر در PyTorch
- پیادهسازی سیستمهای آشکارسازی و ردیابی لحظهای اشیاء با خانواده الگوریتمهای YOLO و DeepSORT
- قطعهبندی تصویر (Image Segmentation) با شبکههای U-Net و Mask R-CNN برای مصارف پزشکی و صنعتی
- تسلط بر معماریهای مدرن Vision Transformers (ViT) و مدلهای چندوجهی (Multimodal Models) مانند CLIP
- استقرار پروژههای Computer Vision روی سختافزارهای لبه (Edge AI) و بهینهسازی سرعت با TensorRT
سرفصلهای جامع دوره (۶ ترم / ۶۰ جلسه)
این دوره شامل ۶ ترم آموزشی کاملاً هدفمند و پروژهمحور است. هر ترم شامل ۱۰ جلسه ۱ ساعت و ۱۵ دقیقهای به همراه پروژه پایانی جامع میباشد:
ترم اول: مبانی پردازش تصویر دیجیتال و کار با OpenCV
جلسه ۰۱: معرفی بینایی ماشین و مفاهیم اولیه تصویر دیجیتال
ماتریس پیکسلها، کانالهای رنگی (RGB, BGR, HSV, Gray Scale) و نصب محیط OpenCV
جلسه ۰۲: عملیات پایه روی تصاویر و هندسه تصویر
تغییر اندازه، چرخش، برش (Crop)، انتقال و اعمال جابهجایی هندسی در OpenCV
جلسه ۰۳: دستکاری پیکسلها و عملیات ریاضی/منطقی
ترکیب تصاویر، ماسکگذاری (Masking)، عملیات AND/OR/XOR و تغییر کنتراست و روشنایی
جلسه ۰۴: هیستوگرام تصویر و تعدیل آن (Histogram Equalization)
تحلیل توزیع روشنایی پیکسلها و بهبود کیفیت تصاویر کمنور با CLAHE
جلسه ۰۵: فیلترگذاری و هموارسازی تصویر (Blurring & Filtering)
فیلترهای خطی و غیرخطی: Gaussian Blur, Median Blur و Bilateral Filter برای حذف نویز
جلسه ۰۶: لبهیابی و تشخیص مرزها (Edge Detection)
الگوریتمهای Sobel, Laplacian و آشکارساز لبه Canny برای استخراج ساختارهای تصویری
جلسه ۰۷: حدآستانهگذاری (Thresholding) و آستانهگذاری تطبیقی
روشهای Simple, Otsu Binarization و Adaptive Thresholding برای جداسازی پیشزمینه
جلسه ۰۸: عملیات ریختشناسی (Morphological Operations)
کاربرد عملگرهای Erosion, Dilation, Opening و Closing در پاکسازی نویزهای ماسک
جلسه ۰۹: استخراج کانتورها (Contours) و ویژگیهای هندسی
یافتن محیط، مساحت، مرکز ثقل، Bounding Box و Bounding Circle اشکال در تصویر
جلسه ۱۰: پروژه پایانی ترم اول
🎯 طراحی سیستم خودکار اسکن مدارک، تصحیح زاویه برگه و جداسازی هوشمند متون سند
ترم دوم: استخراج ویژگیهای کلاسیک، بینایی هندسی و پردازش ویدیو
جلسه ۱۱: استخراج نقاط کلیدی و توصیفگرها (Corner Detection)
الگوریتمهای Harris Corner Detection و Shi-Tomasi برای یافتن نقاط برجسته تصویر
جلسه ۱۲: توصیفگرهای کلیدی پیشرفته (SIFT & SURF)
مفهوم مقیاسپذیری و استخراج ویژگیهای مقاوم در برابر دوران و تغییر نور
جلسه ۱۳: الگوریتمهای سریع ORB و FAST
استخراج سریع ویژگیها برای کاربردهای پردازش ویدیو و سیستمهای real-time
جلسه ۱۴: تطبیق ویژگیها (Feature Matching)
روشهای Brute-Force Matcher و FLANN Matcher به همراه RANSAC برای حذف تطبیقهای نادرست
جلسه ۱۵: چسباندن تصاویر و دوخت پانوراما (Image Stitching)
محاسبه ماتریس ماتریس هموگرافی (Homography) و ساخت تصاویر عریض پانوراما
جلسه ۱۶: تبدیل هاف (Hough Transform)
تشخیص خطوط و دایرهها در تصویر؛ کاربرد در شناسایی خطوط جاده و اشیاء هندسی
جلسه ۱۷: پردازش ویدیو و تحلیل فریمها
مدیریت فریمهای ویدیو، ذخیرهسازی، تفریق پسزمینه (Background Subtraction) و تفکیک متحرکها
جلسه ۱۸: ردیابی حرکت با جریان نوری (Optical Flow)
الگوریتمهای Lucas-Kanade و Farneback برای تحلیل بردار حرکت اشیاء در ویدیو
جلسه ۱۹: آشکارسازی کلاسیک اشیاء با کسکیدها (Haar Cascades)
شناسایی چهره و چشم با Haar Cascadeها و بررسی نقاط ضعف و قوت روشهای کلاسیک
جلسه ۲۰: پروژه پایانی ترم دوم
🎯 ساخت سیستم شمارش خودروهای عبوری در جاده و تشخیص انحراف از بین خطوط با ترکیب Hough و Optical Flow
ترم سوم: یادگیری عمیق در بینایی ماشین (PyTorch & CNNs)
جلسه ۲۱: ورود به Deep Learning برای تصاویر با PyTorch
بارگذاری دیتاستهای تصویری، ساخت Dataset و DataLoader سفارشی و پیکربندی GPU
جلسه ۲۲: معماری شبکههای عصبی کانولوشنی (CNN)
مفاهیم لایه کانولوشن (Convolution Layer)، فیلترها، Stride و Padding
جلسه ۲۳: لایههای کاهش ابعاد (Pooling) و لایههای متراکم
بررسی Max Pooling, Average Pooling، Flattening و جلوگیری از بیشبرازش با Dropout
جلسه ۲۴: آموزش نخستین شبکه CNN اختصاصی
تعریف تابع زیان (Loss Function)، بهینهسازها (Adam/SGD) و چرخه آموزش و ارزیابی
جلسه ۲۵: افزایش دادههای تصویری (Data Augmentation)
تکنیکهای چرخش، تغییر نور، برش تصادفی و استفاده از کتابخانه قدرتمند Albumentations
جلسه ۲۶: معماریهای کلاسیک عمیق (LeNet, AlexNet, VGG)
بررسی سیر تکامل شبکههای عمیق تصویری و تحلیل نقش عمیقتر شدن شبکهها
جلسه ۲۷: شبکههای با اتصالات باقیمانده (ResNet) و Inception
مفهوم Skip Connections برای حل مشکل نابودی گرادیان در شبکههای بسیار عمیق
جلسه ۲۸: انتقال یادگیری (Transfer Learning) و Fine-Tuning
استفاده از وزنهای پیشآموزشدیده ImageNet و تنظیم دقیق لایهها برای دیتای سفارشی
جلسه ۲۹: بصریسازی تصمیمات شبکه (Grad-CAM)
تفسیرپذیری شبکهها و مشاهده مناطقی از تصویر که شبکه بر اساس آنها تصمیمگیری کرده است
جلسه ۳۰: پروژه پایانی ترم سوم
🎯 پیادهسازی سیستم هوشمند تشخیص بیماریهای گیاهی یا رادیولوژی پزشکی با ResNet و تکنیک Transfer Learning
ترم چهارم: تشخیص اشیاء (Object Detection) و قطعهبندی (Segmentation)
جلسه ۳۱: مفاهیم بنیادی Object Detection
Bounding Boxes، معیارهای IoU (Intersection over Union) و Non-Maximum Suppression (NMS)
جلسه ۳۲: آشکارسازهای دو مرحلهای (R-CNN, Fast R-CNN, Faster R-CNN)
شبکههای پیشنهاد منطقه (RPN) و نحوه کار آشکارسازهای دقیق دو مرحلهای
جلسه ۳۳: آشکارسازهای تک مرحلهای (SSD & YOLO)
چرا به مدلهای تک مرحلهای نیاز داریم؟ معماری و نحوه عملکرد سری اول YOLO
جلسه ۳۴: تسلط بر YOLOv8 / YOLOv11 و فریمورک Ultralytics
ساخت دیتاست اختصاصی با فرمت YOLO، برچسبگذاری و آموزش مدل روی دادههای سفارشی
جلسه ۳۵: ردیابی چند جسمی در ویدیو (Multi-Object Tracking)
ترکیب تشخیص اشیاء با الگوریتمهای ردیابی SORT, DeepSORT و ByteTRACK
جلسه ۳۶: قطعهبندی معنایی (Semantic Segmentation) و شبکه U-Net
پیشبینی بایتبهبایت پیکسلها، معماری Encoder-Decoder U-Net برای تصاویر پزشکی و صنعتی
جلسه ۳۷: قطعهبندی نمونهای (Instance Segmentation)
تفکیک اشیاء همنوع از یکدیگر با معماری Mask R-CNN و YOLO-Seg
جلسه ۳۸: تخمین وضعیت بدن (Pose Estimation)
شناسایی مفاصل و نقاط کلیدی بدن انسان با MediaPipe و YOLO-Pose
جلسه ۳۹: بازشناسایی چهره و ویژگیهای بیومتریک (Face Recognition)
استخراج Embedding چهره با ArcFace / FaceNet و سنجش تشابه با دیتابیس
جلسه ۴۰: پروژه پایانی ترم چهارم
🎯 ساخت سیستم هوشمند کنترل کیفیت خط تولید صنعتی به همراه ردیابی خودکار و قطعهبندی قطعات معیوب
ترم پنجم: Vision Transformers، مدلهای چندوجهی و 3D Vision
جلسه ۴۱: ورود ترنسفورمرها به دنیای تصویر (Vision Transformers - ViT)
نحوه تبدیل Patchهای تصویری به Token و مقایسه ViT با شبکههای کانولوشنی سنتی
جلسه ۴۲: معماریهای پیشرفته ترنسفورمری (Swin Transformer & DeiT)
پنجرههای متحرک برای پردازش بهینه تصاویر با ابعاد بزرگ و دقت بالا
جلسه ۴۳: مدلهای قطعهبندی همهمنظوره (Segment Anything Model - SAM)
کار با مدل انقلابی SAM محصول Meta برای قطعهبندی تعاملی هر نوع تصویر بدون آموزش مجدد
جلسه ۴۴: مدلهای چندوجهی تصویر و متن (CLIP)
اتصال متن و تصویر، Zero-Shot Image Classification و جستجوی تصویری بر اساس توضیحات متنی
جلسه ۴۵: توصیفگری تصویر (Image Captioning)
ترکیب CNN/ViT با مدلهای متنی برای تولید خودکار شرح تصویر و توضیحات تصویری
جلسه ۴۶: پرسش و پاسخ تصویری (Visual Question Answering - VQA)
پاسخ به سوالات متنی کاربران در مورد جزئیات و محتوای موجود درون یک تصویر
جلسه ۴۷: بینایی سه بعدی (3D Computer Vision) و ابر نقاط (Point Clouds)
درک عمق (Depth Estimation)، پردازش دادههای LiDAR و کار با ابر نقاط سه بعدی
جلسه ۴۸: بازسازی سه بعدی (3D Reconstruction & NeRF)
معرفی Neural Radiance Fields برای بازسازی فضاهای ۳ بعدی واقعی از روی چند عکس ۲ بعدی
جلسه ۴۹: ارزیابی مدلهای بینایی ماشین در سناریوهای پیچیده
ارزیابی نویز، شرایط نوری سخت، افت فریم و سنجش پایداری مدلهای مدرن
جلسه ۵۰: پروژه پایانی ترم پنجم
🏆 طراحی موتور جستجوی تصویری هوشمند بر پایه CLIP به همراه قطعهبندی خودکار با SAM
ترم ششم: هوش مصنوعی مولد تصویر (Generative AI) و CVOps/Edge Deployment
جلسه ۵۱: شبکههای مولد متخاصم (GANs)
معماری Generator و Discriminator، شبکههای DCGAN و چالشهای آموزش GANها
جلسه ۵۲: تبدیل تصویر به تصویر (CycleGAN & Pix2Pix)
تغییر سبک تصاویر، تبدیل عکس روز به شب و افزایش کیفیت تصاویر رزولوشن پایین (Super Resolution)
جلسه ۵۳: مدلهای انتشار (Diffusion Models)
مبانی ریاضی فرایند نویزدهی و بازسازی در Stable Diffusion و Midjourney
جلسه ۵۴: کنترل دقیق تولید تصویر (ControlNet & LoRA)
هدایت تولید تصاویر با استفاده از لبهها، ژستهای حرکتی و نقشه عمق
جلسه ۵۵: فشردهسازی و فشردهسازی مدلها برای اجرا روی Edge
تکنیکهای Pruning, Quantization و Knowledge Distillation برای کاهش حجم مدلها
جلسه ۵۶: بهینهسازی مدلها با ONNX و TensorRT
تبدیل مدلهای PyTorch به فرمت ONNX و افزایش چندین برابری سرعت اجرا روی کارتهای گرافیک Nvidia
جلسه ۵۷: استقرار بینایی ماشین روی پردازندههای لبه (Raspberry Pi & Jetson Nano)
تنظیم و اجرای مدلهای سبک بینایی ماشین روی بوردهای سختافزاری نهفته (Embedded AI)
جلسه ۵۸: استریم ویدیو با لیتنسی پایین (RTSP Streaming & WebRTC)
اتصال مدلهای بینایی ماشین به دوربینهای مداربسته IP Camera و مدیریت پردازش موازی
جلسه ۵۹: ساخت API تولیدی بینایی ماشین با FastAPI و Docker
سرویسدهی سیستمهای پردازش تصویر در قالب Microservice داکرایز شده با قابلیت مقیاسپذیری
جلسه ۶۰: پروژه نهایی و شبیهسازی مصاحبه کاری
🏆 استقرار یک سیستم کامل نظارت تصویری هوشمند و پردازش ویدیوهای جریان زنده روی داکر با قابلیت ارسال هشدار لحظهای
شیوه برگزاری و پشتیبانی کلاسها
این دوره به دو صورتحضوریدر فضایی کاملاً مجهز وآنلاین (زنده)برگزار میشود. همچنین هر دانشجو زیر نظر منتور اختصاصی پروژه، پشتیبانی برای رفع اشکال خواهد داشت.