ساخت برنامه تشخیص اشیاء با پایتون: پروژهای خلاقانه و کاربردی
تشخیص اشیاء یکی از جذابترین و پرکاربردترین حوزههای یادگیری ماشین و بینایی کامپیوتر است. این فناوری به کامپیوترها امکان میدهد تا اشیاء موجود در تصاویر و ویدئوها را شناسایی و طبقهبندی کنند. در این مقاله، به آموزش گام به گام ساخت یک برنامه تشخیص اشیاء با استفاده از پایتون میپردازیم. این پروژه در دسته پروژههای خلاقانه و کاربردی قرار میگیرد و میتواند پایهای برای پروژههای پیچیدهتر باشد.
پیشنیازها
قبل از شروع، اطمینان حاصل کنید که پیشنیازهای زیر را دارید:
- پایتون: نسخه 3.6 یا بالاتر
- کتابخانههای پایتون:
- OpenCV: برای پردازش تصویر و ویدئو
- TensorFlow یا PyTorch: برای ساخت و آموزش مدل یادگیری ماشین
- NumPy: برای محاسبات عددی
- Matplotlib: برای نمایش تصاویر و نمودارها
- مجموعه داده: مجموعهای از تصاویر که اشیاء مورد نظر در آنها برچسبگذاری شدهاند.
نصب کتابخانهها را میتوان با استفاده از pip انجام داد:
pip install opencv-python tensorflow numpy matplotlib
مراحل ساخت برنامه تشخیص اشیاء
1. جمعآوری و آمادهسازی مجموعه داده
اولین قدم، جمعآوری یک مجموعه داده مناسب است. این مجموعه داده باید شامل تصاویری باشد که اشیاء مورد نظر در آنها وجود داشته باشند. همچنین، هر شیء در تصویر باید با یک برچسب (label) مشخص شود. برچسبها میتوانند به صورت دستی یا با استفاده از ابزارهای برچسبگذاری خودکار ایجاد شوند. فرمت رایج برای ذخیره برچسبها، فرمت XML یا JSON است که مختصات جعبه محدودکننده (bounding box) هر شیء را در تصویر مشخص میکند.
مجموعه داده را به دو بخش آموزش (training) و آزمایش (testing) تقسیم کنید. معمولاً 80% از دادهها برای آموزش و 20% برای آزمایش استفاده میشود. اطمینان حاصل کنید که مجموعه داده آموزشی تنوع کافی را داشته باشد تا مدل بتواند به خوبی تعمیم یابد.
2. انتخاب و بارگیری مدل از پیش آموزشدیده
به جای آموزش یک مدل از ابتدا، میتوان از یک مدل از پیش آموزشدیده (pre-trained model) استفاده کرد. این مدلها بر روی مجموعههای داده بزرگ مانند ImageNet آموزش داده شدهاند و میتوانند به عنوان نقطه شروع خوبی برای تشخیص اشیاء عمل کنند. مدلهای محبوب از پیش آموزشدیده شامل SSD MobileNet، Faster R-CNN و YOLO هستند.
TensorFlow Hub و PyTorch Hub منابع خوبی برای یافتن و بارگیری مدلهای از پیش آموزشدیده هستند. برای مثال، در TensorFlow میتوانید از کد زیر برای بارگیری مدل SSD MobileNet استفاده کنید:
import tensorflow as tf import tensorflow_hub as hub module_handle = "https://tfhub.dev/google/openimages_v4/ssd/mobilenet_v2/1" detector = hub.load(module_handle).signatures['default']
3. آموزش مدل (Fine-tuning)
اگر مجموعه داده شما با مجموعه دادهای که مدل از پیش آموزشدیده بر روی آن آموزش داده شده است، تفاوت زیادی دارد، ممکن است نیاز به آموزش بیشتر مدل (fine-tuning) داشته باشید. این کار شامل آموزش مدل بر روی مجموعه داده خودتان با استفاده از یک نرخ یادگیری (learning rate) پایینتر است. هدف از fine-tuning، تنظیم وزنهای مدل برای بهبود عملکرد آن بر روی مجموعه داده خاص شما است.
در TensorFlow، میتوانید از API Keras برای fine-tuning مدل استفاده کنید. برای این کار، باید لایههای آخر مدل را با لایههای جدیدی که برای تشخیص اشیاء مورد نظر شما طراحی شدهاند، جایگزین کنید. سپس، مدل را با استفاده از مجموعه داده آموزشی خودتان آموزش دهید.
4. پیادهسازی تشخیص اشیاء در تصاویر و ویدئوها
پس از آموزش مدل، میتوانید از آن برای تشخیص اشیاء در تصاویر و ویدئوها استفاده کنید. برای این کار، ابتدا تصویر یا ویدئو را بارگیری کنید. سپس، تصویر را به مدل ورودی دهید و خروجی مدل را دریافت کنید. خروجی مدل شامل مختصات جعبه محدودکننده و احتمال (confidence score) برای هر شیء شناسایی شده است.
برای نمایش نتایج، میتوانید جعبههای محدودکننده را بر روی تصویر رسم کنید و احتمال هر شیء را در کنار آن نمایش دهید. در OpenCV، میتوانید از توابع `cv2.rectangle` و `cv2.putText` برای رسم جعبهها و متن استفاده کنید.
برای تشخیص اشیاء در ویدئوها، میتوانید هر فریم از ویدئو را به مدل ورودی دهید و نتایج را به صورت real-time نمایش دهید.
5. ارزیابی عملکرد مدل
پس از پیادهسازی تشخیص اشیاء، باید عملکرد مدل را ارزیابی کنید. برای این کار، از مجموعه داده آزمایش استفاده کنید. معیارهای ارزیابی رایج شامل دقت (precision)، فراخوانی (recall) و میانگین دقت متوسط (mAP) هستند.
دقت نشان میدهد که چه نسبتی از اشیاء شناسایی شده توسط مدل، واقعاً اشیاء مورد نظر هستند. فراخوانی نشان میدهد که چه نسبتی از اشیاء مورد نظر در تصویر، توسط مدل شناسایی شدهاند. mAP یک معیار کلی است که دقت و فراخوانی را با هم ترکیب میکند.
اگر عملکرد مدل رضایتبخش نیست، میتوانید با تنظیم پارامترهای مدل، تغییر مجموعه داده آموزشی یا استفاده از یک مدل متفاوت، عملکرد آن را بهبود بخشید.
مثال ساده با OpenCV و یک مدل از پیش آموزشدیده (YOLO)
این مثال یک نمای کلی از نحوه استفاده از OpenCV و یک مدل YOLO از پیش آموزشدیده برای تشخیص اشیاء ارائه میدهد. توجه داشته باشید که این یک مثال ساده است و ممکن است نیاز به تنظیمات بیشتری برای دستیابی به نتایج مطلوب داشته باشد.
import cv2
# بارگیری مدل YOLO از پیش آموزشدیده
net = cv2.dnn.readNet("yolov3.weights", "yolov3.cfg")
# بارگیری لیست نام کلاسها
classes = []
with open("coco.names", "r") as f:
classes = [line.strip() for line in f.readlines()]
# تنظیم ورودی شبکه
layer_names = net.getLayerNames()
output_layers = [layer_names[i[0] - 1] for i in net.getUnconnectedOutLayers()]
# بارگیری تصویر
img = cv2.imread("image.jpg")
height, width, channels = img.shape
# ایجاد blob از تصویر
blob = cv2.dnn.blobFromImage(img, 0.00392, (416, 416), (0, 0, 0), True, crop=False)
# تنظیم ورودی شبکه
net.setInput(blob)
# انجام پیشبینی
outs = net.forward(output_layers)
# پردازش خروجی
class_ids = []
confidences = []
boxes = []
for out in outs:
for detection in out:
scores = detection[5:]
class_id = np.argmax(scores)
confidence = scores[class_id]
if confidence > 0.5:
center_x = int(detection[0] * width)
center_y = int(detection[1] * height)
w = int(detection[2] * width)
h = int(detection[3] * height)
x = int(center_x - w / 2)
y = int(center_y - h / 2)
boxes.append([x, y, w, h])
confidences.append(float(confidence))
class_ids.append(class_id)
# حذف جعبههای تکراری
indexes = cv2.dnn.NMSBoxes(boxes, confidences, 0.5, 0.4)
# رسم جعبههای محدودکننده و برچسبها
font = cv2.FONT_HERSHEY_PLAIN
for i in indexes.flatten():
x, y, w, h = boxes[i]
label = str(classes[class_ids[i]])
confidence = str(round(confidences[i], 2))
color = (0, 255, 0)
cv2.rectangle(img, (x, y), (x + w, y + h), color, 2)
cv2.putText(img, label + " " + confidence, (x, y + 20), font, 2, color, 2)
# نمایش تصویر
cv2.imshow("Object Detection", img)
cv2.waitKey(0)
cv2.destroyAllWindows()
این مثال از مدل YOLOv3 استفاده میکند. شما باید فایلهای `yolov3.weights`، `yolov3.cfg` و `coco.names` را دانلود کنید و در کنار اسکریپت پایتون خود قرار دهید. همچنین، باید یک تصویر به نام `image.jpg` را در کنار اسکریپت خود قرار دهید.
نتیجهگیری
ساخت برنامه تشخیص اشیاء با پایتون یک پروژه جذاب و کاربردی است که میتواند در زمینههای مختلفی مانند رباتیک، خودروهای خودران، نظارت تصویری و پزشکی مورد استفاده قرار گیرد. با استفاده از کتابخانههای پایتون و مدلهای از پیش آموزشدیده، میتوانید به راحتی یک برنامه تشخیص اشیاء بسازید و آن را برای نیازهای خاص خود سفارشی کنید.

بدون دیدگاه