اکنون هر شهر بزرگی با ویدیو اداره می‌شود. تقاطع‌های ترافیکی، سکوهای مترو، پارک‌های عمومی و مناطق تجاری، تصاویر مداومی را به اتاق‌های کنترل شهرداری ارسال می‌کنند. حجم خام این داده‌ها خیره‌کننده است. بدون تفسیر، این فریم‌ها صرفاً فایل‌های پرهزینه‌ای هستند که فضای سرور را اشغال می‌کنند. یادگیری عمیق معادله را تغییر داده است. این فناوری به سیستم‌های شهری توانایی مشاهده، درک و واکنش به رویدادها در حین وقوع را می‌دهد و ضبط‌های غیرفعال را به زیرساخت‌های فعال تبدیل می‌کند.

از پیکسل‌ها تا تصمیم‌گیری‌ها

بینایی ماشین سنتی بر قوانین دستی متکی بود. مهندسان سیستم‌ها را برای جستجوی اشکال، رنگ‌ها یا الگوهای حرکتی خاص برنامه‌ریزی می‌کردند. این روش‌ها در آزمایشگاه‌های کنترل‌شده کار می‌کردند، اما شهرها پر از آشفتگی هستند. سایه‌ها جابه‌جا می‌شوند. باران لنزها را کدر می‌کند. عابران پیاده زیر چترهایی پناه می‌گیرند که هیچ شباهتی به نمودارهای آموزشی ندارند. سیستم‌های مبتنی بر قانون مدام شکست می‌خوردند و اپراتورها را در سیل از موارد مثبت کاذب غرق می‌کردند.

یادگیری عمیق با رویکرد متفاوتی به این مسئله می‌نگرد. شبکه‌های عصبی پیچشی (Convolutional neural networks) و مشتقات آن‌ها، ویژگی‌ها را مستقیماً از داده‌ها یاد می‌گیرند. مهندسان به جای اینکه به کامپیوتر بگویند یک دوچرخه چه شکلی است، میلیون‌ها نمونه برچسب‌گذاری شده را به آن می‌دهند تا مدل مفهوم درونی خود را از یک دوچرخه بسازد. نتیجه، سیستمی است که تغییرات دنیای واقعی را بدون از کار افتادن مدیریت می‌کند. دوربینی که به سمت یک بلوار شلوغ نشانه رفته است، می‌تواند یک ون حمل بار را از یک اتوبوس حتی در هنگام غروب، در مه سبک، یا زمانی که وسایل نقلیه تا حدودی روی هم قرار گرفته‌اند، تشخیص دهد. مهم‌تر از آن، مدل به جای پیکسل‌های خام، امتیازهای اطمینان و متاداده‌های ساختاریافته ارائه می‌دهد؛ این بدان معناست که نرم‌افزارهای پایین‌دستی می‌توانند هشدارها را فعال کنند، داشبوردها را به‌روز کنند یا مستقیماً داده‌ها را به سخت‌افزار کنترل ترافیک ارسال کنند.

مدیریت ترافیک و کنترل جریان

ترافیک شهری یکی از واضح‌ترین دستاوردهای تحلیل ویدئویی است. چراغ‌های راهنمایی با زمان‌بندی ثابت، دهه‌ها پیش برای الگوهای پیش‌بینی‌پذیر ساعات اوج ترافیک طراحی شده بودند. آن‌ها نمی‌توانند زمانی که یک کنسرت دو ساعت زودتر جمعیت را به خیابان‌ها می‌ریزد یا زمانی که یک تصادف جزئی باعث مسدود شدن لاین میانی می‌شود، خود را تطبیق دهند.

سیستم‌های یادگیری عمیق نصب‌شده در تقاطع‌ها، وسایل نقلیه را بر اساس نوع شمارش می‌کنند، طول صف‌ها را در چراغ‌های قرمز اندازه‌گیری می‌کنند و زمان انتظار را تخمین می‌زنند. مهندسان شهر نه تنها می‌توانند ببینند که یک جاده شلوغ است، بلکه می‌توانند دلیل شلوغی آن را نیز بفهمند. آیا پشت سر هم شدن خودروها ناشی از ترافیک عبوری است، یا گردش به چپ بدون چراغ‌های محافظ، و یا عبور عابران پیاده برخلاف چراغ راهنمایی؟ دوربین‌های دارای قابلیت استنتاج روی دستگاه (onboard inference) می‌توانند فازهای چراغ راهنمایی را در لحظه تنظیم کنند تا به سمتی که واقعاً بار ترافیکی را حمل می‌کند، اولویت بدهند. برخی سیستم‌ها حوادث را بلافاصله گزارش می‌کنند — مانند تشخیص راننده در مسیر اشتباه، خودروی متوقف شده یا اشیاء مزاحم در مسیر — و اغلب سریع‌تر از آن است که یک اپراتور انسانی که دیوار مانیتورها را اسکن می‌کند، بتواند واکنش نشان دهد.

این ابزارها همچنین با برنامه‌ریزی شهری گسترده‌تر ادغام می‌شوند. شهرها با تحلیل هفته‌ها ویدیو، گلوگاه‌های مزمنی را شناسایی می‌کنند که نشان‌دهنده نیاز به لاین‌های گردش جدید یا محدودیت‌های سرعت اصلاح‌شده است و بدین ترتیب، حدس و گمان را با رفتار مشاهده‌شده جایگزین می‌کنند.

امنیت عمومی و نظارت

کاربردهای امنیتی بسیار فراتر از تشخیص ساده حرکت هستند. تحلیل‌های مدرن می‌توانند الگوهایی را شناسایی کنند که پیش از وقوع تصادفات یا جرایم ظاهر می‌شوند. یک کوله‌پشتی که برای مدتی بیش از بازه زمانی مشخص در سکوی قطار رها شده باشد، باعث فعال شدن یک اعلان می‌شود. دود یا پراکندگی ناگهانی جمعیت که در دوربین‌های ساحلی دیده می‌شود، می‌تواند پیش از آنکه کسی گزارش دهد، نشان‌دهنده یک وضعیت اضطراری باشد.

بهبود کلیدی در گزینش‌پذیری است. سیستم‌های قدیمی به هر سنجاب یا شاخه درخت در حال حرکت، واکنش نشان می‌دادند. مدل‌های یادگیری عمیق حرکات بی‌ربط را فیلتر کرده و رفتارهای واقعاً غیرعادی را علامت‌گذاری می‌کنند. درگیری در یک میدان عمومی، الگوی حرکتی خاصی ایجاد می‌کند که با بازی کردن گروهی از دوستان یا اجرای آکروباتیک یک هنرمند خیابانی متفاوت است. کارکنان امنیتی می‌توانند به جای تعقیب صدها هشدار اشتباه در طول شیفت، تمرکز خود را بر روی تعداد انگشت‌شماری از رویدادهای تأیید شده معطوف کنند.

پایش جمعیت و تحلیل تراکم

تجمعات بزرگ عمومی خطرات منحصربه‌فردی به همراه دارند. خروجی‌های استادیوم، محوطه‌های جشنواره و مراکز حمل‌ونقل در طول تعطیلات، زمانی که تراکم از حد مجاز فراتر رود، می‌توانند خطرناک شوند. سیستم‌های یادگیری عمیق با تحلیل توزیع مکانی افراد در یک صحنه، به شمارش جمعیت و تخمین تراکم می‌پردازند.

این ابزارها نقشه‌های حرارتی تولید می‌کنند که نشان می‌دهند جمعیت در لحظه در کجا متراکم می‌شود. برگزارکنندگان رویداد و پلیس می‌توانند خروجی‌های ثانویه را باز کنند، مسیر تردد پیاده را تغییر دهند یا پیش از آنکه ازدحام خطرناکی شکل بگیرد، ورود افراد را متوقف کنند. در دوره‌های معمول‌تر، همین فناوری جریان پیاده‌روی در راهروهای تجاری یا طبقات میانی ایستگاه‌های حمل‌ونقل را اندازه‌گیری می‌کند و به معماران و برنامه‌ریزان شهری کمک می‌کند تا بفهمند مردم واقعاً چگونه در فضاهای مشترک حرکت می‌کنند. به همین ترتیب، تخمین طول صف در فرودگاه‌ها و ادارات دولتی به کارکنان اجازه می‌دهد تا پیش از طولانی شدن بیش از حد صف‌ها، پنجره‌های خدمات اضافی را باز کنند.

تشخیص و ردیابی اشیاء در محیط‌های شهری

شهرها مملو از اجزای متحرک هستند: پیاده‌ها، دوچرخه‌سواران، اسکوترها، حیوانات خانگی، ربات‌های تحویل کالا و وسایل نقلیه در هر اندازه‌ای. سیستم‌های یادگیری عمیق صرفاً این اشیاء را در یک فریم واحد تشخیص نمی‌دهند؛ بلکه آن‌ها را در طول زمان و در شبکه‌های دوربین ردیابی می‌کنند.

ردیابی چند-شیئی، با عبور موجودیت‌ها از یک صحنه، هویت‌های ثابتی به آن‌ها اختصاص می‌دهد. پیاده‌ای که پشت یک ون پارک‌شده قرار می‌گیرد، از دید سیستم ناپدید نمی‌شود؛ مدل مسیر حرکت را پیش‌بینی کرده و زمانی که هدف دوباره قابل مشاهده شد، آن را مجدداً شناسایی می‌کند. وقتی این قابلیت در شبکه‌ای از دوربین‌ها با میدان‌های دید هم‌پوشان گسترش می‌یابد، بازشناسایی افراد به یک شهر اجازه می‌دهد تا یک فرد آسیب‌پذیر را دنبال کند یا یک کودک گم‌شده را بدون تکیه بر یک اپراتور که ساعت‌ها ویدیو را به صورت دستی بررسی کند، مکان‌یابی نماید.

این قابلیت‌ها همچنین زیربنای لجستیک و اجرای قانون هستند. تشخیص خودکار پلاک خودرو در حال حاضر رایج است، اما سیستم‌های جدیدتر بازشناسایی خودرو می‌توانند سفر یک ماشین خاص را بدون خواندن پلاک و با استفاده از ویژگی‌های متمایزکننده مانند برچسب‌های سپر، رکاب‌های سقفی یا الگوهای چرخ‌ها ردیابی کنند. برای نیروهای انتظامی این یک ابزار قدرتمند است، اما پرسش‌های مشروعی را نیز درباره دامنه فعالیت و نظارت ایجاد می‌کند که مدیران شهری باید از طریق سیاست‌های سخت‌گیرانه به آن‌ها رسیدگی کنند.

چالش زیرساختی

پیاده‌سازی این سیستم‌ها در مقیاس شهری، صرفاً یک مشکل نرم‌افزاری نیست. هزاران دوربین که ویدیوهای با وضوح بالا را پخش می‌کنند، پتابایت‌ها داده تولید می‌کنند. ارسال همه داده‌ها به یک ابر مرکزی برای تحلیل، گران و کند است. پهنای باند شبکه پیش از قدرت محاسباتی، به عامل محدودکننده تبدیل می‌شود.

شهرها با استفاده از محاسبات لبه‌ای (edge computing) به این مسئله پاسخ می‌دهند. دوربین‌های هوشمند مدرن شامل شتاب‌دهنده‌های استنتاج اختصاصی هستند که مدل‌ها را به صورت محلی اجرا کرده و تنها هشدارها، شمارش‌ها یا متادیتای فشرده‌شده را به مرکز ارسال می‌کنند. این کار هزینه‌های پهنای باند را کاهش داده و تأخیر را از چند ثانیه به چند میلی‌ثانیه می‌رساند، که هنگام تنظیم چراغ‌های راهنمایی یا متوقف کردن یک قطار بسیار حیاتی است.

نگهداری، مانع دیگری است. دوربین‌های فضای باز در معرض جرم، یخ و تار عنکبوت قرار دارند. مدلی که بر روی تصاویر بی‌نقص آموزش دیده باشد، زمانی که لنز کثیف شود، عملکردش کاهش می‌یابد. استقرار قابل اعتماد نیازمند نظارت خودکار بر سلامت سیستم و برنامه‌های نگهداری میدانی است. به‌روزرسانی‌های فریم‌ور، بازآموزی مدل با داده‌های محلی و وصله‌های امنیتی، هزینه‌های عملیاتی مداومی را اضافه می‌کنند که تیم‌های تدارکات اغلب در طول پروژه‌های آزمایشی آن‌ها را دست‌کم می‌گیرند.

حریم خصوصی و عنصر انسانی

هیچ بحثی درباره تحلیل ویدئویی شهری نمی‌تواند از حریم خصوصی چشم‌پوشی کند. همان مدل‌هایی که پیاده‌ها را می‌شمارند، می‌توانند چهره‌ها را شناسایی کنند. همان ردیابی که یک فرد گم‌شده را پیدا می‌کند، می‌تواند یک معترض را دنبال کند. شهرهایی که این ابزارها را اتخاذ می‌کنند، باید محدودیت‌های مشخصی برای نگهداری داده‌ها تعیین کنند، تشخیص چهره را به شرایطی محدود و مشخص که تحت حکم قضایی یا رضایت فرد است محدود نمایند، و گزارش‌های شفافی درباره مکان دوربین‌ها و قابلیت‌های سیستم منتشر کنند.

تکنیک‌های گمنام‌سازی کمک‌کننده هستند. مدل‌ها را می‌توان به‌گونه‌ای پیکربندی کرد که به‌طور پیش‌فرض چهره‌ها و پلاک‌ها را تار کنند و تنها متادیتای رفتاری مورد نیاز برای مدیریت ترافیک یا ایمنی را استخراج نمایند. پردازش داده‌ها به صورت محلی در لبه (edge) به جای آرشیو کردن هفته‌ها ویدیو خام در یک سرور مرکزی، خطر نظارت گسترده و نقض داده‌ها را محدود می‌کند.

برای نگاهی عمیق‌تر به الگوریتم‌ها و کاربردهای بررسی‌شده در اینجا، مقاله کامل تحقیق در source paper on Dev.to در دسترس است. اگر می‌خواهید درباره این ایده‌ها با دیگر افرادی که در زمینه هوش مصنوعی شهری و بینایی ماشین فعالیت می‌کنند بحث کنید، به گفتگو در جامعه تلگرام GyaanSetu بپیوندید.

کار واقعی پس از آموزش مدل شروع می‌شود

یادگیری عمیق، تحلیل ویدئویی را از یک آزمایش علمی به یک واقعیت عملیاتی تبدیل کرده است. دوربین‌ها در شهرهای هوشمند دیگر صرفاً ضبط نمی‌کنند؛ آن‌ها تفسیر می‌کنند، اندازه‌گیری می‌کنند و واکنش نشان می‌دهند. این فناوری امکان مدیریت جریان ترافیک، جلوگیری از فجایع ناشی از تجمع جمعیت و تسریع در پاسخ‌های اضطراری را با استفاده از ویدئوهایی که در هر صورت در حال ضبط بودند، فراهم کرده است.

اما سخت‌افزار و الگوریتم‌ها تنها بخشی از کار هستند. شهری که این ابزارها را بدون برنامه‌های نگهداری، بدون معماری شبکه‌ای که محدودیت‌های پهنای باند را رعایت کند و بدون چارچوب‌های حفاظتی برای حریم خصوصی مستقر می‌کند، یا با یک شکست پرهزینه مواجه خواهد شد و یا یک سیستم نظارتی تهاجمی ایجاد خواهد کرد. تفاوت در جزئیات پیاده‌سازی نهفته است. یادگیری عمیق چشم‌ها را فراهم می‌کند؛ اما برنامه‌ریزان شهری و مهندسان همچنان وظیفه قضاوت را بر عهده دارند.