כל עיר מרכזית פועלת כיום באמצעות וידאו. צמתים תנועתיים, רציפי רכבת תחתית, פארקים ציבוריים ואזורי קניות מזינים צילומים רציפים לחדרי בקרה עירוניים. הנפח הגולמי הוא מדהים. ללא פרשנות, הפריימים הללו הם רק קבצים יקרים הצורכים שטח אחסון בשרתים. למידה עמוקה (Deep learning) שינתה את המשוואה. היא מעניקה למערכות עירוניות את היכולת לצפות, להבין ולהגיב לאירועים ככל שהם מתרחשים, ובכך הופכת הקלטות פסיביות לתשתית פעילה.
מפיקסלים להחלטות
ראייה ממוחשבת מסורתית התבססה על כללים שנכתבו ידנית. מהנדסים תכנתו מערכות לחפש צורות, צבעים או דפוסי תנועה ספציפיים. השיטות הללו עבדו במעבדות מבוקרות, אך ערים הן מקומות מבולגנים. צללים משתנים. גשם מטושטש עדשות. הולכי רגל מתקהלים תחת מטריות שנראות כלל לא כמו תרשימי האימון. מערכות מבוססות כללים נכשלו ללא הרף, והציפו את המפעילים ב"חיובי שווא" (false positives).
למידה עמוקה ניגשת לבעיה בצורה שונה. רשתות עצביות קונבולוציוניות (Convolutional neural networks) וצאצאיהן לומדות מאפיינים ישירות מהנתונים. במקום לומר למחשב איך נראה אופניים, מהנדסים מזינים לו מיליוני דוגמאות מתויגות עד שהמודל בונה לעצמו מושג פנימי של אופניים. התוצאה היא מערכת שמטפלת בשונות של העולם האמיתי מבלי לקרוס. מצלמה המופנית לעבר שדרה עמוסה יכולה להבחין בין רכב משלוחים לאוטובוס גם בשעת דמדומים, דרך ערפל קל, או כאשר הרכבים חופפים חלקית. חשוב מכך, המודל מוציא ציוני ביטחון (confidence scores) ומטא-דאטה מובנה במקום פיקסלים גולמיים, מה שאומר שתוכנות המשך יכולות להפעיל התראות, לעדכן לוחות בקרה (dashboards) או להזין נתונים ישירות לחומרת בקרת תנועה.
ניהול תנועה ובקרת זרימה
תנועה עירונית היא אחת ההצלחות הברורות ביותר של אנליטיקת וידאו. רמזורים עם תזמון קבוע תוכננו לפני עשורים עבור דפוסי שעות עומס צפויים. הם אינם יכולים להסתגל כאשר קונצרט מתפנה לרחובות שעתיים מוקדם מהצפוי, או כאשר תאונה קלה חוסמת את הנתיב האמצעי.
מערכות למידה עמוקה המותקנות בצמתים סופרות כלי רכב לפי סוג, מודדות אורך תורים ברמזורים אדומים ומעריכות זמני המתנה. מהנדסי עיר יכולים לראות לא רק שהכביש עמוס, אלא מדוע הוא עמוס. האם העומס נגרם מתנועה עוברת, מפניות שמאלה ללא אותות מוגנים, או מהולכי רגל החוצים בניגוד לאור? מצלמות עם יכולת הסקה (inference) מובנית יכולות להתאים את שלבי האות בזמן אמת כדי לתת עדיפות לכיוון שבו נמצא העומס בפועל. מערכות מסוימות מסמנות אירועים באופן מיידי — זיהוי נהג בתנועה בכיוון ההפוך, רכב תקוע או פסולת על הכביש — לעיתים קרובות מהר יותר ממפעיל אנושי הסורק קיר של מסכים.
כלים אלו משתלבים גם בתכנון עירוני רחב יותר. באמצעות ניתוח של שבועות של וידאו, ערים מזהות צווארי בקבוק כרוניים המאותתים על צורך בנתיבי פנייה חדשים או בהגבלות מהירות מותאמות, ובכך מחליפות ניחושים בהתנהגות שנצפתה בפועל.
בטיחות הציבור ומעקב
יישומים של בטיחות משתרעים הרבה מעבר לזיהוי תנועה פשוט. אנליטיקה מודרנית יכולה לזהות דפוסים המקדימים תאונות או פשעים. תרמיל שנשאר ללא השגחה ברציף רכבת למעלה מפרק זמן מוגדר מפעיל התראה. עשן או פיזור פתאומי של קהל הנראה במצלמות לאורך גדת הנהר יכולים להעיד על מצב חירום לפני שמישהו מדווח עליו.
השיפור המרכזי הוא הסלקטיביות. מערכות ישנות הגיבו לכל סנאי או ענף עץ מתנודד. מודלים של למידה עמוקה מסננים תנועה לא רלוונטית ומסמנים התנהגות חריגה באמת. קטטה המתפרצת בכיכר מייצרת חתימה קינטית ספציפית השונה מקבוצת חברים המשחקת בחוזקה או ממופע רחוב המבצע אקרובטיקה. אנשי אבטחה יכולים למקד את תשומת לבם בכמה אירועים מאומתים במקום לרדוף אחרי מאות התראות שגויות במהלך משמרת.
ניטור קהל וניתוח צפיפות
התקהלויות ציבוריות גדולות מציבות סיכונים ייחודיים. יציאות מאצטדיונים, מתחמי פסטיבלים ומרכזי תחבורה במהלך חגים עלולים להפוך למסוכנים כאשר הצפיפות עולה על הסף הבטוח. מערכות למידה עמוקה מבצעות ספירת קהל והערכת צפיפות על ידי ניתוח ההתפלגות המרחבית של אנשים לאורך הסצנה.
כלים אלו מייצרים מפות חום המראות היכן הקהל מתעבה בזמן אמת. מארגני אירועים ומשטרה יכולים לפתוח יציאות משניות, להסיט תנועת הולכי רגל או לעצור הגעה לפני שנוצרת דוחק מסוכן. בתקופות שגרתיות יותר, אותה טכנולוגיה מודדת את זרימת הולכי הרגל במסדרונות קמעונאיים או בקומות ביניים בתחנות תחבורה, ובכך מסייעת לאדריכלים ולמתכנני ערים להבין כיצד אנשים נעים בפועל בחללים משותפים. הערכת אורך התור בשדות תעופה ובמשרדים ממשלתיים, באופן דומה, מאפשרת לצוותים לפתוח חלונות שירות נוספים לפני שהתורים הופכים לבלתי נשלטים.
זיהוי ומעקב אחר אובייקטים בסביבה עירונית
ערים מלאות בחלקים נעים: הולכי רגל, רוכבי אופניים, רוכבי קורקינט, חיות מחמד, רובוטים למשלוחים וכלי רכב מכל סוג וגודל. מערכות למידה עמוקה (Deep learning) אינן רק מזהות את האובייקטים הללו בפריים בודד; הן עוקבות אחריהם לאורך זמן ודרך רשתות מצלמות.
מעקב אחר מספר אובייקטים (Multi-object tracking) מקצה זהויות עקביות לישויות בעודן חוצות סצנה. הולך רגל שנכנס מאחורי מסחית חונה אינו נעלם מהמודעות של המערכת; המודל חוזה את המסלול (trajectory) ומזהה מחדש את היעד כאשר הוא נראה שוב. כאשר הטכנולוגיה מורחבת על פני רשת מצלמות בעלות שדות ראייה חופפים, זיהוי מחדש של אנשים (person re-identification) מאפשר לעיר לעקוב אחר אדם פגיע או לאתר ילד אבוד מבלי להסתמך על מפעיל בודד שיסרוק ידנית שעות של צילומים.
יכולות אלו מהוות גם תשתית ללוגיסטיקה ואכיפה. זיהוי אוטומטי של לוחיות רישוי הוא כבר נפוץ, אך מערכות חדשות יותר לזיהוי מחדש של כלי רכב יכולות לעקוב אחר מסלולו של רכב ספציפי מבלי לקרוא את הלוחית, על ידי שימוש במאפיינים מובחנים כמו מדבקות על המרכב, מתקני גג או דפוסי גלגלים. עבור רשויות אכיפת החוק זהו כלי עוצמתי, אך הדבר מעלה גם שאלות לגיטימיות לגבי היקף הפיקוח והבקרה שעל מנהלי העיר לטפל בהן באמצעות מדיניות מחמירה.
אתגר התשתית
פריסת מערכות אלו בקנה מידה עירוני אינה בעיה של תוכנה בלבד. אלפי מצלמות המשדרות וידאו ברזולוציה גבוהה מייצרות פטה-בייטים של נתונים. שליחת הכל לענן מרכזי לצורך ניתוח היא יקרה ואיטית. רוחב הפס של הרשת הופך לגורם המגביל לפני כוח העיבוד.
ערים מגיבות באמצעות מחשוב קצה (edge computing). מצלמות חכמות מודרניות כוללות מאיצי הסקה (inference accelerators) ייעודיים המריצים מודלים מקומית ומשדרים חזרה למטה בלבד התראות, ספירות או מטא-דאטה דחוס. זה מפחית את עלויות רוחב הפס וצמצם את השיהוי (latency) משניות למילישניות, דבר שחשוב בעת כיוון רמזורים או עצירת רכבת.
תחזוקה היא מכשול נוסף. מצלמות חיצוניות צוברות לכלוך, קרח וקורי עכביש. מודל שאומן על תמונות נקיות חווה ירידה בביצועים כאשר העדשה מלוכלכת. פריסה אמינה דורשת ניטור תקינות אוטומטי ולוחות זמנים לתחזוקה בשטח. עדכוני קושחה (firmware), אימון מחדש של מודלים עם נתונים מקומיים ועדכוני אבטחה מוסיפים עלויות תפעוליות שוטפות שצוותי רכש נוטים להמעיט בערכן במהלך פרויקטי פיילוט.
פרטיות והאלמנט האנושי
שום דיון בניתוח וידאו עירוני אינו יכול להתעלם מפרטיות. אותם מודלים שסופרים הולכי רגל יכולים לזהות פנים. אותו מעקב שמוצא אדם אבוד יכול לעקוב אחר מפגין. ערים המאמצות כלים אלו חייבות לקבוע מגבלות ברורות על שמירת נתונים, להגביל את זיהוי הפנים לנסיבות מוגדרות היטב הנשלטות על ידי צו בית משפט או הסכמה, ולפרסם דוחות שקיפות לגבי מיקומי מצלמות ויכולות המערכת.
טכניקות אנונימיזציה עוזרות. ניתן להגדיר מודלים כך שיטשטשו פנים ולוחיות רישוי כברירת מחדל, ויחלצו רק את המטא-דאטה ההתנהגותי הדרוש לניהול תנועה או בטיחות. עיבוד נתונים מקומית בקצה במקום ארכוב שבועות של צילומים גולמיים בשרת מרכזי מגביל את הסיכון למעקב המוני ופריצות נתונים.
למבט מעמיק יותר על האלגוריתמים והיישומים שנסקרו כאן, מאמר המחקר המלא זמין ב-source paper on Dev.to. אם ברצונכם לדון ברעיונות אלו עם אחרים העוסקים ב-AI עירוני וראייה ממוחשבת, הצטרפו לשיחה ב-GyaanSetu Telegram community.
העבודה האמיתית מתחילה לאחר שהמודל אומן
למידה עמוקה העבירה את ניתוח הווידאו מניסוי מדעי למציאות תפעולית. מצלמות בערים חכמות כבר לא רק מקליטות; הן מפרשות, מודדות ומגיבות. הטכנולוגיה קיימת כדי לנהל זרימת תנועה, למנוע אסונות המוניים ולהאיץ את המענה לשעת חירום, תוך שימוש בווידאו שכבר הוקלט ממילא.
אך חומרה ואלגוריתמים הם רק חלק מהעבודה. עיר שפורסת את הכלים הללו ללא תוכניות תחזוקה, ללא ארכיטקטורת רשת המכבדת את מגבלות רוחב הפס, וללא מסגרות הגנה על הפרטיות, תיצור או כישלון יקר או מנגנון מעקב פולשני. ההבדל טמון בפרטי היישום. הלמידה העמוקה מספקת את העיניים; מתכנני ערים ומהנדסים הם שעדיין מספקים את שיקול הדעת.
