Сьогодні кожне велике місто функціонує завдяки відео. Перехрестя, платформи метро, громадські парки та торгові райони безперервно передають кадри до муніципальних центрів управління. Обсяги сирих даних приголомшують. Без інтерпретації ці кадри — лише дорогі файли, що споживають місце на серверах. Глибоке навчання змінило правила гри. Воно дає міським системам можливість спостерігати, розуміти та реагувати на події в міру їх розвитку, перетворюючи пасивні записи на активну інфраструктуру.

Від пікселів до рішень

Традиційне комп'ютерне бачення покладалося на правила, розроблені вручну. Інженери програмували системи на пошук певних форм, кольорів або патернів руху. Ці методи працювали в контрольованих лабораторіях, але міста — це хаос. Тіні змінюються. Дощ розмиває лінзи. Пішоходи ховаються під парасолями, які зовсім не схожі на навчальні діаграми. Системи на основі правил постійно давали збої, засипаючи операторів хибними спрацюваннями.

Глибоке навчання підходить до проблеми інакше. Згорткові нейронні мережі та їхні наступники вивчають ознаки безпосередньо з даних. Замість того, щоб пояснювати комп'ютеру, як виглядає велосипед, інженери надають йому мільйони маркованих прикладів, поки модель не сформує власне внутрішнє поняття велосипеда. Результатом є система, яка справляється з варіативністю реального світу без збоїв. Камера, спрямована на завантажений бульвар, може відрізнити фургон доставки від автобуса навіть у сутінках, у легкому тумані або коли транспортні засоби частково перекривають один одного. Що ще важливіше, модель видає показники впевненості та структуровані метадані замість сирих пікселів, а це означає, що програмне забезпечення на наступних етапах може запускати сповіщення, оновлювати панелі керування або передавати дані безпосередньо на апаратне забезпечення управління трафіком.

Управління трафіком та контроль потоків

Міський трафік — це одна з найбільш очевидних сфер успіху відеоаналітики. Світлофори з фіксованим часом роботи були розроблені десятиліття тому для передбачуваних моделей години пік. Вони не можуть адаптуватися, коли після концерту люди виходять на вулиці на дві години раніше або коли легке ДТП блокує середню смугу.

Системи глибокого навчання, встановлені на перехрестях, підраховують транспортні засоби за типом, вимірюють довжину черг на червоне світло та оцінюють час очікування. Міські інженери можуть бачити не лише те, що дорога завантажена, а й чому саме це відбувається. Чи спричинено затор транзитним трафіком, поворотами ліворуч без захищених сигналів чи пішоходами, що перетинають дорогу на червоне світло? Камери з вбудованим виведенням (inference) можуть у реальному часі коригувати фази сигналів, надаючи перевагу напрямку, який фактично має найбільше навантаження. Деякі системи миттєво фіксують інциденти — виявляючи водія, що їде на зустрічну смугу, зупинений автомобіль або сміття на проїзній частині — часто швидше, ніж міг би зреагувати оператор, оглядаючи стіну моніторів.

Ці інструменти також інтегруються з ширшим міським плануванням. Аналізуючи відео за тижні, міста виявляють хронічні «вузькі місця», що вказують на необхідність створення нових смуг для повороту або коригування швидкісного режиму, замінюючи здогадки спостереженням за реальною поведінкою.

Громадська безпека та спостереження

Застосування у сфері безпеки виходять далеко за межі простого виявлення руху. Сучасна аналітика може помічати закономірності, що передують аваріям або злочинам. Рюкзак, залишений без нагляду на пероні потяга довше визначеного інтервалу, викликає сповіщення. Дим або раптове розбігання натовпу, помітне на камерах вздовж набережних, може свідчити про надзвичайну ситуацію ще до того, як хтось про неї повідомить.

Ключовим покращенням є селективність. Старі системи реагували на кожну білку чи коливаючуся гілку дерева. Моделі глибокого навчання відфільтровують нерелевантний рух і фіксують справді незвичну поведінку. Бійка на площі створює специфічний кінетичний підпис, який відрізняється від ігор групи друзів або виступів вуличного акробата. Співробітники служби безпеки можуть зосередити свою увагу на кількох перевірених подіях, а не переслідувати сотні помилкових сповіщень протягом зміни.

Моніторинг натовпу та аналіз щільності

Масові публічні заходи несуть у собі унікальні ризики. Виходи зі стадіонів, місця проведення фестивалів та транспортні вузли під час свят можуть стати небезпечними, коли щільність людей перевищує безпечні пороги. Системи глибокого навчання здійснюють підрахунок натовпу та оцінку щільності, аналізуючи просторовий розподіл людей у сцені.

Ці інструменти створюють теплові карти, що показують у реальному часі місця найбільшого скупчення людей. Організатори заходів та поліція можуть відкривати запасні виходи, перенаправляти пішохідні потоки або призупиняти прибуття людей до того, як утвориться небезпечне скупчення. Під час звичайних періодів та сама технологія вимірює пішохідний трафік у торгових коридорах або на транспортних мезонінах, допомагаючи архітекторам і міським планувальникам зрозуміти, як люди насправді пересуваються спільними просторами. Оцінка довжини черги в аеропортах та державних установах, так само, дозволяє персоналу відкривати додаткові вікна обслуговування до того, як черги стануть неконтрольованими.

Виявлення та відстеження об'єктів у міському середовищі

Міста сповнені рухомих елементів: пішоходів, велосипедистів, самокатників, домашніх тварин, роботів-доставників та транспортних засобів будь-якого розміру. Системи глибокого навчання не просто виявляють ці об'єкти на одному кадрі; вони відстежують їх у часі та через мережі камер.

Багатооб'єктне відстеження (multi-object tracking) присвоює сталі ідентифікатори об'єктам під час їхнього переміщення по сцені. Пішохід, який заходить за припаркований фургон, не зникає з поля зору системи; модель передбачає траєкторію та знову ідентифікує ціль, коли вона знову стає видимою. При розширенні на мережу камер із перекриваючими полями зору, повторна ідентифікація особи (person re-identification) дозволяє місту стежити за вразливою людиною або знайти загублену дитину, не покладаючись на оператора, який вручну переглядає години відеозаписів.

Ці можливості також лежать в основі логістики та правозастосування. Автоматичне розпізнавання номерних знаків уже є поширеним, але новіші системи повторної ідентифікації транспортних засобів можуть відстежувати шлях конкретного автомобіля без зчитування номера, використовуючи такі характерні ознаки, як наклейки на бампері, багажники на даху або візерунки коліс. Для правоохоронних органів це потужний інструмент, але це також поружує законні питання щодо масштабів та нагляду, які адміністрація міста має вирішувати за допомогою суворої політики.

Виклик інфраструктурі

Впровадження таких систем у масштабах міста — це не лише програмна проблема. Тисячі камер, що транслюють відео високої роздільної здатності, генерують петабайти даних. Надсилання всього в центральну хмару для аналізу є дорогим і повільним процесом. Пропускна здатність мережі стає обмежувальним фактором раніше, ніж обчислювальна потужність.

Міста реагують на це за допомогою периферійних обчислень (edge computing). Сучасні розумні камери мають спеціальні прискорювачі виведення (inference accelerators), які запускають моделі локально і передають у штаб-квартиру лише сповіщення, підрахунки або стиснуті метадані. Це знижує витрати на пропускну здатність і скорочує затримку з секунд до мілісекунд, що важливо при регулюванні світлофорів або зупинці поїзда.

Технічне обслуговування — ще одна перешкода. Вуличні камери накопичують бруд, лід і павутиння. Модель, навчена на чистих зображеннях, втрачає ефективність, коли об'єктив брудний. Надійне розгортання потребує автоматизованого моніторингу стану та графіків польового обслуговування. Оновлення прошивки, перенавчання моделей на локальних даних і патчі безпеки створюють постійні операційні витрати, які команди із закупівель часто недооцінюють під час пілотних проєктів.

Конфіденційність та людський фактор

Жодна дискусія про міську відеоаналітику не може обійти стороною питання конфіденційності. Ті самі моделі, що підраховують пішоходів, можуть ідентифікувати обличчя. Те саме відстеження, що знаходить загублену людину, може стежити за протестувальником. Міста, які впроваджують ці інструменти, повинні встановити чіткі межі зберігання даних, обмежити розпізнавання облич лише вузько визначеними обставинами, що регулюються ордером або згодою, і публікувати звіти про прозорість щодо розташування камер і можливостей системи.

Методи анонімізації допомагають. Моделі можна налаштувати так, щоб вони за замовчуванням розмивали обличчя та номерні знаки, витягуючи лише поведінкові метадані, необхідні для управління трафіком або безпекою. Обробка даних локально на периферії, а не архівування тижнів сирих відеозаписів на центральному сервері, обмежує ризик масового стеження та витоку даних.

Для глибшого ознайомлення з алгоритмами та застосуваннями, розглянутими тут, повна наукова стаття доступна за посиланням на статтю на Dev.to. Якщо ви хочете обговорити ці ідеї з іншими фахівцями в галузі міського ШІ та комп'ютерного зору, приєднуйтесь до обговорення в спільноті GyaanSetu у Telegram.

Справжня робота починається після навчання моделі

Глибоке навчання перетворило відеоаналітику з наукового експерименту на оперативну реальність. Камери в розумних містах більше не просто записують; вони інтерпретують, вимірюють і реагують. Технології вже існують для управління транспортними потоками, запобігання катастрофам у натовпах та прискорення реагування на надзвичайні ситуації, використовуючи відео, яке все одно вже записувалося.

Але апаратне забезпечення та алгоритми — це лише частина справи. Місто, яке впроваджує ці інструменти без планів технічного обслуговування, без мережевої архітектури, що враховує обмеження пропускної здатності, і без механізмів захисту приватності, створить або дорогий провал, або інвазивний апарат стеження. Різниця полягає в деталях впровадження. Глибоке навчання забезпечує «очі», але міські планувальники та інженери все ще забезпечують прийняття рішень.