Een vergeten tas op het perron van een station, een koffer achtergelaten in een luchthavenhal: deze situaties kunnen voor heel wat ongerustheid zorgen en kostbare beveiligingsmiddelen mobiliseren. De bewakingsteams moeten snel controleren of het object bewust is achtergelaten of gewoon is vergeten door een passagier. Aangezien het aantal passagiers voortdurend toeneemt en camera's duizenden beelden per dag registreren, wordt het alsmaar moeilijker om dit alles handmatig te analyseren.
Het ReconnAIssance-project pakt het probleem aan door video- en audioanalysesystemen te ontwikkelen op basis van kunstmatige intelligentie en deep learning. Deze systemen kunnen namelijk rechtstreeks op camera's of lokale gateways werken (edge computing, d.w.z. gegevens ter plaatse verwerken, zonder ze naar de cloud te verzenden).
Van onderzoek naar inzetbare technologie voor publieke veiligheid
Het samenwerkingsproject wordt door het Waalse Gewest gefinancierd in het kader van de MecaTech-cluster. Het brengt verschillende industriële en academische partners samen: Phoenix AI (projectcoördinator), Thelis en WNM, Chapsvision/ACIC, Université de Liège, UCLouvain en Sirris.
Een van de gebruikscases van het project, waaraan ACIC en Sirris hebben gewerkt, richt zich op de detectie van voorwerpen die in de openbare ruimte zijn achtergelaten. Een cruciaal aspect voor transportoperatoren, beheerders van openbare plaatsen en lokale overheden. Het doel spreekt voor zich: verlaten voorwerpen automatisch detecteren, in real time beveiligingsteams waarschuwen en tegelijk vermijden dat valse alarmen een site onnodig blokkeren.
Technische uitdagingen bij het detecteren van achtergelaten objecten
Een achtergelaten object detecteren klinkt eenvoudig, maar brengt tal van uitdagingen met zich mee:
- Weinig gegevens beschikbaar: openbare beelddatabanken tonen zelden verlaten objecten in reële situaties (stations, winkelcentra enz.)
- Zeldzame en gevarieerde gevallen: achtergebleven voorwerpen zijn zeldzaam en de reële beelddatabanken zijn eigendomsrechtelijk beschermd, niet geannoteerd en bevatten persoonsgegevens, wat de modeltraining bemoeilijkt
- Verschillende gezichtshoeken: camera's filmen vaak van bovenaf, in tegenstelling tot standaard camerabeelden die op persoonshoogte worden gemaakt
- Belang van betrouwbaarheid: het systeem moet echte objecten detecteren zonder al te veel valse alarmen te genereren
- Technische beperkingen: het model moet licht genoeg zijn om te draaien op platformen zoals Jetson Orin van NVIDIA (een erg krachtige minicomputer ontworpen voor ingebedde AI), zonder afhankelijk te zijn van een cloudserver
Hoe Sirris de detectie verbetert met AI
Bij Sirris hebben we bijgedragen aan de voorbereiding van de gegevens en de ontwikkeling van leermethoden op maat van dit project. Daartoe hebben we onze expertise op het vlak van gegevensverwerking en kunstmatige intelligentie ingezet.
1. Creatie van een dataset op maat
Openbare datasets zoals COCO 2017 bevatten veel beelden uit contexten die weinig gemeen hebben met omgevingen zoals treinstations en winkelcentra. Als die beelden toch worden gebruikt, wordt het leerproces van het model onnodig bemoeilijkt. Daarom selecteerden we de meest relevante afbeeldingen (onder andere door de ‘stuff’-categorieën van COCO 2017 te filteren om de minst relevante afbeeldingen te elimineren) en onderzochten we andere datasets (i-LIDS, YouTube-8M Segments, Open Images, Visual Genome, PETS2006) om een meer representatieve set samen te stellen.
Vervolgens gebruikten we een beeldclassificatiemodel (ResNet50) om zogeheten embeddings te genereren, digitale representaties van de afbeeldingen. Met deze embeddings kunnen we de gelijkenissen tussen afbeeldingen in kaart brengen en de afbeeldingen selecteren die het best bij onze gebruikscase aansluiten.
Zo krijgen we een veel representatievere dataset, die het gemakkelijker maakt om het model te trainen en de detectieprestaties te verbeteren.
2. Implementatie van een pijplijn voor semi-gesuperviseerd en actief leren
Duizenden afbeeldingen handmatig annoteren is erg tijdrovend. Op basis van het meest recente onderzoek (zoals Chen et al. ), hebben we een annotatiepijplijn ontworpen die semi-gesuperviseerd en actief leren combineert. In de praktijk leert het model ook van niet-geannoteerde beelden en is er alleen een menselijke expert nodig voor de meest complexe gevallen.
De afbeeldingen worden eerst verbeterd (variaties in helderheid, contrast, spiegeling enz.). Als het model stabiele voorspellingen geeft voor de originele en verbeterde versies, worden de afzonderlijke afbeeldingen automatisch geannoteerd en toegevoegd aan de dataset. Complexe of dubbelzinnige beelden worden daarentegen naar de actieve leerfase gestuurd en ter annotatie voorgelegd aan een menselijke expert. Op die manier dienen we veel minder afbeeldingen handmatig te annoteren, waardoor de trainingsset sneller kan worden aangemaakt.
De onderstaande figuur illustreert dat proces en laat zien hoe de pijplijn automatisch eenvoudige afbeeldingen selecteert en alleen voor de meest complexe gevallen een menselijke expert inschakelt.
3. Tests en validering op het terrein
Om de validatie van de pijplijn te vereenvoudigen, hebben we de oplossing verpakt in Docker-componenten. Tests die ACIC heeft uitgevoerd op NVIDIA's Jetson Orin-platform, hebben aangetoond dat het systeem in edge computing-modus kan werken, rechtstreeks op lokale camera's of gateways. Er moeten dus geen beelden naar de cloud worden gestuurd. Dat verbetert de reactiesnelheid en vertrouwelijkheid van de gegevens.
Deze bijdragen (en die van ACIC) maken het systeem betrouwbaarder, sneller te trainen en klaar voor implementatie in echte omgevingen zoals stations of luchthavens.
Voortdurende verbetering door actief leren
We ontwikkelen momenteel een innovatieve benadering van actief leren die voortbouwt op de moeilijkheden die een objectdetectiemodel ondervindt om verschillende objecten in een afbeelding correct te detecteren. We hopen dat dit de nauwkeurigheid verder zal verbeteren en tegelijkertijd het aantal benodigde annotaties zal beperken.
Een collectief project gericht op de industrie
De complementariteit van industriële spelers, integratiespecialisten, onderzoekers en het technologiecentrum (Sirris) voorkomt dat de resultaten in het prototypestadium blijven steken. Zo kunnen ze snel worden geïntegreerd in operationele producten en diensten.
Bespreek uw AI-projecten met onze experts
Wilt u onderzoeken hoe AI en edge computing uw infrastructuur kunnen beveiligen of uw videoanalyse kunnen optimaliseren? Neem dan contact op met onze experts.
Neem contact op met Giulia Murtas Neem contact op met Nicolás González-Deleito
Bron
- [1] S. Chen, Y. Yang, and Y. Hua, "Semi-Supervised Active Learning for Object Detection", Electronics 2023,12, 375.