När en människa tittar på en scen eller en bild förstår de det – vilka föremål som finns i den och vad som händer om handling äger rum. En dator, å andra sidan, bearbetar bara digital data som beskriver färgvärdet för varje pixel. För en människa är det enkelt att känna igen en pizza på ett rörigt bord. Men tills nyligen skulle datorer inte kunna utföra samma uppgift.
Datorseende, eller CV, gör det möjligt för en dator att kunna plocka ut viktig information från visuella input och göra korrekta förutsägelser och rekommendationer baserat på den informationen.
Hur fungerar datorseende?
Innan datorseende, för att skapa ett program som kände igen en viss bild, skulle en person behöva göra timmar av manuellt benarbete. För det första skulle en databas med liknande bilder behöva sammanställas.
Sedan skulle dessa bilder behöva analyseras manuellt, mätas och kommenteras med relevant data som forskaren trodde kunde identifiera objektet i fråga (som färg, mått och form). Först då kunde programvara användas för att göra förutsägelser.
Å andra sidan automatiserar datorseende hela denna process med en maskininlärningsmetod som kallas djupinlärning. Deep learning använder ett flerskiktigt neuralt nätverk med hundratals potentiella lager. När det gäller bilder är detta vanligtvis ett konvolutionellt neuralt nätverk (CNN).
Att förklara i detalj hur djupinlärning och neurala nätverk fungerar ligger långt utanför ramen för denna artikel. I grund och botten matas stora mängder data in i det neurala nätverket. Det neurala nätverket analyserar data upprepade gånger tills det kan bilda korrekta förutsägelser om det.
När det gäller en CNN som används för en datorseendeuppgift tar det neurala nätverket data genom flera steg. För det första kollapsar den bilden i flera delar (enskilda pixlar eller grupper av pixlar som är taggade i förväg).
Sedan gör den förutsägelser om vad som finns i olika delar av bilden (som hårda kanter eller specifika objekt). Den kontrollerar noggrannheten av dessa förutsägelser upprepade gånger och ändrar en del av algoritmen varje gång tills den blir mycket exakt.
Datorer är nu så kraftfulla att de kan analysera en bild mycket snabbare än den mänskliga hjärnan, särskilt när de har lärt sig att känna igen vissa mönster. På så sätt är det lätt att se hur en djupinlärningsalgoritm kan överträffa mänskliga förmågor.
Vilka är typerna av datorseende?
Datorseende innebär att analysera och förstå bilder och resultatet av relevanta förutsägelser eller beslut om bilderna. Det finns olika uppgifter som datorseende kommer att använda för att uppnå dessa mål. Några av dessa inkluderar:
Bildklassificering: Typen av bild känns igen. Till exempel om det är en persons ansikte, landskap eller föremål. Den här typen av uppgifter kan användas för att snabbt identifiera och klassificera bilder. En användning för detta är att automatiskt känna igen och blockera olämpligt innehåll på sociala medier. Objektigenkänning: I likhet med bildklassificering kan objektigenkänning identifiera ett visst objekt i en scen – som en pizza på ett rörigt bord. Kantdetektering: En vanlig användning av datorseende, och vanligtvis det första steget i objektdetektering, är att identifiera de hårda kanterna i en bild. Objektidentifiering: Detta är igenkännandet av individuella exempel på ett objekt eller en bild, som att identifiera en viss person, fingeravtryck eller fordon. Objektidentifiering: Detektion är identifieringen av en viss egenskap i en bild, som ett frakturerat ben i en röntgen. Objektsegmentering: Detta är identifieringen av vilka pixlar i bilden som tillhör objektet i fråga. Objektspårning: I en videosekvens, när ett objekt har identifierats, kan det enkelt spåras genom hela videon. Bildåterställning: Suddighet, brus och andra bildartefakter kan tas bort genom att noggrant identifiera var objektet mot bakgrunden är i bilden.
Exempel på datorseende
Artificiell intelligens används redan i flera branscher med en svindlande effekt, vilket är sant för datorseende. Här är några exempel på CV som redan används idag.
Ansiktsigenkänning
Ansiktsigenkänning är ett av de viktigaste sätten att datorseende används idag. Jämfört med databaser med kända ansikten kan datorseendealgoritmer mycket exakt identifiera enskilda personer.
Sociala medier analyserar bilder och taggar automatiskt användare som de har ett bra urval av bilder för. Bärbara datorer, telefoner och säkerhetsenheter kan identifiera personer för att tillåta åtkomst. Brottsbekämpande myndigheter använder ansiktsigenkänning i CCTV-system för att identifiera misstänkta.
Medicin
Datorseende används för närvarande inom vården för att ge snabbare och mer exakta diagnoser än experter kan ställa. Många applikationer involverar analys av röntgen-, CT- eller MRI-bilder för särskilda tillstånd, inklusive neurologiska sjukdomar, tumörer och brutna eller frakturerade ben.
Självkörande bilar
Autonoma fordon måste förstå sin omgivning för att kunna köra säkert. Det innebär att känna igen vägar, körfält, trafiksignaler, andra fordon, fotgängare och mer. Alla dessa uppgifter använder datorseendesystem i realtid för att undvika kollisioner och köra säkert.
Datorseende är utmanande
De nuvarande tillämpningarna av datorseende börjar redan förändra hur vi arbetar i olika branscher. Från att kunna upptäcka felaktig eller trasig utrustning till att korrekt diagnostisera cancer, datorseende har förmågan att förbättra system och rädda liv.
Men det är inte utan sina utmaningar. Datorseende är fortfarande långt ifrån vad mänskligt syn är. Vi har tusentals år av evolution som gör det möjligt för oss att känna igen och förstå nästan allt som händer omkring oss i realtid. Men vi har ingen aning om hur mänskliga hjärnor utför dessa uppgifter.
Deep learning är ett enormt steg i rätt riktning, men det kräver fortfarande otroligt mycket arbete för att skapa ett system som kan utföra en uppgift som människor kan göra mycket enkelt, som att identifiera en bil på vägen. Detta beror på att datorer utför begränsade uppgifter mycket effektivt. Att utveckla en dator som kan förstå den totala komplexiteten i den visuella världen är ett helt annat bollspel.
När mer forskning går in på både AI-tillämpningar och mänsklig biologi, kommer vi sannolikt att se en explosion av möjliga användningsområden för datorseende inom en snar framtid.
Om författaren
Jake Harfield (40 artiklar publicerade)
Jake Harfield är en frilansskribent baserad i Perth, Australien. När han inte skriver är han vanligtvis ute i bushen och fotograferar det lokala djurlivet. Du kan besöka honom på www.jakeharfield.com
Mer från Jake Harfield
Prenumerera på vårt nyhetsbrev
Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!
Klicka här för att prenumerera
