Nyheter i Android, Telefoner, Prylar Och Recensioner

Vad är datorseende och varför spelar det någon roll?

När en människa tittar på en scen eller en bild förstår de det – vilka föremål som finns i den och vad som händer om handling äger rum. En dator, å andra sidan, bearbetar bara digital data som beskriver färgvärdet för varje pixel. För en människa är det enkelt att känna igen en pizza på ett rörigt bord. Men tills nyligen skulle datorer inte kunna utföra samma uppgift.

Datorseende, eller CV, gör det möjligt för en dator att kunna plocka ut viktig information från visuella input och göra korrekta förutsägelser och rekommendationer baserat på den informationen.

Hur fungerar datorseende?

Innan datorseende, för att skapa ett program som kände igen en viss bild, skulle en person behöva göra timmar av manuellt benarbete. För det första skulle en databas med liknande bilder behöva sammanställas.

Sedan skulle dessa bilder behöva analyseras manuellt, mätas och kommenteras med relevant data som forskaren trodde kunde identifiera objektet i fråga (som färg, mått och form). Först då kunde programvara användas för att göra förutsägelser.

Å andra sidan automatiserar datorseende hela denna process med en maskininlärningsmetod som kallas djupinlärning. Deep learning använder ett flerskiktigt neuralt nätverk med hundratals potentiella lager. När det gäller bilder är detta vanligtvis ett konvolutionellt neuralt nätverk (CNN).

Att förklara i detalj hur djupinlärning och neurala nätverk fungerar ligger långt utanför ramen för denna artikel. I grund och botten matas stora mängder data in i det neurala nätverket. Det neurala nätverket analyserar data upprepade gånger tills det kan bilda korrekta förutsägelser om det.

När det gäller en CNN som används för en datorseendeuppgift tar det neurala nätverket data genom flera steg. För det första kollapsar den bilden i flera delar (enskilda pixlar eller grupper av pixlar som är taggade i förväg).

Relaterad  eFootball (PES 2022) är på fel spår. Uppdatering försenad!

Sedan gör den förutsägelser om vad som finns i olika delar av bilden (som hårda kanter eller specifika objekt). Den kontrollerar noggrannheten av dessa förutsägelser upprepade gånger och ändrar en del av algoritmen varje gång tills den blir mycket exakt.

Datorer är nu så kraftfulla att de kan analysera en bild mycket snabbare än den mänskliga hjärnan, särskilt när de har lärt sig att känna igen vissa mönster. På så sätt är det lätt att se hur en djupinlärningsalgoritm kan överträffa mänskliga förmågor.

Vilka är typerna av datorseende?

Datorseende innebär att analysera och förstå bilder och resultatet av relevanta förutsägelser eller beslut om bilderna. Det finns olika uppgifter som datorseende kommer att använda för att uppnå dessa mål. Några av dessa inkluderar:

Bildklassificering: Typen av bild känns igen. Till exempel om det är en persons ansikte, landskap eller föremål. Den här typen av uppgifter kan användas för att snabbt identifiera och klassificera bilder. En användning för detta är att automatiskt känna igen och blockera olämpligt innehåll på sociala medier. Objektigenkänning: I likhet med bildklassificering kan objektigenkänning identifiera ett visst objekt i en scen – som en pizza på ett rörigt bord. Kantdetektering: En vanlig användning av datorseende, och vanligtvis det första steget i objektdetektering, är att identifiera de hårda kanterna i en bild. Objektidentifiering: Detta är igenkännandet av individuella exempel på ett objekt eller en bild, som att identifiera en viss person, fingeravtryck eller fordon. Objektidentifiering: Detektion är identifieringen av en viss egenskap i en bild, som ett frakturerat ben i en röntgen. Objektsegmentering: Detta är identifieringen av vilka pixlar i bilden som tillhör objektet i fråga. Objektspårning: I en videosekvens, när ett objekt har identifierats, kan det enkelt spåras genom hela videon. Bildåterställning: Suddighet, brus och andra bildartefakter kan tas bort genom att noggrant identifiera var objektet mot bakgrunden är i bilden.

Relaterad  Amazons nya Echo-högtalare kommer med en pekskärm

Exempel på datorseende

Artificiell intelligens används redan i flera branscher med en svindlande effekt, vilket är sant för datorseende. Här är några exempel på CV som redan används idag.

Ansiktsigenkänning

Ansiktsigenkänning är ett av de viktigaste sätten att datorseende används idag. Jämfört med databaser med kända ansikten kan datorseendealgoritmer mycket exakt identifiera enskilda personer.

Sociala medier analyserar bilder och taggar automatiskt användare som de har ett bra urval av bilder för. Bärbara datorer, telefoner och säkerhetsenheter kan identifiera personer för att tillåta åtkomst. Brottsbekämpande myndigheter använder ansiktsigenkänning i CCTV-system för att identifiera misstänkta.

Medicin

Datorseende används för närvarande inom vården för att ge snabbare och mer exakta diagnoser än experter kan ställa. Många applikationer involverar analys av röntgen-, CT- eller MRI-bilder för särskilda tillstånd, inklusive neurologiska sjukdomar, tumörer och brutna eller frakturerade ben.

Självkörande bilar

Autonoma fordon måste förstå sin omgivning för att kunna köra säkert. Det innebär att känna igen vägar, körfält, trafiksignaler, andra fordon, fotgängare och mer. Alla dessa uppgifter använder datorseendesystem i realtid för att undvika kollisioner och köra säkert.

Datorseende är utmanande

De nuvarande tillämpningarna av datorseende börjar redan förändra hur vi arbetar i olika branscher. Från att kunna upptäcka felaktig eller trasig utrustning till att korrekt diagnostisera cancer, datorseende har förmågan att förbättra system och rädda liv.

Men det är inte utan sina utmaningar. Datorseende är fortfarande långt ifrån vad mänskligt syn är. Vi har tusentals år av evolution som gör det möjligt för oss att känna igen och förstå nästan allt som händer omkring oss i realtid. Men vi har ingen aning om hur mänskliga hjärnor utför dessa uppgifter.

Relaterad  Clid the Snail: top-down shooter nu även tillgängligt för PC – det finns också en lanseringstrailer att se

Deep learning är ett enormt steg i rätt riktning, men det kräver fortfarande otroligt mycket arbete för att skapa ett system som kan utföra en uppgift som människor kan göra mycket enkelt, som att identifiera en bil på vägen. Detta beror på att datorer utför begränsade uppgifter mycket effektivt. Att utveckla en dator som kan förstå den totala komplexiteten i den visuella världen är ett helt annat bollspel.

När mer forskning går in på både AI-tillämpningar och mänsklig biologi, kommer vi sannolikt att se en explosion av möjliga användningsområden för datorseende inom en snar framtid.

Om författaren

Jake Harfield (40 artiklar publicerade)

Jake Harfield är en frilansskribent baserad i Perth, Australien. När han inte skriver är han vanligtvis ute i bushen och fotograferar det lokala djurlivet. Du kan besöka honom på www.jakeharfield.com

Mer från Jake Harfield

Prenumerera på vårt nyhetsbrev

Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!

Klicka här för att prenumerera

Table of Contents