Teknik för röstigenkänning har en rik historia av utveckling som har lett den till vad den är idag. Det är kärnan i det moderna livet, vilket ger oss möjligheten att utföra uppgifter bara genom att prata med en enhet. Så, hur har denna häpnadsväckande teknik utvecklats under åren? Låt oss ta en titt.
1952: Audrey-systemet
Det första steget i röstigenkänning kom i början av 1950-talet. Bell Laboratories utvecklade den första maskinen som kunde förstå den mänskliga rösten 1952, och den fick namnet Audrey System. Namnet Audrey var en sorts sammandragning av frasen Automatisk sifferigenkänning. Även om detta var en stor innovation, hade den några stora begränsningar.
Mest framträdande, Audrey kunde bara känna igen de numeriska siffrorna 0-9, inga ord. Audrey skulle ge feedback när talaren sa ett nummer genom att tända 1 av 10 glödlampor, var och en motsvarar en siffra.
Bildkredit: metamorworks/Shutterstock.com
Även om den kunde förstå siffrorna med 90 % noggrannhet, var Audrey begränsad till en specifik rösttyp. Det är därför den enda personen som verkligen skulle använda det var HK Davis, en av utvecklarna. När en siffra talades måste talaren vänta minst 300 millisekunder innan han säger nästa.
Den var inte bara begränsad i funktionalitet, utan den var också begränsad i användbarhet. Det var inte mycket nytta för en maskin som bara kunde förstå siffror. En möjlig användning var att slå telefonnummer, men det gick mycket snabbare och enklare att slå numren för hand. Även om Audrey inte hade en graciös tillvaro, står den fortfarande som en stor milstolpe i mänsklig prestation.
1962: IBMs skokartong
Ett decennium efter Audrey försökte IBM utveckla ett röstigenkänningssystem. På världsutställningen 1962 visade IBM upp ett röstigenkänningssystem vid namn Showbox. Precis som Audrey var dess huvudsakliga uppgift att förstå siffrorna 0-9, men den kunde också förstå sex ord: plus, minus, falskt, totalt, delsumma och av.
Shoebox var en matematikmaskin som kunde göra enkla räkneuppgifter. När det gäller feedback, istället för lampor, kunde Shoebox skriva ut resultaten på papper. Detta gjorde det användbart som en miniräknare, även om talaren fortfarande skulle behöva pausa mellan varje siffra/ord.
1971: IBMs automatiska samtalsidentifiering
Efter Audrey och Shoebox utvecklade andra labb runt om i världen röstigenkänningsteknik. Det tog dock inte fart förrän på 1970-talet, när IBM 1971 tog ut den första uppfinningen i sitt slag på marknaden. Det kallades det automatiska samtalsidentifieringssystemet. Det var det första röstigenkänningssystemet som användes över telefonsystemet.
Ingenjörer skulle ringa och kopplas till en dator i Raleigh, North Carolina. Den som ringer skulle sedan uttala ett av de 5 000 orden i dess ordförråd och få ett “talat” svar som svar.
1976: Harpy
I början av 1970-talet intresserade sig det amerikanska försvarsdepartementet för röstigenkänning. DARPA (Defence Advanced Research Projects Agency) utvecklade programmet Speech Understanding Research (SUR) 1971. Detta program gav finansiering till flera företag och universitet för att stödja forskning och utveckling för röstigenkänning.
1976, på grund av SUR, utvecklade Carnegie Mellon University Harpy System. Detta var ett stort steg i tekniken för röstigenkänning. Systemen fram till dess kunde förstå ord och siffror, men Harpy var unik genom att den kunde förstå hela meningar.
Den hade ett ordförråd på bara omkring 1 011 ord, vilket, enligt en publikation av B. Lowerre och R. Reddy, motsvarade mer än en biljon olika möjliga meningar. Publikationen anger sedan att Harpy kunde förstå ord med 93,77 % noggrannhet.
1980-talet: Den dolda Markov-metoden
1980-talet var en avgörande tid för röstigenkänningsteknik, eftersom detta är årtiondet där röstigenkänningsteknik, eftersom detta var årtiondet då vi introducerades till Hidden Markov Method (HMM). Den främsta drivkraften bakom HMM är sannolikhet.
Närhelst ett system registrerar ett fonem (det minsta elementet i tal), finns det en viss sannolikhet för vad nästa kommer att bli. HMM använder dessa sannolikheter för att bestämma vilket fonem som med största sannolikhet kommer härnäst och bildar de mest sannolika orden. De flesta röstigenkänningssystem använder fortfarande HMM för att förstå tal.
1990-talet: Röstigenkänning når konsumentmarknaden
Sedan uppfattningen om röstigenkänningsteknik har den varit på en resa för att hitta ett utrymme på konsumentmarknaden. På 1980-talet visade IBM upp en prototypdator som kunde diktera tal till text. Men det var inte förrän i början av 1990-talet som folk började se sådana här applikationer i sina hem.
1990 introducerade Dragon Systems den första programvaran för tal-till-text-diktering. Den hette Dragon Dictate, och den släpptes ursprungligen för Windows. Detta $9 000-program var revolutionerande för att ge röstigenkänningsteknik till massorna, men det fanns en brist. Programvaran som används diskret diktering, vilket betyder att användaren måste pausa mellan varje ord för att programmet ska kunna ta upp dem.
1996 bidrog IBM igen till branschen med Medspeak. Detta var också ett tal-till-text-dikteringsprogram, men det led inte av diskret diktering som Dragon Dictate gjorde. Istället kunde detta program diktera kontinuerligt tal, vilket gjorde det till en mer övertygande produkt.
2010: En tjej som heter Siri
Under hela 2000-talet exploderade tekniken för röstigenkänning i popularitet. Det implementerades i mer mjukvara och hårdvara än någonsin tidigare, och ett avgörande steg i utvecklingen av röstigenkänning var Siri, den digitala assistenten. 2010 introducerade ett företag vid namn Siri den virtuella assistenten som en iOS-app.
På den tiden var Siri en imponerande mjukvara som kunde diktera vad talaren sa och ge ett utbildat och kvickt svar. Det här programmet var så imponerande att Apple förvärvade företaget samma år och gav Siri lite av en översyn och drev det mot den digitala assistent vi känner idag.
Det var genom Apple som Siri fick sin ikoniska röst (röst av Susan Benett) och en mängd nya funktioner. Den använder naturlig språkbehandling för att kontrollera de flesta av systemets funktioner.
2010-talet: De fyra stora digitala assistenterna
Som det ser ut dominerar fyra stora digitala assistenter röstigenkänning och ytterligare programvara.
Siri finns i nästan alla Apples produkter: iPhones, iPods, iPads och Mac-datorer. Google Assistant finns på de flesta av de över 3 miljarder Android-enheter på marknaden. Dessutom kan användare använda kommandon i många Google-tjänster, som Google Home. Amazon Alexa har inte mycket av en dedikerad plattform där den bor, men det är fortfarande en framstående assistent. Den är tillgänglig för nedladdning och användning på Android-enheter, Apple-enheter. och även utvalda bärbara Lenovo-datorer Bixby är den senaste posten till den digitala assistentlistan. Det är Samsungs hemodlade digitala assistent, och den finns bland företagets telefoner och surfplattor.
En talad historia
Röstigenkänning har kommit långt sedan Audrey-dagarna. Det har gjort stora vinster på flera områden; till exempel, enligt Clear Bridge Mobile, gynnades det medicinska området av röststyrda chatbots under pandemin 2020. Från att bara kunna förstå siffror till att förstå olika varianter av hela meningar, har röstigenkänning visat sig vara en av de mest användbara teknik i vår moderna tid.
Om författaren
Arthur Brown (38 artiklar publicerade)
Arthur är en teknisk journalist och musiker som bor i Amerika. Han har varit i branschen i nästan ett decennium, efter att ha skrivit för onlinepublikationer som Android Headlines. Han har en djup kunskap om Android och ChromeOS. Tillsammans med att skriva informationsartiklar är han också skicklig på att rapportera tekniska nyheter.
Mer från Arthur Brown
Prenumerera på vårt nyhetsbrev
Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!
Klicka här för att prenumerera
