Spotify, världens största musikstreamingtjänst, har tilldelats ett patent för taligenkänningsteknik för att analysera en användares röst för att sluta sig till kön, ålder och miljö. Med tanke på företagets övriga utveckling är det tydligt att Spotify, efter att ha vunnit våra öron, nu också är ute efter våra röster.
Men varför skulle Spotify vilja utveckla den här typen av taligenkänning, och vad skulle den användas till? Låt oss gräva i patentet och dess konsekvenser.
Spotifys patent för taligenkänning
2018 skickade Spotify in en patentansökan med titeln “Identifiering av smakattribut från en ljudsignal.” Efter nästan tre års väntan beviljades patentet i januari 2021. Som namnet antyder kör arkiveringsdetaljerna i princip ett system som kan ta inspelat ljud från din miljö, med eller utan tal, genom en uppsättning av algoritmer och använd den resulterande analysen för att spela musik som passar din demografiska och nuvarande miljö.
Patentet listar några exempel på hur algoritmen kan kategorisera data, inklusive kön, ålder, accent, känslomässigt tillstånd, fysisk miljö och antalet personer. Anmälan fortsätter dock att notera att detta inte är en uttömmande lista, bara några exempel på hur företaget kan märka inspelat ljud. Utöver dessa metadata föreslår patentet att Spotify också kan analysera ditt tal.
Vad skulle Spotify kunna använda taligenkänning till?
För närvarande finns det inget som tyder på att Spotify har utvecklat det föreslagna systemet som beskrivs i patentet. Det är dock i linje med några andra projekt som musikströmningstjänsten har arbetat med. Inte långt efter att patentet beviljades i början av 2021 rullade Spotify ut en röststyrningsfunktion. Med hjälp av väckordet “Hey, Spotify” kan du styra musikuppspelningen i appen enbart med röstkommandon.
Eftersom Spotify är en mobilapp snarare än en röstassistent på systemnivå som Siri eller Google Assistant, finns det vissa begränsningar. Till exempel måste appen vara öppen, Spotify måste ha tillgång till din mikrofon och din smartphones skärm måste vara upplåst och påslagen. Om streamingtjänsten hoppas kunna bygga ett mer heltäckande system skulle den behöva åtkomst på systemnivå eller egen hårdvara.
Under 2019 testade Spotify en fordonsbaserad hårdvaruenhet känd som Car Thing. I ett Spotify Newsroom-inlägg vid den tiden sa företaget att enheten skulle tillåta vissa Spotify Premium-användare i USA att lyssna på musik och poddsändningar i sin bil med hjälp av den röststyrda Car Thing. Den noterade också att de var ute efter att utföra liknande tester som kallas Voice Thing och Home Thing.
Det var dock inte mycket känt om testerna eller om Spotify hade planer på att rulla ut dem mer allmänt. I januari 2021, två dagar efter att patentet tilldelades, lämnade Spotify in nya listor till FCC för en omdesignad Car Thing med Bluetooth-funktionalitet. Även om det inte finns någon officiell bekräftelse på ett releasedatum, verkar det som att företaget väntade på ljudanalyspatentet innan de gick vidare med sina hårdvaruplaner.
Problemet med maskininlärning
Även om det blir allt vanligare är system med artificiell intelligens inte riktigt så smarta som de från början låter. De flesta använder maskininlärning, där systemet får en uppsättning träningsdata att lära sig av. I det här fallet kan det ha varit några ljudinspelningar, kategoriserade efter kön och plats. AI:n börjar förstå hur man upptäcker skillnaderna den ser i träningsdata och sorterar dem därefter.
Men det är här det ibland uppstår problem. Alla har olika röst, accent och ton. I de flesta fall kan vi lyfta luren och avgöra om vi känner personen i andra änden, och i så fall vem det är. Detta är utan någon visuell uppmaning heller, vilket visar hur unik varje röst är. En uppsättning träningsdata kommer aldrig att kunna fånga den detaljnivån och nyansen.
Följaktligen kommer det att finnas tillfällen som AI gör antaganden så att den kan producera ett resultat. Om den ingående rösten är något lägre kan den betecknas som en mansröst. På samma sätt kan det omvända vara sant, där toner med högre tonhöjd markeras som kvinnor, till exempel.
Tyvärr är detta inte bara en teoretisk risk, eftersom det har funnits många högprofilerade fall där maskininlärningsalgoritmer har gått fel.
Konsekvenserna av Spotifys system
När de trycks på, skulle de flesta människor kämpa för att identifiera en obekant accent exakt, och det är med en livstid av upplevelser och minnen att hämta ur. Maskininlärningssystemet kommer bara att veta vad som fanns i träningsdatan, vilket lämnar det att göra ännu fler antaganden. Det är lätt att se hur detta kan leda till potentiellt problematiska eller till och med rasistiska resultat.
Detta är inte heller utan företräde. År 2015 märkte Jacky Alciné, en mjukvaruingenjör, att Google Photos identifierade hans svarta vänner som gorillor. Efter en onlinereaktion påstod sig Google ha tagit hand om denna känsliga fråga. WIRED rapporterade dock 2018 att Google inte hade åtgärdat det underliggande bildkategoriseringsproblemet. Istället hade företaget bara blockerat termer relaterade till vissa primater som gorilla, apa och schimpans från sitt klassificeringssystem.
Spotifys föreslagna system har också potentiella integritetsproblem. För att fungera på det sätt företaget förväntar sig, skulle taligenkänningsfunktionen behöva kontinuerligt övervaka vad du säger och miljön du befinner dig i. Alltid-på-förmågan är en personlig integritetsfråga men kan också leda till invasiv brottsbekämpning eller statlig övervakning.
Vissa är också försiktiga med funktionen för känsloupptäckt. Som beskrivits skulle Spotifys algoritm identifiera ditt känslomässiga tillstånd och spela stämningsanpassad musik när ditt ljud har analyserats. Detta underbyggs dock av antagandet att om du befinner dig i en viss headspace, vill du stanna där genom musik. Det är också öppet för missbruk av teknikföretag.
Till exempel, 2012 utförde Facebook ett hemligt experiment genom att visa positivt eller negativt innehåll i mer än en halv miljon användares flöden för att se hur det påverkade deras känslomässiga tillstånd. Av dessa skäl skickade Access Now, en människorättsorganisation, ett öppet brev till Spotify och bad företaget att överge systemet.
Framtiden för personlig musik?
Spotify var ett av de första företagen att skapa en övertygande musikstreamingtjänst. Gränssnittet och den stora katalogen gör den till en favorit över hela världen. Tjänsten integreras också fint med de flesta digitala assistenter och smarta hemutrustningar. Genom åren har företaget gjort det enkelt för dig att upptäcka ny musik eller njuta av dina favoriter med algoritmiskt genererade spellistor.
I teorin borde taligenkänning som alltid är på ta denna anpassning ett steg längre, så streamingtjänsten kan passivt ta in ditt humör och din miljö för att spela den bästa musiken för dig vid rätt tidpunkt. Teknikens alltid lyssnande karaktär har dock långtgående integritetsimplikationer som kan uppväga all bekvämlighet som plattformen erbjuder.
Om författaren
James Frew (297 publicerade artiklar)
James är en erfaren teknikjournalist och var tidigare MakeUseOfs Buyer’s Guide Editor. Hans mål är att göra teknik tillgänglig och säker för alla. Medan han tog examen med en BIng i maskinteknik, brinner han också för mental hälsa, hållbarhet och musik.
Mer från James Frew
Prenumerera på vårt nyhetsbrev
Gå med i vårt nyhetsbrev för tekniska tips, recensioner, gratis e-böcker och exklusiva erbjudanden!
Klicka här för att prenumerera
