Webbskrapning innebär insamling av information i form av data från webbplatser eller sidor. Även om din kanske inte är en medveten handling, har du skrapat webben på ett eller annat sätt samtidigt som du samlar in information. Men det är oftast subtilt.
Webbskrapning eller skärmskrapning är i allmänhet en målmedveten handling, och proffs automatiserar designen för att få enorma data. Oavsett om de kopierar texter på en webbplats manuellt, använder dedikerade verktyg eller skriver webbskrapningsskript, slår webbskrapor ibland hårt på en webbplats genom att göra flera förfrågningar samtidigt.
Men även om många företag nu utnyttjar webbskrapning för att skapa konkurrensfördelar, är det faktiskt lagligt?
Vilka webbplatser bör och bör du inte skrapa?
Internet är en samling information som ger människor tillgång till gamla data och realtidsdata. Webbskrapning eller skärmskrapning har funnits ett tag nu. Men hur mycket ska du använda det och vilka webbplatser kan du skrapa?
Vissa webbplatser är stränga med sökrobotar eller skärmskrapor och blockerar dem helt. Så det är uppenbart att du inte ska skrapa sådana webbplatser. Men folk gör det fortfarande.
Tyvärr finns det knappast något annat sådana sajter kan göra för att stoppa det än att lappa kryphålen.
Innan du skrapar en webbplats bör du helst kontrollera om den tillåter genomsökning eller inte. Vanligtvis kan du ta reda på det genom att kontrollera webbplatsens robots.txt-fil. Du kan göra detta genom att skriva in “[website URL]/robots.txt”.
En robots.txt anger vanligtvis regler för olika sökrobotar eller användaragenter. Dessa regler varierar dock beroende på vilken webbplats som är inblandad. Medan vissa webbplatser tillåter genomsökning på alla sidor, vissa anger vilka sidor som en bot kan genomsöka, och vissa blockerar sökrobotar direkt.
En webbplats som blockerar alla användaragenter från att genomsöka alla sidor anger vanligtvis följande regler:
user-agent: *
Disallow: /
En robots.txt-fil som blockerar alla botar från att genomsöka vissa kataloger eller sidor ser vanligtvis ut så här:
user-agent: *
Disallow: /URL to page 1
Disallow : /URL to page 2
Om robots.txt inte tillåter att sidan du vill genomsöka kan du förmodligen skrapa den. Annars bör du backa eller begära administratörens samtycke. De kan ge dig tillgång.
Vissa webbplatser anger dessutom uttryckligen om de tillåter genomsökning eller inte i sina användarvillkor. Vissa anger detta även överst i sin robots.txt. Kolla alltid upp det också för att vara säker på att du gör rätt.
Hur webbskrapning missbrukas
Så om du har fått skräppostmeddelanden eller SMS från webbplatser eller personer som du aldrig försett med din personliga information, så har du förmodligen blivit skrapad någonstans, på något sätt. Och mestadels är det via ett av dina sociala mediers handtag.
Som sagt, webbskrapning är ibland mer än att bara samla in data som återges till frontend. Om det används uppsåtligt kan det resultera i läckage av personlig och sekretessbelagd information.
Medan de flesta sociala medieplattformar rynkar på näsan åt det, kommer krypande bots fortfarande åt folks profiler, och deras kontaktinformation läcker och skrapas.
Facebook har till exempel rapporterats ha sårbarheter som läckt ut användarnas kontaktuppgifter tidigare, även om användarna håller dem privata.
På samma sätt drabbades LinkedIn nyligen av ett säkerhetsintrång som resulterade i läckage av personuppgifter som tillhör över 500 miljoner konton. Följaktligen resulterade den sårbarheten i att många e-postadresser och telefonnummer delades utan medgivande från profilägarna.
Är det olagligt att skrapa en webbplats?
Det har aldrig kommit någon slutsats om lagligheten av webbskrapning. Fokus ligger istället på hur en sökrobot fungerar från fall till fall och vad de använder den insamlade informationen för att uppnå.
Så snarare än att dra slutsatser om dess laglighet är skrapning, när det görs med uppsåt, olagligt. Men om det görs klokt är det inte olagligt.
Men som förväntat verkar det finnas en strängare policy för skrapning och användning av sociala medier eftersom användarnas integritet är så viktig. Men allt handlar fortfarande om hur människor skrapar data.
Internet & Social Media Law Blog analyserade fallet med hiQ Labs, ett dataskrapningsföretag som vann en rättegång mot LinkedIn 2019 efter att ha försökt blockera hiQ Labs från att skrapa offentligt tillgängliga LinkedIn-användares data.
Med hiQ Labs som hävdade att Computer Fraud and Abuse Act (CFAA) endast förbjuder obehörig åtkomst, bekräftade domen att LinkedIns data var allmänt tillgänglig, så alla som skrapade dem gjorde det för att de är tillgängliga.
Dessutom använde hiQ Labs bara den skrapade informationen för att tillhandahålla analyslösningar till företag – så att de kan fatta bättre rekryteringsbeslut.
Däremot stämde Facebook nyligen utvecklare av Chrome-tillägg som skrapade Facebook-användares profiler utan deras samtycke.
På samma sätt stämdes en copycat-sajt av Facebook för att ha skrapat flera Instagram-användares profilinformation och sedan använda dessa för att skapa kloner. Enligt den rapporten gick Facebook sedan längre för att få ett permanent domstolsföreläggande mot gärningsmannen.
Det här är några fall där människor kan ha använt webbskrapning illegalt. De nämnda företagen samlade in Facebook-användares data bedrägligt, utan samtycke från dess användare. Så det bröt mot integritetspolicyn.
Så även om webbskrapning kan frustrera webbplatsen som den hämtar data från, hindrar för närvarande ingen allmän regel människor från att få vad de vill, så länge de inte bryter mot internetlagarna direkt.
Är webbskrapning synonymt med hacking?
Det finns några myter kring webbskrapning. En av dessa är tron att skrapa en webbplats betyder att du har hackat den. Även om hackning så småningom kan leda till att data skrapas, stämmer inte påståendet att själva termen innebär att man hackar en webbplats.
Webbskrapning kan involvera användning av dedikerade genomsöknings- eller skrapningsverktyg, Application Programming Interfaces (API) eller webbskrapningsskript för att hämta renderade data från en webbplats. Till skillnad från hacking, äventyrar det varken webbplatsen det skrapar eller stör upplevelsen för sina användare.
Så även om hacking involverar obehörig åtkomst, vanligtvis till en webbplatss databas, riktar webbskrapning endast data som redan är synliga i användargränssnittet. Även om människor kan använda webbskrapning på ett skadligt sätt, är det fortfarande inte synonymt med hacking.
Utöver det, till skillnad från webbskrapning, är avsiktlig och oetisk hackning olagligt.
Vilka är fördelarna med webbskrapning?
Webbskrapning har många positiva sidor, och även vissa teknikföretag erbjuder nu sina data för free genom API:er. Den informationen räcker vanligtvis inte för att bedöma affärstrender och fatta beslut.
Så företag får nu mer data genom att skrapa webben för att förbättra metoder och öka försäljningen. Dessutom matar dataforskare maskininlärningsalgoritmer med data som samlats in via skärmskrapning.
Sådan data kan vara bilder som används i bildigenkänning, vanlig text för sentimentanalys eller direkt produktdata för marknadsintelligens och konsumentbeteendeanalys.
Så webbskrapning är ännu mer användbart eftersom om du har tillgång till information som din konkurrent inte har, kan du slå dem.
Medan vissa webbplatser rynkar på näsan åt webbskrapor, bryr sig vissa, till och med e-handelstjänster, inte om du skrapar deras data eller inte. Webbjättar som eBay och Salesforce startade sitt API år 2000 och erbjöd programmerare tillgång till offentliga data för första gången.
Ska du verkligen skrapa webben?
Vi har konstaterat att webbskrapning inte är olagligt när det görs på rätt sätt. Men vad du gör med den information du skrapar är också ett bekymmer. Så istället för att missbruka detta, använd det för att få fler insikter som hjälper dig och andra att fatta välgrundade beslut.
Men webbskrapning som en färdighet ger dig tillgång till stora bitar av internetdata, vilket kan hjälpa dig eller ditt företag att hålla sig ovanför affärsnischen. Som datavetare breddar det till och med ditt räckvidd och förbättrar dina kodnings- och tekniska färdigheter.
Till exempel är Python ett av programmeringsspråken som hjälper dig att enkelt skrapa en webbplats med dess Beautiful Soup-bibliotek eller Scrapy-ramverk.
Om författaren
Idowu Omisola (123 artiklar publicerade)
Idowu brinner för allt smart teknik och produktivitet. I hans free tid, han leker med kodning och byter till schackbrädet när han har tråkigt, men han älskar också att bryta sig loss från rutinen då och då. Hans passion för att visa människor vägen runt modern teknik motiverar honom att skriva mer.
Mer från Idowu Omisola
Prenumerera på vårt nyhetsbrev
Gå med i vårt nyhetsbrev för tekniska tips, recensioner, free e-böcker och exklusiva erbjudanden!
Klicka här för att prenumerera
