Nyheter i Android, Telefoner, Prylar Och Recensioner

Hur du tränar din chatbot genom snabb teknik

En av anledningarna till att AI-baserade chatbots har tagit världen med storm de senaste månaderna är för att de kan generera eller förfina text för en mängd olika ändamål, oavsett om det är att skapa en reklamkampanj eller att skriva ett CV.

Dessa chatbots drivs av algoritmer för stora språkmodeller (LLM), som kan efterlikna mänsklig intelligens och skapa textinnehåll såväl som ljud, video, bilder och datorkod. LLM är en typ av artificiell intelligens som tränas på ett stort antal artiklar, böcker eller internetbaserade resurser och andra indata för att producera mänskliga svar på naturliga språkingångar.

Ett växande antal teknikföretag har introducerat LLM-baserade generativa AI-verktyg för kommersiellt bruk för att automatisera applikationsuppgifter. Till exempel lanserade Microsoft förra veckan en chatbot baserad på OpenAI:s ChatGPT till ett begränsat antal användare; Den är integrerad i Microsoft 365 och kan automatisera CRM- och ERP-applikationsfunktioner.

Säljstyrka

Till exempel kan den nya Microsoft 365 Copilot användas i Word för att skapa ett första utkast till ett dokument, vilket kan spara timmar av skrivande, sökning och redigering. Säljstyrka meddelade också planer på att lansera en GPT-baserad chatbot för användning med din CRM-plattform.

De flesta lärjungar, som OpenAI:s GPT-4, är förutbildade som förutsägelsemotorer för innehåll eller nästa ord; det är så de flesta företag använder dem, “out of the box” så att säga. Och medan LLM-baserade chatbots har producerat sin andel av fel, fungerar förutbildade LLM:er relativt bra på att tillhandahålla korrekt och övertygande innehåll som åtminstone kan användas som utgångspunkt.

Många industrier kräver dock mer anpassade LLM-algoritmer, de som förstår deras jargong och producerar innehåll specifikt för deras användare. LLM:er för hälso- och sjukvårdsindustrin kan till exempel behöva bearbeta och tolka elektroniska journaler (EPJ), föreslå behandlingar eller skapa en sammanfattning av patientvård baserat på medicinska anteckningar eller röstinspelningar. En LLM anpassad till finansbranschen kan sammanfatta inkomstsamtal, skapa mötesutskrifter och utföra bedrägerianalyser för att skydda konsumenterna.

I flera branscher kan det vara avgörande att säkerställa en hög grad av svarsnoggrannhet.

De flesta LLM:er kan nås via ett applikationsprogrammeringsgränssnitt (API) som låter användaren skapa parametrar eller justeringar av hur LLM svarar. En fråga eller förfrågan som skickas till en chatbot anropas en symbol, där användaren begär ett svar. Uppmaningar kan vara naturliga språkfrågor, kodavsnitt eller kommandon, men för att LMM ska kunna göra sitt jobb korrekt måste uppmaningarna vara exakta.

Och det behovet har gett upphov till en ny färdighet: snabb ingenjörskonst.

Snabb ingenjörskonst förklarad

Snabbteknik är processen att utveckla och optimera textuppmaningar för stora språkmodeller för att uppnå önskade resultat. “[It] “hjälper LLM:er för snabb iteration i produktutforskning och prototyper genom att skräddarsy LLM för att bättre anpassa sig till uppgiftsdefinitionen snabbt och enkelt”, säger Marshall Choy, senior vice president of products at SambaNova Systemen Silicon Valley-startup som tillverkar halvledare för artificiell intelligens (AI).

Kanske lika viktigt för användarna, snabb ingenjörskonst är redo att bli en viktig färdighet för affärs- och IT-proffs, enligt Eno Reyes, en maskininlärningsingenjör med Hugging Face, en gemenskapsdriven plattform som skapar och är värd för LLM.

Relaterad  Epic Games Store har startat vinterrean
Neil Lockhart/Shutterstock

“Många människor jag känner inom mjukvara, IT och konsulttjänster använder snabb teknik hela tiden för sitt personliga arbete”, sa Reyes i ett e-postsvar till . “När LLM blir alltmer integrerad i olika branscher är deras potential att förbättra produktiviteten enorm.”

Genom att effektivt använda snabb konstruktion kan företagsanvändare optimera LLM:er för att utföra sina specifika uppgifter mer effektivt och exakt, allt från kundtjänst till innehållsgenerering till dataanalys, sa Reyes.

Den mest kända LLM för tillfället, OpenAI:s GPT-3, är grunden för den populära ChatGPT chatboten. GPT-3 LLM arbetar på en 175 miljarder parametermodell som kan generera text och datorkod med korta skriftliga uppmaningar. Den senaste versionen av OpenAI, GPT-4, beräknas ha upp till 280 miljarder parametrar, vilket gör det mycket mer sannolikt att ge korrekta svar.

Tillsammans med OpenAI:s GPT LLM inkluderar populära generativa AI-plattformar öppna modeller som t.ex BLOOM av det kramande ansiktet och XLM-RoBERTa, Nvidia NeMO LLM, XLNet, ansluta sig och GLM-130B.

Eftersom snabb ingenjörskonst är en begynnande och framväxande disciplin, litar företag på broschyrer och snabbguider som ett sätt att säkerställa optimala svar från sina AI-applikationer. Marknader för annonser växer till och med fram, som t.ex Topp 100 ChatGPT-uppmaningar.

“Människor säljer till och med snabba förslag”, säger Arun Chandrasekaran, en framstående vicepresident-analytiker på Gartner Research, och tillade att den senaste tidens översvämning av uppmärksamhet kring generativ AI har belyst behovet av bättre snabbteknik.

“Det är en relativt ny domän,” sa han. “Generativa AI-applikationer förlitar sig ofta på gigantiska självövervakade AI-modeller och därför krävs mer kunskap, testning och ytterligare ansträngning för att få optimala svar från dem. “Jag är övertygad om att med ökande mognad kan vi se bättre vägledning och bästa praxis från AI-modellbyggare om effektiva sätt att få ut det mesta av AI-modeller och applikationer.”

Bra insteg är lika med bra utgång

Maskininlärningskomponenten i LLM lär sig automatiskt från indata. Utöver de data som ursprungligen användes för att skapa en LLM, som GPT-4, skapade OpenAI något som heter Förstärkningsinlärning Mänsklig feedbackdär en människa tränar modellen för hur man ger människoliknande svar.

Till exempel kommer en användare att ställa en fråga till LLM och sedan skriva det ideala svaret. Användaren kommer sedan att ställa samma fråga till modellen igen, och modellen kommer att erbjuda många andra olika svar. Om detta är en faktabaserad fråga är förhoppningen att svaret förblir detsamma; om det är en öppen fråga är målet att producera flera kreativa mänskliga svar.

Till exempel, om en användare ber ChatGPT att generera en dikt om en person som sitter på en strand på Hawaii, förväntas den generera en annan dikt varje gång. “Så vad de mänskliga tränarna gör är att de betygsätter svaren från bäst till sämst,” sa Chandrasekaran. “Det är en input till modellen för att se till att den ger ett bättre eller mer mänskligt svar, samtidigt som man försöker minimera de sämsta svaren. Men hur ramar man in frågorna? [has] ett stort inflytande på resultatet du får av en modell.”

Relaterad  Elden Ring, den öppna världen kommer att inspirera spelare att utforska och upptäcka nya saker

Organisationer kan träna en GPT-modell genom att mata in anpassade datamängder som är interna för det företaget. Till exempel kan de ta företagsdata och etikett och annotera det för att öka dess kvalitet och sedan mata in det i GPT-4-modellen. Det justerar modellen så att den kan svara på frågor som är specifika för den organisationen.

Finjustering kan också vara branschspecifik. Det finns redan en stugindustri som växer fram av startups som tar GPT-4 och får i sig en mängd information som är specifik för vertikala branscher, såsom finansiella tjänster.

“De kan få in information från Lexus-Nexus och Bloomberg, de kan få in information från SEC som 8K- och 10K-rapporter. Men poängen är att modellen lär sig mycket språk eller information som är mycket specifik för den domänen, säger Chandrasekaran. “Så finjusteringar kan ske på branschnivå eller på organisationsnivå.”

Till exempel, Harvey är en startup som samarbetade med OpenAI för att skapa vad den kallar en “copilot för advokater” eller en version av ChatGPT för jurister. Advokater kan använda den anpassade ChatGPT-chatboten för att upptäcka eventuella rättsliga företräde för vissa domare för att förbereda sitt nästa fall, sa Chandrasekaran.

“Jag ser värdet i att sälja vägbeskrivningar inte så mycket genom språk utan genom bilder,” sade Chandrasekaran. “Det finns alla typer av modeller i det generativa AI-utrymmet, inklusive text-till-bild-modeller.”

Till exempel kan en användare be en generativ AI-modell att producera en bild av en gitarrist som spelar månen. “Jag tror att text-till-bild-domänen har mer tonvikt på snabba marknader,” sa Chandrasekaran.

Hugging Face som ett heltäckande centrum för LLM

Medan Hugging Face skapar några av sina egna LLM, inklusive BLOOM, är organisationens primära funktion att vara ett nav för maskininlärningsmodeller från tredje part, som GitHub gör för kod; Hugging Face är för närvarande värd för över 100 000 modeller för maskininlärning, inklusive en mängd olika LLM:er från nystartade företag och stora teknikföretag.

Eftersom nya modeller är öppen källkod, är de allmänt tillgängliga centralt, vilket skapar en enda destination för framväxande öppen källkod LLM.

För att finjustera en LLM för ett specifikt företag eller bransch med Hugging Face kan användare dra fördel av organisationen “Transformatorer” “Datauppsättning” API:er och bibliotek. Till exempel, i finansiella tjänster kan en användare importera en förutbildad LLM som t.ex Flan-UL2, ladda en datauppsättning av finansiella nyhetsartiklar och använd “transformers”-tränaren för att ställa in modellen för att generera sammanfattningar av dessa artiklar. Integrationer med AWS, djup hastighetoch Snabba upp effektivisera och optimera träningen ytterligare.

Hela processen kan göras på mindre än 100 rader kod, enligt Reyes.

Ett annat sätt att komma igång med snabb konstruktion är Hugging Face Inference API; är en enkel HTTP-begäranslutpunkt som stöder mer än 80 000 transformatormodeller, enligt Reyes. “Detta API tillåter användare att skicka textmeddelanden och ta emot svar från modeller med öppen källkod på vår plattform, inklusive LLMs,” sa Reyes. “Om du vill gå ännu enklare kan du skicka text utan kod med hjälp av slutledningswidgeten i LLM-modellerna i Kramande ansiktskub.”

Relaterad  Ny Genshin Impact Trailer tillägnad gameplay för Yun Jin

Få-shot och no-shot-inlärning

Snabb LLM-teknik tar i allmänhet en av två former: få-shot och no-shot inlärning eller träning.

Zero-shot-inlärning innebär att mata en enkel instruktion som en prompt som ger ett förväntat svar från LLM. Den är utformad för att lära en LLM att utföra nya uppgifter utan att använda data märkta för dessa specifika uppgifter. Tänk på noll skott som förstärkningsinlärning.

Däremot använder få-shot-inlärning en liten mängd information eller exempeldata för att träna LLM för de önskade svaren. Få skott lärande Den består av tre huvudkomponenter:

  • Uppgifts beskrivning: En kort beskrivning av vad modellen ska göra, till exempel “Översätt engelska till franska”
  • Exempel: Några exempel som visar modellen vad den förväntas göra, till exempel ”havsutter => loutre de mer”
  • Omedelbar: Början av ett nytt exempel, som modellen måste slutföra genom att generera den saknade texten, till exempel “ost =>”

I verkligheten finns det få organisationer idag med skräddarsydda träningsmodeller som passar deras behov eftersom de flesta modeller fortfarande är i ett tidigt utvecklingsstadium, enligt Gartners Chandrasekaran. Och medan low-shot, no-shot-inlärning kan hjälpa, är det viktigt att lära sig snabb teknik som en färdighet för både IT- och företagsanvändare.

“Snabb ingenjörskonst är en viktig färdighet att ha idag, eftersom grundmodeller är bra för inlärning i låga skott och nollskott, men deras prestanda påverkas på många sätt av hur vi bygger anvisningarna. meddelanden metodiskt,” sade Chandrasekaran. “Beroende på användningsfall och domän kommer dessa färdigheter att vara viktiga för både IT- och affärsanvändare.”

De flesta API:er tillåter användare att tillämpa sina egna snabba tekniker. Varje gång en användare sms:ar ett LLM, finns det möjlighet att förfina uppmaningarna för att uppnå specifika resultat, enligt Reyes.

“Men den här flexibiliteten öppnar också dörren för skadliga användningsfall, såsom snabb injektion,” sa Reyes. “Fall som [Microsoft’s] Bing Sydney visade hur människor kan utnyttja snabb ingenjörskonst för oavsiktliga ändamål. “Som ett växande studieområde kommer att ta itu med snabb injektion i både skadliga användningsfall och “red teaming” för penetrationstestning avgörande för framtiden, vilket säkerställer en ansvarsfull och säker användning av LLMs i olika applikationer.”