Nyheter i Android, Telefoner, Prylar Och Recensioner

Hur VK med RSK introducerades i LSS-servrar

Ekosystemet för VK-projekt betjänas nu av cirka 60 tusen servrar, som förbrukar mer än ett dussin megawatt. Varje år läggs minst 5 tusen nya maskiner till dem, och fler och mer kraftfulla. Men elen blir inte billigare och det måste göras något åt ​​det

När man bygger och underhåller en infrastruktur av denna skala är det nödvändigt att ta hänsyn till många parametrar, bland vilka även de minsta vid första anblicken kan drastiskt påverka den totala ägandekostnaden (TCO), som alla hyperskalare strävar efter att minimera. Stanislav Zakirov, Director of Infrastructure Development på VK, berättade hur processen med att välja utrustning går till och varför vi bestämde oss för att prova ett vätskekylningssystem (LSS) i servrar.

När VK – och detta är inte bara VKontakte, utan också en mängd andra tjänster, inklusive Odnoklassniki, Mail.RU, Citymobil, Delivery Club, etc. – har inställningen till att bygga infrastruktur förändrats avsevärt under de senaste åren. Ett separat testlaboratorium ansvarar för valet av hårdvaruplattform, som studerar mängden hårdvara, inklusive de som ännu inte har släppts. En av de viktigaste parametrarna att tänka på när man väljer är prestanda per watt, eftersom denna parameter har en dramatisk effekt på framtida driftskostnader och därmed på TCO-uppskattningen.

Urvalet baseras på syntetiska tester, men sedan faller kandidaterna i händerna på ingenjörer som ser hur de klarar av verklig belastning, data och i den verkliga miljön. En hel del mätvärden tas bort från CPU, inklusive till exempel belastningsnivå, svarstid, cachemissar etc. Huvudkravet är att det nya systemet klarar de mest krävande och stora interna kundernas uppgifter så effektivt som möjligt i termer av kostnad per enhet användbar prestanda.

Den kraft som är onödig för mindre krävande uppgifter utnyttjas fortfarande till viss del, vilket underlättas av övergången till molnmodellen (i synnerhet containerisering och virtualisering) och mjukvarudefinierade lösningar, i kombination med kompetent orkestrering. Faktum är att i detta utvecklingsstadium har VK kommit till ett logiskt slut – alla nya maskiner har en enhetlig plattform med en enda processorversion, på vilken CPU-noder, GPU-noder och lagringssystem är byggda.

Bild: VK

Den nuvarande generationen servrar är baserad på plattformar med två sockel med Intel Xeon Platinum 8380 (40C / 80T, 2,3 / 3,40 GHz, L3-cache 60 MB, TDP 270 W). Enkelt uttryckt använder den den äldsta Intel-processorn för tillfället. Nu finns det bara en CPU och plattformen är också en. De köps mer och mer i stora volymer, vilket är mycket bekvämare och mer lönsamt när det gäller service och gör att du kan få en betydande prisvinst. Så betydande att till och med användningen av två eller tre plattformar med olika CPU:er och kringutrustning under de nuvarande förhållandena och med nuvarande VK-förfrågningar visar sig vara dyrare i genomsnitt.

Och detta är även utan att ta hänsyn till ytterligare faktorer som ytterligare inköp av processorer och andra komponenter i framtiden, för ju större intervall som används, desto svårare blir det att göra detta. Men varje hyperscaler har sin egen, mycket intressanta matematik. Du kan till exempel titta på design OCP-servrarna Meta (Facebook), och ännu bättre – till den nya AWS-plattformen, som “nådde toppen”. AWS använder till övervägande del sina egna datacenter och flyttar aktivt till en plattform med sin egen CPU Graviton3… Vilket för oss till frågan om driftskostnader, eller snarare, balansen mellan CAPEX och OPEX.

Relaterad  Vad är “Ta bort denna följare” på Twitter, hur man använder och vad händer?

Bild: VK

VK har nu bara två egna datacenter – i Moskva och St. Petersburg, och allt annat faller på hyrda platser i andra datacenter, och inte alltid de nyaste. Detta har sina konsekvenser. Den ökade tätheten av datorkraft inom en enda nod leder till behovet av mer komplexa beräkningar för kraft och kylning i racket och, vidare, datacentret. Så för den nya plattformen valdes ett 2U-chassi helt enkelt för att det är möjligt att installera större fläktar i det, vilket minskar deras rotationshastighet och strömförbrukning, vilket snabbt ökar när belastningen på hårdvaran ökar.

Faktum är att i moderna plattformar med ett par processorer, vars TDP närmar sig 300 W (ännu högre på toppen) och andra komponenter (även upp till 200 W), kan bara fläktarna förbruka ytterligare en tredjedel av förbrukningsnivån av själva hårdvaran. Samtidigt är det fortfarande relativt enkelt att skala effekt från 5-7 kW per rack, typiskt för kommersiella datacenter (med deras faktiska genomsnittliga effektbelastning, grovt sett, på nivån två tredjedelar). Men kylning är inte alltid fallet. Och vi har ännu inte pratat om system med acceleratorer, där bara “kisel” förbrukar 3 kW eller mer.

Utgång? Det första sättet är att drastiskt minska tätheten av utrustningsplacering i rack, vilket oftast är olönsamt ur TCO-synpunkt både i ditt datacenter och för hyrda ägare, särskilt när de är belägna där kostnaden för mark är en betydande kostnad objekt när du bygger ett datacenter. Dessutom komplicerar det underhållet av anslutningar och ökar kostnaderna för nätverksinfrastrukturen. Det andra är att skapa dina egna optimerade noder och datacenter, där du redan kan spara på utbyggnadsskalan, som stora hyperskalare gör. Det tredje är att förbättra kylningseffektiviteten. Men hur exakt är en separat fråga.

Det kan bli kostsamt att öka produktionen av kyla för traditionell luftkylning, och det är inte alltid möjligt att övertala datacenteroperatören (din egen eller någon annans, ny eller gammal) att installera till exempel ett par kylaggregat till (och detta är inte bara extra utrymme, utan också el). , och ofta inte ens tekniskt genomförbart. Ett kompromissalternativ är LSS, som har en högre effektivitet, men som om det inte är nedsänkningssystem kan vara relativt lätta att implementera även i den befintliga infrastrukturen. Ja, inte alltid och inte överallt. Ja, kapitalutgifterna kommer att vara något högre än för den klassiska “luften”, men på lång sikt kan du potentiellt spara betydligt på operationssalar.

Generellt sett är det nödvändigt att göra separata beräkningar för varje enskilt fall, men om det finns möjlighet att testa LSS på befintliga anläggningar, och det finns planer på att ytterligare bygga ut infrastrukturen, där kraftfulla system med acceleratorer inte kan undvaras, så kan t.ex. en chans bör inte missas. Exakt samma situation är nu med VK, som i synnerhet förbereder byggandet av sitt tredje egna datacenter, som kommer att ligga i Domodedovo nära Moskva. För att studera möjligheterna till praktisk tillämpning av LSS vände sig VK till RSK-företaget, som skapade ett nyckelfärdigt system, komponenter av sin egen design: pumpenheter, ett vätskedistributionssystem i ett rack och vattenblock för en CPU med en TDP på ​​270 + W.

Relaterad  Chrome för Android låter dig betala online med ditt fingeravtryck

I början av sommaren 2020 installerades testsystemet i Moskvas VK-datacenter (långt ifrån det nyaste) – två rack med olika typer av noder för totalt 30 kW, som var och en hade 5 kW för luft och 10 kW för “Vatten”. Det tog en halv dag att byta system och LSS var i minimiversionen, det vill säga utan redundans. Sedan ingick dessa maskiner i den allmänna poolen, och de körde (och körde fortfarande) normala produktlaster. Efter att ha undersökt beteendet och driften av maskiner och LSS, hittat och eliminerat alla problemområden, samt felsökt hela mjukvaran och hårdvaran, beslutade företaget att utöka testsortimentet – nu finns det 60 bilar i Moskva och 40 fler i St. Petersburg.

Sommaren 2021 dök det upp flera fler rack med LSS i servrar i Moskva. Inklusive två dussin GPU-noder: samma två toppprocessorer + åtta PCIe-acceleratorer på 300 W vardera. I detta fall kyls alla heta komponenter i sådana enheter med vätska. Själva kretsen ökade sin kapacitet fem gånger och fick redundans: två kyltorn installerades för att kyla vätskan och två pumpenheter installerades för att skapa en cirkulation av köldmediet. Dessutom är RSK-pumpenheterna unika – detta är den enda lösningen som kombinerar pumparna för de interna och externa kretsarna i en enhet, tillsammans med ett energieffektivt kontrollschema. Hela kylsystemet, inklusive kyltorn och pumpar för båda kretsarna, förbrukar i proportion till antalet installerade LSS-servrar och den faktiska värmebelastningen.

Efter uppdateringen fick testlabbets ingenjörer återigen lida av felsökning av hela systemet på olika nivåer. Börjar med det faktum att överföringen av GPU till LSS är mycket svårare än CPU, och slutar med skapandet av ett avancerat övervakningssystem, som gjorde det möjligt att förstå varför allt var bra i syntetiska tester, och problem uppstod under verkliga belastningar. Detta är viktigt eftersom acceleratorer är involverade i distribuerad maskininlärning, och att förlora ens en av dem är frustrerande.

Samtidigt bekräftades det att med ökningen av omfattningen av implementeringen av LSS, blir de mer och mer lönsamma lösning – varje kilowatt i det nya testet 100-kW-systemet med redundans är mycket billigare än i det gamla 20- kW-system utan det. Och en enhet med uteslutande luftkylning, enligt tester, förbrukar faktiskt inte mindre än med LSS (inklusive både interna och externa komponenter), och det är mycket dyrare att bara skala “luft”.

En sådan hybridmetod med utvinning av värme med hjälp av LSS från de specifika hetaste komponenterna (i genomsnitt står de för 85 % av strömförsörjningen och följaktligen kylning i ett visst system) gör det till exempel mycket lättare att byta till free kylning (inklusive med adiabatik) … Den resulterande PUE är ungefär 1,1 jämfört med den traditionella 1,35-1,5. Därför, även om CAPEX för LSS är högre, kan CAPEX för datacentret som helhet (särskilt med hänsyn till IT-komponenterna) vara lägre, och besparingarna på OPEX under en period på 3-5 år kan helt återvinna ökade kapitalkostnader.

Relaterad  Google låter dig styra din smartphone med en huvtröja

Och i sig gör minskningen av specifik toppenergiförbrukning mindre att spendera på inköp av garanterad kapacitet, UPS och generatorer. Dessutom finns det ett antal ytterligare faktorer i investeringarna. Till exempel, för “vatten” är det åtminstone all “VVS”, ytterligare utrustning av noder och rack, etc. Endast i fallet med “luft” är dessa mycket dyra radiatorer och fläktar för höga TDP-nivåer och en lägre densitet av utrustning i ställen.

När det gäller VK visar beräkningar att införandet av LSS är en effektiv lösning vad gäller nyckelparametrar. Det betyder inte att alla andra kommer att vara exakt likadana. Även den nuvarande plattformen kan användas ganska bekvämt i gamla datacenter. Men VK har redan planer för nästa generations hårdvara, vars TDP växer (CPU 300+ W, GPU 500+ W), men den kritiska temperaturen sjunker. Och vi måste förbereda oss för dess utseende nu, och övergången till LSS för dem kommer att bli ännu mer effektiv än i den nuvarande generationen.

Och möjligheten att använda exakt rätt (och förstklassig) utrustning är viktig för utvecklingen av verksamheten som helhet. Hur det faktiskt kommer att bli är nu ingen redo att säga. Än så länge är planerna att utrusta LSS med en del av det framtida datacentret, efter att ha fått erfarenhet av rejält massutbyggnad och drift av noder med “vatten”, samt resten av infrastrukturen – till exempel lagringssystem och nätverket ska inte heller glömmas bort. Huvudsaken är att det inte längre finns någon rädsla för att använda LSS i datacentret. Det finns en förståelse för svagheter och vanliga felpunkter, det finns en förståelse för hur man löser problem.




Om du upptäcker ett fel, välj det med musen och tryck på CTRL + ENTER. | Kan du skriva bättre? Vi är alltid glada över nya författare.

\n \n\n\t\t\t \n\t\t\t \n\t\t\t \n\n\t\t\t\t\t\t\t\n\t \t\t\t\t\t\t

\n\n\n\n\n\n\n\n\n\t\t\t\t\t\t\t\n\n\n\t\t\t\t\t\t\tOm du märker ett fel, välj det med musen och tryck CTRL + ENTER. | Kan du skriva bättre? Vi är alltid glada över nya författare.\n\t\t\t\t\t\t\t\t\t\n\t\t\t\t\t\t\t\t\t\t \t\t\t\t\t\t\n\t\t\t\t\t\t\t\t\t\t\t\t\t\t\t\t\t\t \n\t\t\t\t\t\t\t\t\t”,”author”:{“@type”:”Person”,”name”:”Aroged”,”url”:”https :\/\/www.aroged.com\/author\/admin\/”,”sameAs”:[“https:\/\/www.aroged.com”]},”articleSection”:[“Games”]”image”:{“@type”:”ImageObject”,”url”:”https:\/\/www.aroged.com\/wp-content\/uploads\/2021\/12\/How-VK -with-RSK-was-introduced-into-LSS-servers.JPG”,”width”:800,”height”:465},”publisher”:{“@type”:”Organisation”,”name”:” “,”url”:”https:\/\/www.aroged.com”,”logo”:{“@type”:”ImageObject”,”url”:””},”sameAs”:[“https:\/\/www.facebook.com\/Arogeed”,”https:\/\/twitter.com\/Thearoged”,”https:\/\/t.me\/Aroged”,”https:\/\/www.linkedin.com\/company\/aroged\/”,”https:\/\/www.youtube.com\/channel\/UCiVipsa5WnWr7FLzgVf6cZw”]}}

Table of Contents