Skyhöga ambitioner möter molnets verklighet: Hathora siktade på snabb tillväxt genom att förlita sig på molninfrastruktur och använda AWS med Kubernetes för att betjäna spelutvecklare, från små team till jättelika spelstudior.
Marknaden för massiva flerspelarspel: en lekplats värd miljarder: Marknaden för massiva flerspelarspel förväntas växa med nästan 30 miljarder dollar fram till 2029, vilket innebär både stora möjligheter och allvarliga infrastrukturutmaningar för företag som Hathora.
Framgång och belastning: för mycket, för snabbt: Hathoras plattform togs snabbt i bruk av över 100 studior, men de större kundernas krav blottlade begränsningarna och de höga kostnaderna i deras helt molnbaserade strategi.
Omprövad strategi: lärdomar den hårda vägen: När Hathoras team insåg att infrastrukturen inte räckte till omvärderade de affärsplanen för att hitta hållbara sätt att stödja och göra vinst på stora spelstudior.
Lärdomar för teknikledare: anpassning till skala: Hathoras erfarenhet är en lärdom för teknikledare om vikten av skalbar infrastruktur och balansen mellan molnkostnader och tillväxtstrategier.
Ibland blir själva den infrastruktur som hjälper dig att uppnå en framgångsrik lansering till slut ett hinder när företaget skjuter i höjden.
I Hathoras fall var det både bokstavligt sant och en smula ironiskt: Företaget tillhandahåller kritisk infrastruktur och serverorkestrering åt videospelsstudior för att vara värd för och skala upp deras multiplayer-onlinespel.
Det är en enorm marknad enligt de flesta mått. Analysföretaget Technavio prognostiserade till exempel att marknaden för massiva multiplayer-onlinespel (MMO) kommer att växa med nästan $30 miljarder mellan 2025 och 2029. Andra analytiker förutspår en liknande tillväxt under de närmaste ungefär fem åren.
Hathora ville lansera och skala upp sin plattform snabbt, så företaget följde en modell som har blivit vanlig bland många nystartade företag, små team och andra verksamheter: De satsade fullt ut på molnet och körde allt på Amazon Web Services med EKS, molnjättens helt hanterade Kubernetes-tjänst. Ambitionerna verkade gränslösa: Hathora ville betjäna spelutvecklare av alla storlekar, från de minsta teamen till de största studiorna och alla däremellan
Och det fungerade – upp till en viss punkt. Mer än 100 spelstudior började använda Hathoras plattform inom sex månader efter den första lanseringen. Den inledande framgången avslöjade ett grundläggande problem med tanke på Hathoras mål att betjäna spelstudior av alla storlekar och från hela världen: När de började arbeta med allt större studior blev ekonomin i deras molnbaserade infrastruktur snabbt ohållbar – så pass att de riskerade att gå miste om en stor och lukrativ del av den totala marknaden.
I den här fallstudien får vi en förstahandsinblick i hur Hathoras CTO och team omvandlade sin ursprungliga affärs- och teknikstrategi med potentiellt dramatiska resultat – samt några lärdomar för andra teknikledare inom alla branscher.
Företaget & CTO:n
Företag: Hathora, en global leverantör av kritisk infrastruktur och serverorkestrering åt videospelsstudior för att vara värd för deras multiplayer-onlinespel.
CTO: Harsh Pandey, som också är företagets grundare:
“Vi byggde Hathora för att ge spelstudior av alla storlekar tillgång till infrastruktur i global skala utan att de behöver bygga den själva. Men när vi började räkna på priserna för större studior gick ekonomin inte ihop. Molnkostnaderna, särskilt kostnaderna för datautgående trafik, gjorde vårt erbjudande ohållbart för exakt den typ av kunder vi ville betjäna.”
Huvudkontor: New York City
Kundnärvaro: I dag betjänar Hathora (bokstavligen) kunder över hela världen från 14 globala regioner fördelade över sex kontinenter.
Affärsproblemet
Stora ambitioner medför vanligtvis stora utmaningar, och så var det precis för Harsh och Hathora.
En del av detta beror på spelbranschens grundläggande natur: MMO-spel är inte små familjeföretag med förutsägbara trafikmönster. Multiplayer-spel måste i stället leverera ständiga uppdateringar till varje ansluten spelare samtidigt, med mycket hög prestanda.
Det innebär att stora mängder data regelbundet flyttas fram och tillbaka mellan backend-infrastrukturen och enskilda spelare, som kan uppgå till miljoner i större spel. Och om du tycker att dina kunder är krävande, låt oss bara säga att seriösa spelare inte nödvändigtvis är särskilt tålmodiga när det gäller spelets prestanda och användarupplevelsen.
Att köra spelserverarbetsbelastningar från Hathoras molnbaserade plattform fungerade bra för mindre studior. Men när en större studio kontaktade företaget om prissättning insåg Harsh och teamet begränsningarna i den ekonomiska modellen.
“Vi visste att vi hade en utmaning att hantera när en stor spelstudio som använde vår plattform för spelserverhosting frågade om priset för lanseringen,” berättade Harsh för oss. “Deras beräknade bandbreddskostnad uppgick till över en miljon dollar i månaden.”
Det var fyra gånger de normalt förväntade beräkningskostnaderna för att köra spelet, enligt Harsh. Det var inte hållbart för vare sig studion eller Hathora. Det försatte Hathora i ett så kallat vägskäl: hålla fast vid den ursprungliga molnbaserade strategin men riskera att förlora segmentet med stora studior, eller förändra något.
“Problemet som behövde lösas var prissättningen, helt enkelt,” säger Harsh.
Lösningen var dock teknisk: Hathora behövde omvandla sin egen infrastruktur för att bättre möta de unika kraven hos spelserverarbetsbelastningar, samtidigt som företaget införde en prismodell som även de största studiorna enkelt kunde börja använda.
Vad de gjorde åt det och varför
IT-proffs av alla slag har hört gott om argument för fördelarna med att migrera infrastruktur och arbetsbelastningar till molnet eller helt enkelt lansera en helt molnbaserad verksamhet. Det har varit en stor trend i flera år, och Hathora var inget undantag.
Hathora gick nästan i motsatt riktning för att lösa problemet med stora kunder genom att införa en hybridmolnarkitektur och till slut satsa stort på en gammal trotjänare: fysiska servrar.
(Läs vår artikel om den nyare trenden att flytta från molnmiljöer till lokal infrastruktur.)
Harsh berättar om företagets utveckling:
”Vi gick över till en hybridmodell och följde infrastrukturkostnaden per samtidig session, latenstidsprestanda i globala regioner och den tekniska insats som krävdes för att driva allt. Genom att flytta 80 % av våra arbetsbelastningar till fysiska servrar kan vi nästan halvera beräkningskostnaderna och sänka bandbreddskostnaderna med mer än 90 %. Vi hanterar nu över 30 000 kärnor i 14 regioner med ett relativt litet tekniskt team. Den effektivitetsnivån och räckvidden hade varit omöjlig med vår ursprungliga arkitektur.”
De använder fortfarande molninfrastruktur för skalbarhet och efterfrågetoppar, vilket motsvarar ungefär 20 % av arbetsbelastningarna (i stället för 100 %). Hathoras teknikstack bygger nu däremot på resurser från två leverantörer av fysiska servrar samt AWS- och GCP-molnresurser, i stället för att ha allt hos AWS. Harsh och teamet valde Talos Linux, en minimalistisk distribution som är särskilt utformad för Kubernetes-miljöer, samt Omni (även det från Sidero Labs) för orkestrering från ett enda kontrollplan över företagets hybrida miljöer.
Det behöver knappast sägas att detta inte var lika enkelt som att slå på eller av en strömbrytare. Dessutom fanns det för- och nackdelar att ta hänsyn till. Att enbart använda molnet hjälpte inledningsvis Hathora att lansera snabbt och framgångsrikt. Att lämna den modellen innebar att vissa av molnets fördelar gick förlorade, åtminstone till en början:
”Att göra en förändring innebar att vi gav upp många av de bekvämligheter som molnplattformar erbjuder”, säger Harsh. ”Vi skulle förlora enkel automatisk skalning, inbyggd övervakning och hanterade tjänster. Det ökade den operativa komplexiteten. Vi var också tvungna att bevisa att vi kunde matcha eller överträffa molnprestandan. Det fanns ingen garanti för att vi skulle hitta leverantörer eller verktyg som fungerade på det sätt vi behövde. Men vi ansåg att det var avgörande för vår affärsmodell att få kontroll över kostnader och prestanda, och vi var beredda att ta den risken.”
Satsningen ger resultat och banar väg för nästa fas i Hathoras tillväxt: företaget betjänar nu kunder på sex kontinenter. Det kan leverera samma kritiska infrastruktur till de största studiorna till en betydligt lägre kostnad än tidigare. Det erbjuder också mer detaljerad kontroll över spelarbetsbelastningarnas unika krav (detta är även en viktig fördel med programvara för kravhantering), genom kontroll på nodnivå med Talos Linux och enhetlig klusterorkestrering med Omni, oavsett var arbetsbelastningarna körs.
”De här verktygen är minimalistiska, säkra och enkla att använda i olika typer av infrastruktur”, säger Harsh. ”Vi utvärderade vår teknikstack utifrån prestanda, kostnad och hur mycket kontroll vi skulle behålla. Den nya konfigurationen gör att vi kan arbeta med ett litet team och skala globalt utan att vara bundna till en enskild leverantör.”
Hathoras lilla tekniska team har faktiskt blivit något av ett inofficiellt nyckeltal. Det visade omedelbara prestanda- och kostnadsförbättringar efter att företagets första fullständiga region migrerats till hybridmodellen och skalade därefter snabbt (det kör nu 14 regioner runt om i världen).
”Varje gång någon får reda på att vår infrastruktur hanteras av bara några få ingenjörer blir det ett ögonblick som visar hur långt vi har kommit.”
Viktiga insikter och lärdomar
Du behöver inte arbeta inom digital infrastruktur eller videospelsbranschen för att tillämpa liknande principer och lärdomar i din egen verksamhet.
- Lyssna på dina kunder: Harsh och teamet insåg att de hade ett problem – och att de behövde ta initiativ för att lösa det – genom att lyssna på sina kunder, särskilt den stora studio som hade använt Hathora för interna tester och senare frågade efter kostnadsberäkningar för att köra själva spelet på plattformen. CTO:er ansvarar lika mycket för att lösa kundernas problem som för att bygga tekniska lösningar – de två delarna hör ihop.
- Var inte rädd för att ändra riktning. ”Molnet först”, ”molnnativ” och liknande termer bör betraktas som anpassningsbara strategier, inte som heliga dogmer. Samma princip gäller i stor utsträckning: bara för att du börjar med en viss strategi betyder det inte att du måste hålla fast vid den för alltid. Hathora kunde ha stått still och stannat helt i molnet, men det skulle ha begränsat företagets tillväxtpotential och i slutändan prestandan hos spelen som körs på dess infrastruktur.
Genom att övergå till en hybridmodell kunde företaget betjäna kunder av alla storlekar och förbättra prestandan tack vare större flexibilitet och kontroll när de specifika kraven från spelarbetslaster skulle hanteras. Hathora har sedan dess kunnat lansera en företagsnivå som ger de största spelstudiorna förutsägbara priser och starka prestandagarantier.
- Var noggrann i din analys. En sådan omvandling kan inte genomföras genom gissningar. Harsh och teamet genomförde ett fullständigt koncepttest med Talos och Omni för att sätta deras strategiska förändring på prov:
”När vi hade validerat att vi kunde samordna allt genom ett enda system migrerade vi vår första hela region. Prestandavinsterna kom omedelbart. Därefter lanserade vi modellen globalt och lade till leverantörer och platser efter hand”, sade Harsh.
De analyserade för- och nackdelarna – inklusive den inledande förlusten av molnets fördelar som Harsh beskrev ovan – för att minimera överraskningar. De visste att de var tvungna att hitta en Kubernetes-vänlig lösning som kunde samordna allt över flera miljöer och regioner och i praktiken behandla alla maskiner likadant, oavsett om de kördes på fysisk maskinvara eller i ett moln.
Harsh noterade att de också gjorde en djupgående jämförelse av leverantörer, jämförde AMD- och Intel-processorer, testade verklig nätverksprestanda och utvärderade leverantörerna utifrån hur väl de presterade jämfört med AWS Global Accelerator.
”Vi såg till att vår nya konfiguration inte bara var billigare, utan också snabbare och mer tillförlitlig i de regioner som var viktiga.”
- Tänk långsiktigt: Omvälvande riktningsförändringar som denna handlar inte bara om att lösa problem som uppstår vid ett enda tillfälle. Om de genomförs rätt öppnar de upp allt fler möjligheter framöver. Det långsiktiga perspektivet börjar redan ge resultat för Hathora. De fortsätter att utveckla nya funktioner för större studior, till exempel alternativ med dedikerade kluster, regional peering för överlämningar med låg latens och förbättrad övervakning under liveevenemang.
Harsh sade också att Hathoras nya infrastrukturmodell för spel visar potential inom andra branscher som kräver respons i realtid och hög genomströmning, och företagets långsiktiga plan är att lansera nya lösningar för utvecklare utanför spelbranschen.
”Övergången till en hybridmodell gav oss flexibilitet på lång sikt. Nu kan vi snabbt etablera oss i nya regioner, testa nya maskinvaruleverantörer utan inlåsning och ge kunderna större kontroll över hur deras infrastruktur distribueras. Plattformen har blivit mycket mer modulär och anpassningsbar.”
För fler fallstudier och handböcker, prenumerera på The CTO Clubs nyhetsbrev.
