Tekoälyvalmiin infrastruktuurin rakentaminen: opas yritysten IT:lle

By Mike Peercy

Tekoälyvalmiin infrastruktuurin rakentaminen on ratkaisevan tärkeää tekoälyn hyödyntämiseksi. Tutustu yritysten haasteisiin ja huomioon otettaviin seikkoihin, kuten datan hallintaan, pilvipalveluihin, mallien valintaan ja osaajien hankintaan.

Moniin teknisiin päätöksiin liittyy tekoälyn tukeminen – esimerkiksi siihen, mitä LLM:iä käytetään, minne ne otetaan käyttöön, millaista infrastruktuuria tarvitaan ja miten työntekijöitä koulutetaan. Äskettäin kyselyymme vastanneista yhdysvaltalaisista yritysten IT-päättäjistä lähes puolet (44 %) ilmoitti, että tekoälyvalmiin data-infrastruktuurin luominen on tämän päivän tärkein prioriteetti. IT-organisaatiot myös kouluttavat olemassa olevia malleja mukautetusti (37 %), käyttävät tekoälyyn pilvipalveluita (32 %), rakentavat omia oppimismallejaan (32 %), sallivat työntekijöiden käyttää kaupallisesti saatavilla olevia tekoälymalleja (29 %) ja kouluttavat työntekijöitä (33 %).

Tässä artikkelissa tarkastelen näitä eri osa-alueita ja esitän muutamia näkökohtia yrityksille, jotka rakentavat niin sanottua tekoälyvalmista infrastruktuuria. Kuten aina, budjetti vaikuttaa merkittävästi tekoälyteknologiaa koskevaan päätöksentekoon, mutta myös turvallisuus, hallinnon vaatimustenmukaisuus sekä sellaisten IT-työntekijöiden saatavuus, joilla on oikeat tekoäly- ja ML-taidot, ovat ratkaisevia tekijöitä.

Tekoälyvalmiin data-infrastruktuurin luominen

Tekoälyhankkeen käynnistäminen yrityksessäsi saattaa edellyttää mallin kehittämistä ja kouluttamista, jos sinun on rakennettava oma generatiivinen tekoälymallisi.  Tämä alkaa yleensä hankkimalla riittävästi suorituskykyisiä laskentaresursseja – kalliita suorittimia, grafiikkasuorittimia ja tensoriprosessoreita, joita tarvitaan koneoppimismallien isännöintiin ja datan käsittelyyn huippunopeudella.  Vaikka valmiiksi rakennettu infrastruktuuri, julkiset mallit ja pilvipalvelut tarjoavat kustannus- ja helppokäyttöisyyshyötyjä, IT-organisaatioiden on myös punnittava tekoälyn omissa tiloissa säilyttämisen hyötyjä paremman hallinnan saavuttamiseksi tai vaihtoehtoisesti rakennettava hybridimalli, joka tarjoaa oikean tasoisen datan hallinnan, läpinäkyvyyden ja turvallisuuden. 

Tekoälypalvelimen keskimääräinen hinta on 32 000 dollaria. ”Gartnerin ansioitunut analyytikko John-David Lovelock huomauttaa, että tekoälypalvelimista koostuva teline maksaa yli miljoona dollaria.” Tekoälyä varten suunnitellut flash-tallennusteknologiat voivat myös lisätä kustannuksia. Lisäksi kaikki nämä laitteet vaativat tukea ja ylläpitoa, mikä edellyttää kokoaikaista IT-henkilöstöä ja huippuluokan datakeskusta. 

Get Free Access
Get regular tech leadership wisdom for delivering better software and systems.
Get Free Access

Have an account? Log In

Yritysdatan käyttäminen tekoälyn kanssa

Riippumatta siitä, rakennatko oman mallisi alusta alkaen vai todennäköisemmin hienosäädätkö ja käytätkö valmiiksi rakennettuja malleja, tarvitset datanhallintaa tuodaksesi oikean strukturoimattoman datan tekoälyn käyttöön. Strukturoimattoman datan hallinta automatisoi tekoälydatan työnkulkuja ja hallinnoi yrityksen datan hallintaa erityisesti arkaluonteisen datan osalta. 

Strukturoimaton data, jonka osuus IDC:n mukaan on 90 % kaikesta datasta, on yleensä hajallaan monissa siiloissa. Datanhallinnan tehtävänä onkin helpottaa oikean datan nopeaa hakua, merkitsemistä ja syöttämistä tekoälymalleihin.

Tekoälyn pilvipalvelut

Suuret pilvipalveluntarjoajat ovat rakentaneet kokonaisvaltaisia palveluita tukemaan tekoälyä organisaatioissa, jotka eivät pysty tai halua hallinnoida teknologiaa itse. Komponentit ulottuvat nopeasta tallennuksesta ja laskentatehosta koneoppimisresursseihin, generatiiviseen tekoälyyn ja kehitystyökaluihin. Pilvipohjaisella tekoälyllä on selviä kustannusetuja – palvelimia tai tallennustilaa ei tarvitse ostaa eikä kasvaneesta energiankulutuksesta tarvitse maksaa, mikä kasvattaisi datakeskuksen tilantarvetta – mutta pilvessä voi helposti varata liikaa resursseja ja käyttää liikaa rahaa. Myös pilviosaamisen puutteet ovat ongelma.

Pilvipohjainen tekoälystrategia voi olla sekä onnistunut että kustannustehokas, jos pystyt hallitsemaan dataa asianmukaisesti. Jos esimerkiksi kopioit petatavuittain strukturoimatonta dataa pilveen ja yrität sen jälkeen selvittää, mikä data on hyödyllistä tekoälylle, lasku kasvaa nopeasti valtavaksi. 

Kannattaa myös välttää tekoälysovelluksen syöttämistä datalla ennen kuin olet siivonnut datan sekasotkun: useimmilla organisaatioilla on suuria määriä päällekkäistä, vanhentunutta tai niin sanottua zombidataa, joka pitäisi poistaa. Varmista ennen datan siirtämistä, että se on hyvässä kunnossa – luokiteltu ja järjestetty – ja siirrä vain dataa, jonka tiedät sopivan projektisi laajuuteen.  On myös hyvä ottaa huomioon pilvidatan hallintaan liittyvät kysymykset.

Valitse käyttötapauksia, joiden sijoitetun pääoman tuotto on ennustettavissa, ja varmista, että pystyt mittaamaan tulokset myöhemmin. Turvallisuus- ja vaatimustenmukaisuusvaatimukset voivat estää tekoälyn isännöinnin pilvessä. Vähintäänkin on olennaista ymmärtää dataasi tekoälypalvelussa kohdistuvat riskit ja tietää, miten projektit tarkastetaan datariskien varalta, ennen minkään projektin aloittamista.

Koneoppimismalleja koskevat päätökset

Suositut koneoppimismallit, kuten GPT, Claude, Gemini, TensorFlow ja PyTorch, perustuvat koulutuksessa valtaviin julkisiin tietoaineistoihin. Jotta tekoälystä kuitenkin saadaan hyödyllinen ja uskottava yritysprojekteissa, joiden tavoitteena on parantaa toimintoja, tutkimusta ja kehitystä tai asiakassuhteita, haluat kouluttaa mallin omalla luottamuksellisella datallasi ja pitää sen yksityisenä. 

Mallin kouluttaminen ja/tai kehittäminen edellyttää erikoistuneiden datatieteilijöiden taitoja. Heidän on hallittava tärkeimmät ohjelmointikielet, kuten Python ja R, massadatan mallintaminen ja analysointi, koneoppimismallien tuntemus sekä turvallisuus ja pilvilaskenta.

Kunnianhimoinen ja hyvin rahoitettu analytiikka- ja datatiedetiimi saattaa jopa päättää kehittää mallin alusta alkaen. Syitä tähän ovat halu hallita täysin arkkitehtuuria ja tietoturvaa ja/tai tukea erittäin arkaluonteista ja kilpailullista hanketta. Vaikka Hugging Facen ja OpenAI:n kaltaiset yhteisöt auttavat komponenttien valinnassa ja yhteistyössä muiden kanssa, kyseessä on valtava urakka. Se edellyttää datan puhdistamista ja valmistelemista, algoritmien valintaa ja kouluttamista sekä mallin hienosäätöä tarkkuuden ja luotettavuuden varmistamiseksi. Tarvitsette työn tekemiseen infrastruktuurin lisäksi myös insinööritiimin.

Useimpien organisaatioiden resurssirajoitteiden vuoksi esikoulutettujen suljetun tai avoimen lähdekoodin koneoppimismallien käyttäminen yrityksen datan kanssa on todennäköisesti yleisin väylä tekoälyn hyödyntämiseen.  Tekoälyn päättely on paljon suurempi ja laajempi markkina kuin tekoälyn kouluttaminen. Siksi IT-organisaatiot investoivat yhä enemmän asianmukaisen datainfrastruktuurin luomiseen, jotta yrityksen dataa voidaan etsiä, kuratoida, auditoida ja syöttää tekoälylle samalla kun datan hallinnasta pidetään huolta.  

More Articles

Valmiiden tekoälytyökalujen yleistyminen  

Komprisen kyselyssä selvisi, että vain 30 % organisaatioista on varannut budjetin tekoälylle, mikä viittaa siihen, että 70 % kokeilee ja tutkii teknologiaa edelleen. Nykyään tämä tarkoittaa todennäköisesti edullisten sovellusten, kuten OpenAI ChatGPT:n, Anthropic Clauden, Microsoft Copilotin tai Google Geminin, käyttämistä. Eri osastojen työntekijät käyttävät näitä työkaluja kysymyksiin vastaamiseen, tekstin kirjoittamiseen, grafiikan ja kuvien luomiseen tai ohjelmakoodin kirjoittamiseen – salamannopeasti ja riittävän hyvillä tuloksilla. 

Puuttuvia asioita ovat standardit ja yleiset parhaat käytännöt. Mitkä projektit ovat turvallisia ja tarkoituksenmukaisia GenAI:n käyttöön? Mitä dataa tulisi käyttää ja mikä data tulisi suojata tietojen syöttämiseltä järjestelmään? Miten GenAI:n tuottamien teosten tarkkuutta ja laillisuutta tulisi arvioida? Mitä tapahtuu, jos immateriaalioikeuksia tai asiakasdataa vuotaa yleiskäyttöiseen LLM-malliin? Miten yritys voi suojautua GenAI:n tuottamaan työhön liittyviltä tekijänoikeus- tai kunnianloukkauskanteilta? 

Aloittakaa ymmärtämällä dataomaisuutenne datan ominaisuuksien ja arkaluonteisen datan, kuten henkilötietojen (PII) ja immateriaalioikeuksia koskevan datan, määrän osalta. Tämä analyysi auttaa organisaatiota laatimaan GenAI:n käyttöä koskevia toimintaperiaatteita, jotka ohjaavat datan ja käyttötapausten hallintaa. Tarvitsette työkalun vaatimustenmukaisuuden valvontaan ja GenAI:n käytöstä aiheutuvien ongelmien tutkimiseen, jos ja kun niitä ilmenee. 

Voitteko seurata, mitkä käyttäjät tai osastot ovat lähettäneet mitäkin dataa tekoälytyökaluun? Pystyttekö löytämään arkaluonteisen datan ja siirtämään sen pois hakemistoista, joista se voidaan löytää ja viedä tekoälytyökaluun? Jotkin jäsentymättömän datan hallintaratkaisut tarjoavat tämän toiminnallisuuden; tekoälyn datanhallinta on kasvava kysyntäalue, jolla pyritään estämään tekoälyn haitalliset seuraukset, jotka voivat vahingoittaa asiakkaiden luottamusta, uskollisuutta ja markkinamaineen uskottavuutta.

GenAI:n hallinnan tarve

Kun otetaan huomioon tekoälyyn liittyvät yleiset markkinahuolenaiheet, sen tunnettu kyky tuottaa virheellisiä tuloksia ja haitallisia hallusinaatioita, yritysdatan vuotamisen riski yleiskäyttöisiin LLM-malleihin sekä tekoälyteknologioiden kehittämisen ja käyttöönoton kustannukset, IT-johtajat haluavat aukottoman suunnitelman ja prosessin tekoälypinoon kuuluvien teknologioiden arviointia ja käyttöönottoa varten.

Haluatko lisää tekoälyä koskevia näkemyksiä? Tilaa The CTO Clubin uutiskirje, niin saat vinkkejä ja työkaluja suoraan sähköpostiisi!

Mike Peercy
Mike Peercy is the CTO and cofounder of Komprise. Holding a PhD for research in fault-tolerant distributed computing, he is an expert in architecting and developing high-performance, scale-out software solutions and has extensive experience working with complex enterprise IT infrastructure.
Follow the author:

You may also like