Nopeuta tekoälyprojekteja datan valmistelulla

By Vinay Samuel

Tekoälyprojekteja aloittavat organisaatiot kohtaavat haasteen saada käyttöönsä laadukasta ja asiayhteyden huomioivaa dataa nopeasti. Sen sijaan, että ne luottaisivat hitaisiin ja kalliisiin pilvipohjaisiin järjestelmiin, monet siirtävät dataa takaisin paikalliseen tallennustilaan. Tätä prosessia kutsutaan datan palauttamiseksi paikalliseen käyttöön. Muutos auttaa vähentämään kustannuksia ja varmistaa, että tekoälymallit pääsevät käsiksi uusimpaan dataan.

Organisaatiot, jotka aloittavat tekoälyhankkeita, eivät voi odottaa pitkään kestäviä tiedon keskittämishankkeita. Niiden on pystyttävä integroimaan korkealaatuista dataa mahdollisimman nopeasti riippumatta siitä, missä se sijaitsee, jotta niiden tekoälytyökalut voivat tuottaa kontekstuaalisesti tarkkoja tuloksia hyödyntäen uusimman datan tarjoamia oivalluksia.

Vanhentunut ja hankala tiedon poimiminen useista lähteistä sekä sen kopioiminen keskitettyyn sijaintiin tekoälytyökalujen käsiteltäväksi on tarpeetonta ja kuluttaa merkittävästi teknisiä ja taloudellisia resursseja. 

Datan palauttamisen yleistyminen: siirtymä pilvestä paikallisiin järjestelmiin

Monissa organisaatioissa datan siirtäminen pilvipohjaisesta tallennustilasta paikallisiin järjestelmiin on täydessä vauhdissa. Tätä kutsutaan datan palauttamiseksi. Kun organisaatioiden luoman ja käsittelemän datan määrä on kasvanut, myös datan hallintaan liittyvät kustannukset ovat kasvaneet. Kustannukset kertyvät nopeasti jopa muutaman sentin gigatavu-hinnalla.

Hewlett Packard Enterprisen Yhdysvaltain julkisen sektorin teknologiajohtaja Bill Burnham huomauttaa kustannusten voivan kasvaa ”tähtitieteellisiksi”, kun organisaatiot siirtyvät käsittelemään petatavuja dataa. Datan palauttaminen paikalliseen tallennustilaan on taloudellisesti järkevää erityisesti tekoälysovelluksissa, joissa uutta dataa käytetään tulosten hienosäätöön ja päivittämiseen. 

Toiminnan näkökulmasta data on ihanteellista sijoittaa mahdollisimman lähelle sitä paikkaa, jossa sitä käytetään. Pilvipohjaiset järjestelmät tarjoavat monia hyötyjä, mutta ne eivät ole ratkaisu jokaiseen ongelmaan. Tekoälymalleja koulutettaessa on ratkaisevan tärkeää, että niillä on käytettävissään tuoreinta ja täsmällistä dataa.

Tekoälydatan ja tulosten suojaaminen

Gartnerin tutkimus osoittaa, että pilvipalvelujen virheelliset määritykset ovat merkittävä ongelma, joka voi johtaa arkaluonteisen datan päätymiseen luvattomien tekoälymallien käsiteltäväksi. Kuten loppukäyttäjiä varoitetaan siitä, että heidän julkisiin generatiivisen tekoälyn palveluihin lähettämiään kyselyitä voidaan käyttää, sama koskee kaikkea paljastunutta dataa.

Paikalliset järjestelmät eivät ole immuuneja tietomurroille, mutta riskiä siitä, että luvaton tekoälymalli pääsee käsiksi yrityksen dataan ja aiheuttaa immateriaalioikeuksien vuotamisen, voidaan pienentää.

Tekoälymallien epätarkat tulokset ovat edelleen merkittävä ongelma. Viimeaikaiset esimerkit, kuten Googlen tekoälyn ehdotus kokkeille käyttää liimaa, jotta juusto pysyisi pizzan päällä ja syödä kiven päivässä vitamiinien ja mineraalien lähteenä, osoittavat, kuinka tärkeää on syöttää suurille kielimalleille asianmukaista ja kontekstuaalista dataa. Käyttämällä omaa dataa ja tarjoamalla sen nopeasti ja kustannustehokkaasti saataville voidaan vähentää harhaanjohtavien tai virheellisten tulosten riskiä. 

Kontekstuaalisen datan merkitys tekoälyn tarkkuudelle

Kontekstuaalisen tiedon merkitystä ei voi liioitella. Paras data, jota organisaatiosi voi käyttää tekoälytyökaluissa, on data, joka liittyy nimenomaisesti sen toimintaan.

Vaatteiden vähittäismyyjille heidän palvelemaansa väestöön liittyvät demografiset tiedot ovat ratkaisevan tärkeitä. 16–25-vuotiaisiin naisiin keskittyvä vaateliike tarvitsee erilaisia syötteitä kuin myymälät, jotka myyvät pukuja 35–50-vuotiaille miehille.

Tekoälymallit, jotka käsittelevät yleistä dataa eivätkä ymmärrä yrityksen erityistarpeita, voivat tuottaa tuloksia, jotka johtavat huonoihin päätöksiin. Vaikka pizzan juuston liimaamista koskevat esimerkit ovat humoristisia, vähittäiskauppaketjun ostaja, joka tilaa tuhansia kappaleita vaatteita, joita ei osteta, voi aiheuttaa suuria kustannuksia tai jopa katastrofin. 

More Articles

Tekoälyn tuominen paikalliseen ympäristöön

Datan sijoittaminen mahdollisimman lähelle paikkaa, jossa sitä käytetään tekoälyä varten, vähentää monimutkaisuutta ja kustannuksia. Tekoälyhankkeet ovat erittäin riippuvaisia mallin kouluttamiseen käytetystä datasta. Korkealaatuinen ja ajantasainen data on arvokkaampaa kuin uusien data-analyytikkojen palkkaaminen. Organisaatioiden on asetettava malleissaan käyttämänsä data etusijalle ja tehtävä se helposti saataville. 

Tyypillinen lähestymistapa tekoälysovellusten datan hallintaan perustuu datan kopioimiseen lähteestä, jotta sitä voidaan käyttää mallien kouluttamiseen. Kun paras data on kuitenkin hajautettu useille alustoille, kuten pilvipohjaiseen CRM-järjestelmään, paikalliseen taloushallinnon alustaan ja verkossa toimiviin tuottavuustyökaluihin, datan tekeminen saataville voi olla haastavaa. Usein seurauksena on, että keskittämisen kannalta helpoimmin saatavilla olevaa dataa käytetään ja muu data jätetään myöhemmäksi, kun budjetti ja aika sen sallivat.

Kysymys, joka tekoälytiimien on esitettävä, kuuluu: miten ne voivat käyttää kaikkea tarvitsemaansa dataa joutumatta odottamaan kalliita ja aikaa vieviä datan palautusprojekteja? Ne tarvitsevat helpon tavan käyttää eri sijainneissa olevaa hajallaan olevaa dataa ja pystyä ohjaamaan kyseistä dataa käyttäviä kyselyitä uudelleen datan siirtyessä.

Datan valmistelutyökalut voivat muokata datan tekoälyn hyödyntämistä varten ja samalla minimoida häiriöt datan palauttamisen aikana. Hyödyntämällä näitä uusia huipputason lähestymistapoja tekoälyprojektit voivat edetä vauhdilla odottamatta datan siirtoa tai tarvetta suunnitella järjestelmiä merkittävästi uudelleen. Koulutusdataa voidaan tuoda tekoälymalleihin ja LLM-malleihin lähes reaaliajassa sitä mukaa kun sitä syntyy.

Tekoälyprojektien vauhdittaminen paikallisilla datahub-keskuksilla

Kasvavat kustannukset, huoli immateriaalioikeuksien vuotamisesta ja tekoälytyökalujen kehittämisen suurempi ketteryys vauhdittavat siirtymistä pilvipohjaisista alustoista paikallisiin ympäristöihin. Tekoäly ja LLM-mallit edellyttävät laadukkaan, kontekstuaalisen ja ajantasaisen datan käyttöä, jotta ne voivat tarjota käyttäjille parhaat tulokset. 

Tekoälyn datahub, joka toimii kaikkien tekoäly- ja dataintegraatioprojektien yhtenä keskitettynä työtilana ja hallinta-alueena, mahdollistaa tekoälyprojektien vauhdittamisen samanaikaisesti pilvipalveluista palauttamisen projektien kanssa, jotta organisaatiot voivat hyödyntää dataansa nopeasti.

Samalla ne voivat edelleen tarjota liiketoimintakäyttäjille parempaa asiakasymmärrystä ja edistynyttä analytiikkaa liikevaihdon kasvattamiseksi ja kilpailijoiden päihittämiseksi erittäin kilpailullisessa liiketoimintaympäristössä.  

Tilaa The CTO Clubin uutiskirje saadaksesi lisää tekoälyä koskevia näkemyksiä ja parhaita käytäntöjä.

Get regular tech leadership wisdom for delivering better software and systems.
Get Free Access

Have an account? Log In

Vinay Samuel
Vinay Samuel started his IT career decades ago at Teradata as a marketing data expert. His career has featured senior roles as Vice President Asia of Greenplum, CEO of GridMatics, and Vice President APJ for Hewlett-Packard. Vinay was a pioneer in “event based analytics” and parallel database technologies in the mid 90s, and went on to lead several disruptive data analytics companies, including where he is today -- at Zetaris. Zetaris enables instant analytics on decentralized data, finally solving some very real-world problems for data platform leaders and analytics leaders.
Follow the author:

You may also like