Tekoälyn käyttöönoton edistäminen: haastattelussa Pete Lilley avoimen lähdekoodin vektoritietokannoista

By Katie Sanders

Vektoritietokantaominaisuuksien integrointi avoimen lähdekoodin työkaluihin, kuten PostgreSQL:ään, mullistaa yritysten tekoälyn mahdollistamalla tarkan vektorihaun ja hakuavusteisen generoinnin. Tässä kysymys–vastaus-haastattelussa Pete Lilley kertoo näkemyksiään käyttöönoton haasteiden ratkaisemisesta, hallinnoitujen palvelujen hyödyntämisestä sekä skaalautuvan ja tulevaisuuden tarpeisiin vastaavan tekoälyinfrastruktuurin rakentamisesta.

Vektoritietokantaominaisuuksien integroiminen laajalti käytettyihin avoimen lähdekoodin tietokantoihin, kuten PostgreSQL:ään ja Apache Cassandraan, merkitsee merkittävää edistysaskelta tekoälyn käyttöönotossa yritysympäristöissä. 

NetApp Instaclustrin varatoimitusjohtaja ja pääjohtaja Pete Lilley tuo keskusteluun yli 25 vuoden kokemuksen IT-palveluista ja ratkaisujen käyttöönotosta. Skaalautuvan datainfrastruktuurin syvällisen asiantuntemuksensa ansiosta Pete kertoo, miten nämä avoimen lähdekoodin edistysaskeleet tekevät vektorihakujen ja hakua hyödyntävän generoinnin (RAG) käyttämisestä käytännöllistä ja tehokasta tekoälyyn perustuvissa yrityksissä. 

Nämä teknologiat auttavat teknologiajohtajia nopeuttamaan tekoälyhankkeita, tukemaan yritystason suorituskykyä sekä hyödyntämään vektoriominaisuuksien integroimiseen olemassa oleviin datainfrastruktuureihin liittyviä mahdollisuuksia ja ratkaisemaan siihen liittyviä haasteita.

  1. Miten näet vektoritietokantaominaisuuksien integroimisen suosittuihin avoimen lähdekoodin tietokantoihin, kuten PostgreSQL:ään ja Apache Cassandraan, vaikuttavan tekoälyteknologioiden käyttöönottoon yritysympäristöissä?

Mahdollisuus hyödyntää vektorihakua tuttujen avoimen lähdekoodin tietokantojen, kuten PostgreSQL:n (pgvector-laajennuksen), uuden Apache Cassandra 5.0:n ja kolmantena esimerkkinä OpenSearchin, avulla helpottaa yritysten tekoälyhankkeiden käynnistämistä ja skaalaamista. Jokainen näistä täysin avoimen lähdekoodin teknologioista – teknologioista, jotka useimmilla yrityksillä on jo osana teknologiakokonaisuuttaan – on kehittynyt siten, että se tarjoaa nyt sekä tekoälyn tarkkuuden kannalta olennaiset yritystason vektorihaun ominaisuudet että taustalla olevan datainfrastruktuurin, joka varmistaa tekoälyhankkeiden menestyksen pitkällä aikavälillä.

Teknologiajohtajat ymmärtävät tarvitsevansa vektoritietokantoja, mutta monet suhtautuvat varauksella omistusoikeudellisten vektoritietokantojen käyttöönottoon ja niiden ympärille tarvittavan osaamisen rakentamiseen, sillä ne ovat kalliita ja edistävät toimittajalukkiutumista. Täysin avoimen lähdekoodin vaihtoehdot voivat olla paljon houkuttelevampia, koska saatavilla on laaja asiantuntijajoukko ja hallinnoituja palveluja sekä kutakin edellä mainittua hanketta ympäröivät tukevat avoimen lähdekoodin yhteisöt. Siinä missä omistusoikeudelliset vektoritietokannat merkitsevät ennakkokustannuksia ja joustavuuden menetystä, avoimen lähdekoodin vektoritietokantojen avulla yritykset voivat päästä nopeasti liikkeelle ja toteuttaa tekoälyhankkeita varmemmin.

  1. Mitä erityisiä etuja hakua hyödyntävän generoinnin (RAG) toteuttamisesta avoimen lähdekoodin vektoritietokantojen avulla on yrityskohtaisissa tekoälyn käyttötapauksissa?

Ilman RAG-arkkitehtuuria ja vektorihakua yritysten LLM-mallien on käytettävä perinteistä hakukoneteknologiaa yrittäessään ymmärtää avainsanojen välisiä suhteita kyselyitä tulkitessaan. Seurauksena on usein tehottomuutta ja kontekstin ymmärtämisen puutetta – tai jopa kyselyn kontekstin täydellinen väärinymmärtäminen, mikä voi johtaa tekoälyn hallusinaatioihin. Jos käyttäjän kyselyn kontekstuaalista tarkoitusta ei pystytä ymmärtämään riittävän hyvin, yritysten tekoälyhankkeet ovat alttiita LLM-mallien heikolle suorituskyvylle ja heikkolaatuisille tuloksille… elleivät tulokset ole jopa tuhoisan harhaanjohtavia.

Vektorihaku tarjoaa paremman tavan saavuttaa kontekstin ymmärtäminen – erityisesti silloin, kun sitä tukee vektoritietovarastojen RAG-käyttö. Vektoritietokannat tallentavat upotusvektoreita, jotka määrittävät avainsanoille paikkatiedon numeeristen koordinaattien joukkoina. Mitä lähempänä nämä luvut ovat toisiaan, sitä samankaltaisempia kaksi avainsanaa ovat. Vektorihaku hyödyntää näitä upotuksia keskittääkseen haut rajattuihin tietojoukkoihin, jotka ovat kyselyn kontekstin kannalta olennaisimpia. Tämä suppeampi tarkasteluala mahdollistaa valtavien tietojoukkojen tehokkaamman hyödyntämisen. Se pienentää hallusinaatioiden riskiä ja parantaa samalla suorituskykyä. 

  1. Mitä keskeisiä haasteita teknologiajohtajat saattavat kohdata tuodessaan vektoritietokantaominaisuuksia olemassa olevaan datainfrastruktuuriinsa, ja miten he voivat parhaiten valmistaa tiiminsä tähän siirtymään?

Teknologiajohtajien tulisi varautua oppimiskäyrään, jonka heidän tiimiensä on ylitettävä, ennen kuin vektoritietokanta tarjoaa heidän tavoittelemansa kustannustehokkaan toiminnan ja suorituskyvyn. Pitkän aikavälin suunnittelu on olennaista, jotta tiimit saavat tietokannan asianmukaiseen käyttöönottoon ja jatkuvaan optimointiin tarvittavat resurssit ja ajan.

Myös tiettyjen datan parhaiden käytäntöjen noudattaminen vaikuttaa merkittävästi tekoälyhankkeiden tuloksiin. Niihin tulisi kuulua korkealaatuisen datan hyödyntäminen, datan oikeaoppinen pilkkominen ja upottaminen sekä metadatan ja hybridihakutermien hyödyntäminen (perinteisten hakumenetelmien ja vektorihaun yhdistäminen). LLM-mallien ja vektorihaun avulla toteutettujen tekoälyhankkeiden vieminen esittelyvaiheesta yritystason tuotantokäyttöön edellyttää omistautumista ja pitkäjänteistä työtä. Kun varmistetaan, että vektoritietokantojen operoinnin ja datatieteen tehtävissä on kokenutta osaamista – tai että tukea varten on saatavilla ulkoista hallinnoituihin palveluihin perustuvaa asiantuntemusta – oppimiskäyrä loivenee ja hankkeet etenevät nopeammin kohti merkityksellisiä tuloksia.

  1. Miten näet hallinnoitujen palvelujen roolin IT-johdon tukemisessa vektoritietokantaominaisuuksien käyttöönotossa ja optimoinnissa erityisesti silloin, kun yrityksen oma asiantuntemus on rajallista?

Hallinnoidut palvelut voivat tarjota yrityksille nopean väylän älykkään data-infrastruktuurin käyttöönottoon ja auttaa tekemään kaiken oikein heti ensimmäisellä kerralla, vaikka organisaation palveluksessa ei olisi omia asiantuntijoita. Suosittuja avoimen lähdekoodin teknologioita, kuten PostgreSQL:ää, Cassandra 5.0:aa tai OpenSearchia, hyödyntävillä yrityksillä ei ole vaikeuksia löytää hallinnoituja palveluita, jotka ovat valmiita auttamaan niiden tekoälyprojektien toteutuksessa ja optimoinnissa sekä vähentämään joitakin niistä ongelmista, joita tiimit väistämättä kohtaavat hakiessaan suuntaa.

  1. Kun katsotaan tulevaisuuteen, miten uskot tekoälypohjaisten datateknologioiden kentän kehittyvän ja mitä toimia teknologiajohtajien tulisi tehdä nyt varmistaakseen, että heidän organisaationsa ovat hyvässä asemassa tulevaa kehitystä varten?

Kysynnän kasvu suorituskykyisemmille, joustavammille ja kyvykkäämmille tekoälyn datateknologioille on käytännössä varmaa tulevaisuudessa. Teknologiajohtajien tulisi ehdottomasti tarkastella avoimen lähdekoodin ohjelmistoja, jotka ovat jo osoittaneet yritystason luotettavuutensa, skaalautuvuutensa, tietoturvansa, tehokkuutensa ja kestävyytensä alalla, sekä pohtia, miten nämä vaihtoehdot voisivat palvella tekoälyprojekteja tukevaa älykästä data-infrastruktuuria. Loppujen lopuksi oikeiden datakerroksen työkalujen valinta voi olla ratkaisevaa, kun yrityksen tekoälyvisio pyritään sovittamaan yhteen yrityksen tekoälytodellisuuden kanssa.

Mitä seuraavaksi

Tekoälypohjaisten teknologioiden muokatessa datan hallintaa ja analysointia vektorihaun ominaisuuksien laajentuminen avoimen lähdekoodin tietokannoissa, kuten PostgreSQL:ssä ja Apache Cassandrassa, tarjoaa yrityksille helposti hyödynnettävän ja tehokkaan perustan tekoälyinnovaatioille. 

Näiden teknologioiden hyödyntäminen strategisesti ennakoiden voi auttaa organisaatioita skaalaamaan tekoälyä tehokkaasti, vähentämään yleisiä käyttöönoton haasteita ja varmistamaan yhteensopivuuden pitkän aikavälin tekoälytavoitteiden kanssa. 

Asettamalla etusijalle avoimen lähdekoodin vaihtoehdot ja hallinnoidut palvelut, jotka tukevat vektoritietokantojen toimintoja, teknologiajohtajat voivat varautua infrastruktuurinsa tulevaisuuteen ja asemoida organisaationsa hyödyntämään datateknologian tekoälyn kehityksen seuraavaa aaltoa.

Tilaa The CTO Clubin uutiskirje saadaksesi lisää tietoa avoimesta lähdekoodista. 

Katie Sanders
As a data-driven content strategist, editor, writer, and community steward, Katie helps technical leaders win at work. Her 15 years of experience in the tech space makes her well-rounded to provide technical audiences with first-hand operating wisdom so senior tech leaders can get clarity. Tech leaders want to learn from peers who’ve been there. Katie surfaces hard-won lessons that help leaders scale systems, teams, and strategy in the face of disruption. Katie is an Executive Editor at Black & White Zebra. She nurtures a large and diverse community of technical experts and writers, and she knows that a thriving community doesn't grow without thoughtfulness, advocacy, and intention. Interested in being reviewed? Find out more here.
Follow the author:

You may also like