Torju datamyrkytys näillä viidellä keinolla

By Kevin Casey

Datamyrkytys uhkaa tekoälymalleja turmelemalla niitä voimistavat tietoaineistot ja voi pahimmillaan suistaa raiteiltaan kaiken asiakaschatboteista markkinoinnin automaatiotyökaluihin. Lue lisää viidestä keskeisestä periaatteesta, joiden avulla teknologiajohtajat voivat estää datamyrkytyshyökkäykset ennen kuin ne pääsevät juurtumaan.

Kyberhyökkäyksistä puhuttaessa datan myrkyttäminen sopii kuvaan täydellisesti. Se vain kuulostaa pahalta, etenkin kun yritysmaailmassa dataa pidetään yhä useammin jalometallin digitaalisena vastineena.

Se käy järkeen, koska datan myrkyttäminen on pahasta. Termillä tarkoitetaan tekoälymalleihin kohdistuvaa uutta riskiä, jossa ulkoinen tai sisäinen hyökkääjä turmelee harjoitusaineistoja tarkoituksellisesti vaikuttaakseen mallin toimintaan tai tuotoksiin. Tämä voi tarkoittaa virheellisen datan lisäämistä, olemassa olevan datan manipulointia tai puhtaan datan poistamista.

Jos rakennat tekoälypohjaisia SaaS-tuotteita – esimerkiksi markkinoinnin automaatiosovellusta, joka sisältää LLM-työkalun – sinun on tarkasteltava lähemmin sitä, miten suojaat mallisi.

Tässä artikkelissa jaan asiantuntijoiden neuvoja keskeisistä strategioista, joilla datan myrkyttämisen riskiä tekoälyn harjoitusaineistoissa voidaan minimoida.

Mitä datan myrkyttäminen on?

Esimerkki datan myrkyttämisestä on peräisin NISTiltä, joka monien muiden turvallisuuteen keskittyvien organisaatioiden tavoin selvästi kiinnittää uhkaan huomiota: ”[Hyökkääjät voivat ujuttaa] keskustelutietueisiin lukuisia sopimattoman kielen esiintymiä, jolloin chatbot tulkitsee nämä esiintymät riittävän yleiseksi puhetavaksi käyttääkseen niitä omissa asiakasvuorovaikutuksissaan.”

Yhtäkkiä luotettava asiakaspalveluchatbottisi käyttää kirosanoja (tai vielä pahempaa kieltä) keskustellessaan oikeiden ihmisasiakkaidesi kanssa. Tuskin kukaan tarkoittaa tätä puhuessaan tekoälyn hyödyntämisestä tuottavuuden, tehokkuuden tai innovaatioiden edistämiseen.

Käyttötapauksesta riippumatta CTO:iden, jotka upottavat generatiivista tekoälyä tai muita tekoälypohjaisia sovelluksia SaaS-tuotteisiinsa, on ryhdyttävä toimiin suojatakseen harjoitusdatansa haitallisilta lisäyksiltä, poistoilta tai muilta manipuloinneilta, jotka voivat vaikuttaa kaikkeen mallin suorituskyvystä käyttäjäkokemukseen, brändin maineeseen ja muuhun.

Lisäksi asiantuntijat vaikuttavat yleisesti olevan yhtä mieltä siitä, että datan myrkyttämisessä paras toimintatapa on ennaltaehkäisy. Sen estäminen on yleensä helpompaa kuin tapahtuman vaikutusten lieventäminen.

Miten datan myrkyttämistä torjutaan – 5 periaatetta riskien minimoimiseksi

1. Tunne datasi.

Puolustuksen vahvistaminen datan myrkyttämistä vastaan alkaa sen ymmärtämisestä, mitä olet suojaamassa – et voi suojata sellaista, mitä et tunne.

”Ensimmäinen askel datan myrkyttämisen torjumiseksi tekoälypohjaisissa SaaS-tuotteissa on ymmärtää selkeästi, millä datalla malliasi koulutetaan”, sanoo Ian Ahl, henkilöllisyyden turvallisuuteen keskittyvän palveluntarjoajan P0 Labsin uhkatutkimuksesta vastaava johtaja. ”On olennaista kouluttaa malleja datalla, jota voit hallita.”

Millaista data on? Mistä se tulee? Kenellä on siihen pääsy? Jos sinulla ei ole selkeitä vastauksia tällaisiin kysymyksiin, olet todennäköisesti suuremmassa vaarassa joutua myrkyttämishyökkäyksen kohteeksi.

Harjoitusdatan hyvä tuntemus on myös hyvän datanhallinnan edellytys, jota käsittelemme jäljempänä. Tärkeintä on tässä vaiheessa ymmärtää, että käytössä on oltava kontrollit sille, miten ihmiset, tiimit ja prosessit käsittelevät harjoitusdataa ja käyttävät sitä.

”Arvioimalla itse dataa voit asettaa tiukemmat kontrollit sitä päivittäville käyttäjille ja luoda tiukat suojakaiteet sille, miten asiakkaat voivat olla vuorovaikutuksessa datan kanssa”, Ahl sanoo. ”Kyse on ihmisiin, prosesseihin ja dataan kohdistuvan valvonnan yhdistelmästä.”

2. Arvioi datan muunnosstrategiasi uudelleen.

Sinun on myös pohdittava – ja mahdollisesti arvioitava uudelleen – miten data siirtyy alkuperäisistä lähteistään malleihisi eli datalinjastoon.

”CTO:iden datan muunnosstrategiaa koskevilla päätöksillä on suora vaikutus heidän tekoälypohjaisten SaaS-tuotteidensa turvallisuuteen, koska nämä päätökset vaikuttavat siihen, kuinka alttiita datalinjastot voivat olla myrkyttämiselle”, sanoo Dave Jenkins, Iterate.ai-yhtiön tuote- ja tutkimusjohtaja.

Jenkinsin mukaan olemme keskellä laajempaa siirtymää ETL (Extract, Transform, Load) -datalinjastoarkkitehtuurista ELT (Extract, Load, Transform) -datalinjastoarkkitehtuuriin. Kehityssuuntaukselle on useita syitä, mutta jälkimmäisen strategian yksi etu on, että se soveltuu paremmin datan myrkyttämisen kaltaisten ongelmien riskin minimointiin.

”Tämän taustalla on se, että kun tekoälydatan muunnokset tehdään varhaisessa vaiheessa ja malli on puutteellisesti säädetty tai datajoukot ovat vielä keskeneräisiä, kuten ETL-prosessissa joskus tapahtuu, mahdollisesti virheellinen data ikään kuin leivotaan sisään”, Jenkins sanoo. ”Virheet ja hallusinaatiot voivat lisääntyä siitä eteenpäin, ja myrkytetyn datan lähteen löytäminen – ja korjaaminen – voi olla lähes mahdotonta.”

Tämän vuoksi Jenkins lisää, että kannattaa välttää tilannetta, jossa eri sovellukset tekevät omat muunnoksensa ennen datan siirtämistä data-altaaseen. ELT-malli kääntää toimintojen järjestyksen toisin päin, niin sanotusti, ja antaa sinulle enemmän hallintaa sekä yhtenäisemmän muunnosprosessin.

”Siirtämällä sen sijaan kaikki muunnokset Snowflaken kaltaiseen datawarehouse-ympäristöön teknologiajohtajat ja heidän tiiminsä saavat enemmän näkyvyyttä ja hallintaa rakentaessaan tuotteitaan”, Jenkins sanoo.

3. Aseta hyvä datanhallinta etusijalle.

Näkyvyys ja hallinta ovat olennaisia, mutta ne eivät yksin riitä ilman vahvoja käytäntöjä ja hallintaa kaikissa dataketjuissa ja -prosesseissa.

”Tämän tekeminen oikein edellyttää tietenkin myös selkeää hallintaa”, Jenkins sanoo. ”Teknologiajohtajien on määriteltävä, missä tekoälydatan muunnoksia voidaan tehdä. He haluavat käyttöönsä auditointijäljet, validointikehykset, vertailuaineistot vertailutestausta varten sekä mieluiten muunnosten testausympäristöt, joissa mahdolliset virheet ja hallusinaatiot voidaan testata ja testata uudelleen ennen tuotantoon siirtymistä.”

Ahl huomauttaa, että hallinnan on katettava myös ihmiset, erityisesti selkeiden käytäntöjen ja suojakaiteiden muodossa. Niissä määritellään, kuka voi käsitellä koulutusdataa, mitä dataa he voivat käyttää ja niin edelleen: ”Kenellä tahansa, jolla on mahdollisuus lisätä tiedostoja mallin kouluttamista varten – olipa kyseessä käyttäjä tai tiimi – on oltava rajoituksia sen datan suhteen, jota he voivat hyödyntää.”

4. Vahvista yleistä tietoturvaasi.

On myös tärkeää muistaa, että tekoäly laajentaa jälleen monien organisaatioiden hyökkäyspinta-alaa. Datan myrkyttäminen on vain yksi mahdollinen uhka – joskin merkittävä sellainen. Kaiken edellä mainitun tulisi tapahtua laajemman tietoturvastrategian puitteissa.

Jos laiminlyöt jo tietoturvan perusasiat, kuten korjauspäivitykset, salasanojen turvallisen käytön, identiteetinhallinnan ja vähimpien oikeuksien periaatteen, on selvää, että myös tekoälymallisi ja koulutusdatasi ovat entistä alttiimpia riskeille.

5. Harkitse vastustajakoulutusta.

Kun datan myrkyttämisen kaltaisia uudempia uhkia ilmenee, niitä vastaan puolustautumiseen tarkoitetut uudet strategiat ja työkalut seuraavat yleensä perässä. Näin tapahtuu nyt tekoälyn kohdalla, joka on tuonut mukanaan kokonaisen joukon uusia riskejä, ei ainoastaan datan myrkyttämistä. Ne kootaan joskus termin ”vastustajatekoäly” alle. Sillä tarkoitetaan koneoppimisen ja muunlaisen tekoälyn haitallista käyttöä muiden tekoälyjärjestelmien hyökkäämiseen. Datan myrkyttäminen on yksi vastustajatekoälyn muoto.

Voit kääntää tilanteen tässä edukseksesi ja käyttää vastustajakoulutusta, jossa malleillesi opetetaan olennaisesti, kuinka havaita mahdollisia malleja ja poikkeamia, jotka saattavat viitata datan myrkyttämiseen tai muihin vastustajatekoälyn muotoihin, ja ryhtyä sitten toimiin niiden vaikutusten lieventämiseksi. 

Vastustajakoulutus saa jatkuvasti lisää jalansijaa keskeisenä lähestymistapana tekoälyn tietoturvaan. Esimerkiksi tämä tieteellinen artikkeli tarjoaa kehyksen terveydenhuollon toimintaympäristöissä datan keräämisen yhteydessä syntyneiden ennakkoluulojen lieventämiseen. Näissä ympäristöissä datan myrkyttämisen ja muiden hyökkäysten mahdolliset seuraukset ovat erityisen vakavia. Toisessa artikkelissa esitetään vastustajakoulutuksen kehys erityisesti datan myrkyttämiseltä suojautumista varten.

Mitä seuraavaksi?

Jos rakennat generatiivista tekoälyä ja muita tekoälypohjaisia ominaisuuksia SaaS-tuotevalikoimaasi, sinun on varmistettava, että koulutusdatasi on puhdasta, täsmällistä ja turvallista.

Muussa tapauksessa lisäät datan myrkyttämisen ja muiden ongelmien riskiä – ja nämä ongelmat on yleensä helpompi ehkäistä kuin ratkaista jälkikäteen.

Ennen kuin jatkat, tilaa uutiskirjeemme saadaksesi uusimmat näkemykset!

Kevin Casey
Kevin Casey is an award-winning technology and business writer with deep expertise in digital media. He covers all things IT, with a particular interest in cloud computing, software development, security, careers, leadership, and culture. Kevin's stories have been mentioned in The New York Times, The Wall Street Journal, CIO Journal, and other publications. His InformationWeek.com on ageism in the tech industry, "Are You Too Old For IT?," won an Azbee Award from the American Society of Business Publication Editors (ASBPE), and he's a former Community Choice honoree in the Small Business Influencer Awards. In the corporate world, he's worked for startups and Fortune 500 firms – as well as with their partners and customers – to develop content driven by business goals and customer needs. He can turn almost any subject matter into stories that connect with their intended audience, and has done so for companies like Red Hat, Verizon, New Relic, Puppet Labs, Intuit, American Express, HPE, Dell, and others. Kevin teaches writing at Duke University, where he is a Lecturing Fellow in the nationally recognized Thompson Writing Program.
Follow the author:

You may also like