Organisaties die AI-projecten starten, kunnen niet wachten op langdurige projecten voor datacentralisatie. Ze moeten hoogwaardige gegevens zo snel mogelijk kunnen integreren, waar deze zich ook bevinden, zodat hun AI-tools contextueel nauwkeurige resultaten kunnen leveren op basis van inzichten uit de meest recente gegevens.
Verouderde en omslachtige gegevensextractie en het kopiëren van gegevens uit meerdere bronnen naar een centrale locatie om deze door AI-tools te laten verwerken, is onnodig en vergt aanzienlijke technische en financiële middelen.
De opkomst van datarepatriëring: de verschuiving van de cloud naar on-premises
Voor veel organisaties is de verplaatsing van gegevens uit cloudopslag naar on-premises systemen in volle gang. Dit staat bekend als datarepatriëring. Naarmate de hoeveelheid gegevens die organisaties creëren en verwerken is toegenomen, zijn ook de kosten voor gegevensbeheer gestegen. Zelfs bij enkele centen per gigabyte lopen de kosten snel op.
Bill Burnham, CTO voor de Amerikaanse publieke sector bij Hewlett Packard Enterprise, merkt op dat de kosten “astronomisch” kunnen groeien wanneer organisaties petabytes aan gegevens gaan verwerken. Gegevens terugbrengen naar on-premises opslag, met name in AI-toepassingen waarin nieuwe gegevens worden gebruikt om resultaten te verfijnen en bij te werken, is economisch zinvol.
Vanuit operationeel perspectief is het ideaal om gegevens zo dicht mogelijk te plaatsen bij de locatie waar ze worden gebruikt. Cloudgebaseerde systemen bieden veel voordelen, maar zijn niet voor elk probleem een oplossing. Bij het trainen van AI-modellen is het essentieel dat deze toegang hebben tot de meest recente en nauwkeurige gegevens.
AI-gegevens en -resultaten beveiligen
Onderzoek van Gartner suggereert dat onjuiste configuraties van clouddiensten een aanzienlijk probleem vormen, waardoor gevoelige gegevens door niet-geautoriseerde AI-modellen kunnen worden verwerkt. Net zoals eindgebruikers worden gewaarschuwd dat de zoekopdrachten die ze indienen bij openbare generatieve AI-diensten kunnen worden gebruikt, geldt dit scenario voor alle gegevens die worden blootgesteld.
On-premises systemen zijn niet immuun voor datalekken, maar het risico dat een niet-geautoriseerd AI-model toegang krijgt tot bedrijfsgegevens en daardoor leidt tot een lek van intellectueel eigendom, kan worden beperkt.
Onnauwkeurige resultaten van AI-modellen blijven een aanzienlijk probleem. Recente voorbeelden, zoals de AI van Google die koks adviseerde om lijm te gebruiken om kaas op een pizza te laten zitten en elke dag een steen te eten als bron van vitaminen en mineralen, laten zien hoe belangrijk het is dat LLM's worden voorzien van geschikte en contextuele gegevens. Door uw eigen gegevens te gebruiken en deze snel en kostenefficiënt beschikbaar te maken, wordt het risico op misleidende of foutieve resultaten verkleind.
De rol van contextuele gegevens bij AI-nauwkeurigheid
Het belang van contextuele informatie kan niet genoeg worden benadrukt. De beste gegevens die uw organisatie voor AI-tools kan gebruiken, zijn gegevens die specifiek betrekking hebben op uw activiteiten.
Voor kledingretailers zijn gegevens over de demografie die zij bedienen van cruciaal belang. Een kledingwinkel die zich richt op vrouwen van 16 tot 25 jaar heeft andere input nodig dan winkels die pakken verkopen aan mannen in de leeftijdsgroep van 35 tot 50 jaar.
AI-modellen die algemene gegevens verwerken en de specifieke behoeften van het bedrijf niet begrijpen, kunnen resultaten leveren die tot slechte beslissingen leiden. Hoewel voorbeelden zoals kaas op een pizza lijmen humoristisch zijn, kan een inkoper voor een winkelketen die duizenden kledingstukken bestelt die niet zullen worden gekocht, te maken krijgen met hoge kosten of zelfs catastrofale gevolgen.
Uw AI on-premises brengen
Door gegevens zo dicht mogelijk bij de locatie te plaatsen waar ze voor AI worden gebruikt, worden complexiteit en kosten verminderd. AI-projecten zijn sterk afhankelijk van de gegevens die worden gebruikt om het model te trainen. Het beschikken over hoogwaardige, actuele gegevens is waardevoller dan het aannemen van meer datawetenschappers. Organisaties moeten prioriteit geven aan de gegevens die ze voor hun modellen gebruiken en deze toegankelijk maken.
De gebruikelijke aanpak voor het beheren van gegevens voor AI-toepassingen is gebaseerd op het kopiëren van gegevens uit de bron, zodat deze kunnen worden gebruikt om de modellen te trainen. Maar wanneer de beste gegevens verspreid zijn over meerdere platforms, zoals een cloudgebaseerd CRM-systeem, een on-premises financieel platform en online productiviteitstools, kan het lastig zijn om de gegevens toegankelijk te maken. Vaak is het resultaat dat de gegevens die het eenvoudigst te centraliseren zijn worden gebruikt, terwijl de rest wordt bewaard voor wanneer budget en tijd het toelaten.
De vraag die AI-teams moeten stellen, is hoe ze toegang kunnen krijgen tot alle gegevens die ze nodig hebben zonder te hoeven wachten op kostbare en tijdrovende projecten voor het terugbrengen van gegevens. Ze hebben een eenvoudige manier nodig om toegang te krijgen tot uiteenlopende gegevens op meerdere locaties en om de query's die toegang hebben tot die gegevens te kunnen omleiden wanneer de gegevens worden verplaatst.
Tools voor gegevensvoorbereiding kunnen gegevens geschikt maken voor AI-activering en tegelijkertijd verstoringen tijdens het terugbrengen van gegevens tot een minimum beperken. Door gebruik te maken van deze nieuwe geavanceerde benaderingen kunnen AI-projecten een flinke versnelling krijgen zonder te wachten op gegevensmigratie of systemen aanzienlijk opnieuw te moeten ontwerpen. Trainingsgegevens kunnen vrijwel in realtime naar AI-modellen en LLM's worden gebracht zodra ze worden aangemaakt.
AI-projecten versnellen met lokale gegevenshubs
Stijgende kosten, zorgen over het uitlekken van intellectueel eigendom en een grotere wendbaarheid bij de ontwikkeling van AI-tools stimuleren de verschuiving van cloudgebaseerde platforms naar lokale systemen. AI en LLM's vereisen toegang tot hoogwaardige, contextuele en actuele gegevens om ervoor te zorgen dat ze de beste resultaten voor gebruikers leveren.
Een AI-gegevenshub die fungeert als de centrale werkplek en zone voor gegevensbeheer voor alle AI- en gegevensintegratieprojecten maakt het mogelijk om AI-projecten gelijktijdig met projecten voor het terugbrengen van gegevens te versnellen, zodat organisaties hun gegevens snel kunnen benutten.
Tegelijkertijd kunnen ze zakelijke gebruikers betere klantinzichten en geavanceerde analyses blijven bieden om de omzet te verhogen en concurrenten voor te blijven in een uiterst concurrerende zakelijke omgeving.
Abonneer je op de nieuwsbrief van The CTO Club voor meer inzichten en beste werkwijzen op het gebied van AI.
