Anthropic publicerade nyligen ett case study om hur de internt automatiserat 95% av alla business analytics-frågor med Claude — med ~95% träffsäkerhet.
Det är ett imponerande resultat. Men den verkligt intressanta insikten gömmer sig i en bisats: utan rätt infrastruktur runt AI-agenten låg träffsäkerheten på 21%.
Det är inte ett modellproblem. Det är ett datastyrningsproblem.
Den ärliga bilden av AI-analytik idag
De flesta organisationer som testar AI för dataanalys gör samma misstag: de pekar modellen mot ett datalager och hoppas på det bästa.
Resultatet är förutsägbart. Agenten hittar fel tabell. Den använder en föråldrad metricdefinition. Den returnerar ett svar som ser korrekt ut men bygger på fel data — och ingen vet om det.
Anthropic identifierade tre systemiska felkällor:
- Entity ambiguity — agenten kan inte mappa "omsättning för produkt X" till rätt tabell och kolumn, för det finns femton tabeller med liknande namn och ingen tydlig ägare
- Data staleness — scheman, affärsdefinitioner och logik förändras konstant; agenten vet inte vad som är aktuellt
- Retrieval failure — rätt information finns, men agenten hittar den inte i ett datalager med miljontals fält
Lösningen: en agentic data stack
Det som tog Anthropic från 21% till 95% var inte en bättre modell — det var ett lager av struktur runt modellen:
1. Kanoniska datasets
Istället för tiotals nära-identiska tabeller: ett fåtal välstyrda, tydligt ägda datasets som är den enda sanningskällan. Nära-kopior depreceras aggressivt.
2. Semantic layer som primärkälla
Kompilerade metric- och dimensionsdefinitioner som agenten måste konsultera först — innan den skriver en enda SQL-rad. Är metriken täckt av semantic layer:et, returneras ett konsistent svar.
3. Skills — strukturerade kontextdokument
Markdown-filer colocated med dbt-modellerna i ett repo. CI-checks säkerställer att en ändring i datamodellen alltid medför en uppdatering av skills. Utan skills: 21%. Med skills: 95–99%.
4. Evals och provenance
Varje svar bär en "provenance footer" — vilken datakälla det kom från, hur färsk datan är, vem som äger modellen. Evals körs automatiskt vid varje PR-merge.
Det som förvånade mest
Anthropic testade att ge agenten direkt åtkomst till tusentals historiska SQL-filer — i tanken att "alla rätta svar finns redan där". Det hjälpte nästan inte alls. Agenten presterade bara marginellt bättre.
Det stärker poängen: rådata är inte kunskap. Strukturerad, underhållen, ägd kontext är kunskap.
Vad det här betyder för svenska SMBs
Det finns ett tydligt mönster i hur AI-implementationer misslyckas: man investerar i en bra modell eller ett bra verktyg, och sedan undrar man varför agenten ger fel svar eller varför teamet slutat lita på det.
Svaret är nästan alltid detsamma: kontexten runt agenten är inte byggt för maskinläsning.
Det är precis det vi bygger på VasthavM. Inte en ny AI-modell — utan den infrastruktur som gör att den modellen faktiskt levererar korrekta, betrodda svar i din specifika verksamhet.
Det handlar om:
- Datastyrning — klara ägarskap, kanoniska definitioner, deprecerade dubbletter
- Kontextlager — strukturerade dokument som agenten kan navigera utan att gissa
- Validering — automatiska kontroller som fångar fel innan de når slutanvändaren
- Underhåll — processer som håller kontexten aktuell när verksamheten förändras
En kritisk detalj från Anthropic: utan aktivt underhåll sjönk träffsäkerheten från 95% till 65% på en månad. Idag uppdaterar 90% av alla data-PR:s agentens skills.
Det är inte ett teknikprojekt — det är ett organisatoriskt åtagande.
Det verkliga AI-skyddet
Prashant Goela, data engineering-expert, sammanfattade det bäst i sin analys av Anthropics case study:
"Den verkliga enterprise AI-vallgraven är inte LLM:en. Det är legibiliteten hos den infrastruktur som stöder den."
Alla kan anropa Claude via ett API. Inte alla kan bygga ett system där Claude konsekvent hittar rätt svar i din specifika affärsdata.
Det är skillnaden mellan en AI-demo och AI som skapar värde i produktion.
Vill du veta hur din organisation ligger till? Boka en Automationsrevision — vi kartlägger var kontextluckor kostar er pengar och tid, och tar fram en konkret plan för att stänga dem.