Så mäter vi något som ingen tidigare kunnat mäta

AI-svar är icke-deterministiska. Modellerna uppdateras varje vecka. Det finns inga officiella rankings. Det här är hur MrSearch ändå producerar mätbara, repeterbara och handlingsbara siffror på er AI-synlighet — varje dag.
Den här sidan är teknisk. Den är skriven för er som vill förstå metodologin innan ni förlitar er på siffrorna. Hoppa direkt till en sektion via menyn nedan, eller läs hela vägen igenom.

Varför AI-synlighet är fundamentalt annorlunda än SEO

Att mäta er position på Google är (relativt sett) enkelt. Sökmotorn är deterministisk: samma sökord ger samma resultat för samma användare, varje gång. Resultaten har explicit ranking. Det finns API:er som rapporterar din position numerärt. Inget av detta gäller för AI.

Icke-deterministiska svar

Ställ samma fråga till ChatGPT två gånger med fem minuters mellanrum och ni får två olika svar. Variationen är inte ett fel — den är inbyggd i hur språkmodeller fungerar (genom temperature och top-p sampling). En enskild mätning säger lite om er faktiska synlighet.

Ingen explicit ranking

AI-modeller listar ibland alternativ i ordning, ibland som flytande text, ibland implicit i en mening. Det finns inget ”position 1” att mäta — bara mönster över många svar.

Mörka data

Det finns ingen Google Search Console för ChatGPT. Inget officiellt API som säger ”din synlighet i ChatGPT är X”. Datan måste produceras genom strukturerad mätning, inte hämtas från en källa.

Modellerna uppdateras kontinuerligt

ChatGPT-4o är inte samma modell idag som för tre månader sedan. När OpenAI uppdaterar — och de gör det ofta — kan era resultat förändras dramatiskt över en natt. En engångsmätning är värdelös; bara kontinuerlig spårning fångar verkligheten.

Det är dessa fyra utmaningar som MrSearch är byggt för att lösa. De närmaste sektionerna förklarar exakt hur.

Tre principer som styr allt vi mäter

Att mäta något som ingen tidigare mätt kräver en disciplinerad approach. MrSearch är byggt på tre principer som vi inte gör avkall på – eftersom det är de som garanterar att siffrorna ni får faktiskt går att lita på.

1
Rigor

"Inget tal får finnas utan en transparent metod bakom sig."

Varje KPI vi visar har en dokumenterad beräkningsmetod, viktade kriterier och definierade datakällor. Ni ska kunna fråga oss exakt hur ett tal räknades fram — och vi ska kunna svara.
2
Repeterbarhet

"Samma metod, samma data, samma resultat."

Eftersom AI-svar varierar, mäter vi i statistiskt giltiga volymer (10 prompts × dagliga körningar) och beräknar standardavvikelse explicit. Vi visar inte bara en siffra — vi visar hur säker den siffran är.

3
Handlingsbara insikter

"Mätning utan åtgärd är meditation."

Varje KPI vi presenterar måste antingen direkt peka mot en åtgärd, eller utgöra underlag för en sådan. Datapunkter som inte kan översättas till ”vad ska jag göra på måndag morgon?” har ingen plats i produkten.

 

Från er URL till handlingsbar insikt - i sex steg

Allt MrSearch gör går genom samma pipeline. Här är varje steg, ärligt beskrivet — inklusive vad som händer i bakgrunden som ni inte ser i gränssnittet.
1

Generering

Promts

10 prompts skapas från er URL och kategori
2

Fråga

Multi-modell

Promptarna körs mot alla AI-modeller dagligen
3

Analys

Svaranalys

Strukturerad extraktion av data från svaren
4

Scoring

Viktning

10 kriterier viktas till AI-Score
5

Lagring

Trender

Tidsstämplad data för historik och jämförelse
6

Output

Åtgärder

Prioriterade rekommendationer baserat på gap

"Vad skulle era kunder faktiskt fråga AI:n?"

När ni lägger till ett varumärke använder MrSearch er URL, beskrivningen av er kategori och er målgrupp för att generera 10 prompts som speglar verkliga sökmönster. Ni kan justera, lägga till eller ta bort dem manuellt. De 10 prompterna är hela mätinstrumentet — väljer vi fel prompts mäter vi fel saker.

"Samma frågor, alla relevanta AI-modeller, varje dag."

Varje prompt skickas till ChatGPT, Perplexity, Claude, Copilot, Gemini och Google AI Overviews — beroende på paket. Frågorna ställs neutralt, utan personalisering, så att resultaten är jämförbara mellan körningar och mellan kunder.

"Vad sa AI:n egentligen — och vem nämndes?"

Varje svar analyseras genom en sekundär språkmodell som extraherar: vilka varumärken som nämns, i vilken ordning, hur ofta, med vilket sentiment, och vilka attribut som kopplas till vart och ett. Resultaten lagras som strukturerad data, inte fri text.

"Översätt rådatan till en jämförbar siffra."

De extraherade datapunkterna matas in i tio bedömningskriterier (mer detalj i nästa sektion). Varje kriterium viktas enligt en metodologi som är offentligt dokumenterad. Resultatet är AI-Score: ett enskilt tal mellan 0 och 100.

"Inte bara dagens siffra — historiken bakom den."

Varje datapunkt från varje körning lagras med tidsstämpel, modell-ID och prompt-ID. Det innebär att ni kan jämföra inte bara dagens AI-Score med förra veckans, utan exakt vilka kriterier som förändrats — och i vilken modell.

"Vad ska du göra åt det?"

Datan jämförs mot fördefinierade gap-mönster (synlighetsgap, attributgap, positionsgap, modellgap). När ett mönster matchar genereras ett förbättringsområde med konkret rekommendation och prioritering baserad på beräknad effekt på AI-Score.

AI-Score är ett enskilt tal. Bakom står tio.

AI-Score från 0 till 100 är ett medelvärde av tio viktade bedömningskriterier. Här är varje kriterium, dess vikt och dess motivering — så att ni själva kan bedöma metoden.

1

Mentions

Vikt

Nämns varumärket överhuvudtaget i svaret? Binärt ja/nej. Grunden för allt annat.

2

Primary recommendation

Vikt

Är varumärket det enda alternativet eller ett av flera? ”Använd X” vs ”Du kan välja mellan X, Y och Z”.

3

Sentiment

Vikt

Är kontexten runt omnämnandet positiv, neutral eller negativ? Extraheras via sekundär API-analys.

4

Logprobs / Modellkonfidens

Vikt

Hur säker är AI-modellen när den nämner ert varumärke? Hög sannolikhet = stark förankring i träningsdatan.

5

Text position

Vikt

Hur tidigt i svaret dyker varumärket upp? Mätt i tokens från svarets början.

6

Attribute density

Vikt

Hur mycket text ägnas åt att beskriva varumärket? Räknar tokens som direkt kopplas till er.

7

Exclusivity

Vikt

Hur många konkurrenter nämns i samma svar? Mindre = starkare ensam-position.

8

Mention frequency

Vikt

Hur många konkurrenter nämns i samma svar? Mindre = starkare ensam-position.

9

Call to action

Vikt

Uppmanas användaren att besöka eller använda varumärket? ”Besök X.com” är starkare än passiv namedrop.

10

Source citation

Vikt

Inkluderas en URL eller källhänvisning? Relevant främst för modeller med webbsökning.

Totalt 100%
AI-Score 10 KRITERIER
Viktningsfördelning

40% av AI-Score avgörs av om ni nämns och som primär rekommendation. Resterande 60% handlar om hur kvalitativt ni nämns — givet att ni nämns.

Vikten är inte slumpmässig

Mentions och Primary recommendation tillsammans utgör 40 % — för att om ni inte nämns alls, eller bara nämns som ett av många alternativ, har resten av kriterierna marginell betydelse. De resterande 60 % handlar om hur kvalitativt ni nämns, givet att ni nämns.

Vissa kriterier är medvetet låga

Source citation (1 %) får mer vikt i framtiden när webbsökning blir standard i alla AI-modeller. Vi viktar för det landskap som existerar idag, inte det vi tror existerar imorgon.

Vi mäter inte bara vad AI:n säger - utan hur säker den är på det

När en språkmodell genererar ett svar producerar den inte bara texten — den producerar också, för varje ord, sannolikheten att just det ordet skulle väljas. Den sannolikheten kallas log-probability, eller logprobs. Den är en av de mest underutnyttjade signalerna i hela AI-erans mätning.

Varför logprobs är intressant

När ChatGPT skriver ”En av de bästa lösningarna är Acme”, kan ordet ”Acme” ha:

Hög logprob (95 %) = AI:n är säker.

Acme är starkt förankrat i modellens träningsdata för den här typen av fråga. Det är inte en gissning, det är en etablerad association.

Låg logprob (12 %) = AI:n är osäker.

Modellen valde det här ordet, men det fanns flera andra likvärdiga alternativ. Associationen är svag.

Två varumärken kan båda nämnas av AI:n men ha helt olika styrka i den underliggande representationen. Det märker ni inte i det genererade svaret. Det märker ni bara om ni läser logprobs.

Vad det betyder för er

Hög logprob för ert varumärke = AI:n behöver inte tänka för att rekommendera er. Ni är en del av modellens grundförståelse av kategorin. Det är den allra starkaste form av AI-synlighet som finns.

Låg logprob = AI:n nämnde er, men nästan av en tillfällighet. Den hade lika gärna kunnat välja någon annan. Er position är skör.

Skillnaden mellan dessa två är osynlig i den vanliga texten. Den är synlig i logprobs. Och den är en av de viktigaste signalerna MrSearch spårar.

// Exempel: Två svar, samma fråga, olika konfidens
En av de bästa lösningarna för snabb filhantering är Acme som är känt för stabilitet .
Logprob för "Acme": 0.94 (mycket hög)
// Samma fråga, annat varumärke:
En av de bästa lösningarna för snabb filhantering är Beta som erbjuder liknande funktioner .
Logprob för "Beta": 0.31 (låg)
låg
hög

Hur vi får statistiskt giltiga siffror ur slumpmässiga svar

Språkmodeller producerar olika svar på samma fråga. Det är ett faktum som inte går att kringgå. Men det betyder inte att man inte kan mäta dem — det betyder bara att mätningen måste designas för att hantera variationen.
10
Prompts / Varumärke
Tio prompts, inte en
En enskild prompt kan ge ett missvisande resultat på grund av modellens slumpmässighet. Tio prompts som täcker olika sätt att fråga om samma kategori ger ett medelvärde som dämpar variationen. Tio är inte ett magiskt tal — det är en avvägning mellan statistisk styrka och mätningskostnad.
24h
Uppdateringscykel

Daglig körning

Varje prompt körs varje dag. Trender över dagar dämpar enskilda outliers. En förändring som håller i sig över sju dagar är signal; en enskild dags variation är brus.
σ
Spridning mäts

Standardavvikelse explicit

Förutom medelvärdet beräknar vi spridningen i era resultat. Ett varumärke som hamnar på position 2 i 9 av 10 prompts (låg σ) är mer förankrat än ett som hamnar på position 1 i 5 prompts och position 8 i 5 prompts. Båda har medelposition cirka 4–5; bara ett av dem är konsekvent synligt.
Två varumärken. Samma medelposition. Olika konsistens.

Skillnaden i pålitlighet är osynlig i medelvärdet – synlig i distributionen.

Varumärke A — konsekvent

snitt = #4 · σ = 0.8 (låg)

Varumärke B — spritt

snitt = #4 · σ = 2.7 (hög)

Båda har snittposition #4. Bara ett av dem är pålitligt synligt.

Var datan kommer från - och hur den lagras

Datakällor

Direkta API-anrop till officiella endpoints (OpenAI, Anthropic, Google, Perplexity). Vi skrapar inte gränssnitt. Det betyder att våra data är den data modellen själv producerar, inte en användarspecifik personaliserad version.

Frekvens

Projekt: en gång per dygn, alla KPI:er, alla aktiverade modeller. Engångsmätningar (Analyze): i realtid. Tröskel-alerts: triggas omedelbart när definierade gränsvärden överskrids.

Lagring

Råresponserna lagras med tidsstämpel, modell-version och prompt-ID. Det innebär att vi kan jämföra historiska resultat även när modellerna senare uppdaterats — och visa er exakt när ett skifte i synlighet sammanföll med en modelluppdatering.

Datasekretess
Era prompts och varumärkesdata är er egendom. Vi använder dem inte för att träna interna modeller. Datan lagras inom EU.
Era prompts
MrSearch Orchestrator
ChatGPT
Claude
Perplexity
Copilot
Gemini
AIO
Svaranalys (sekundär LLM)
Strukturerad data (EU-lagring)
Ert dashboard

Hur en KPI-förändring blir en konkret åtgärd

Språkmodeller producerar olika svar på samma fråga. Det är ett faktum som inte går att kringgå. Men det betyder inte att man inte kan mäta dem — det betyder bara att mätningen måste designas för att hantera variationen.

01 - Synlighetsgap

Prompts där ni konsekvent inte nämns. Indikerar att det saknas innehåll eller auktoritet inom ämnesområdet.

Åtgärdsmönster

Skapa innehåll som adresserar de specifika frågeställningarna. Ofta produktsidor, FAQ:er eller jämförelser.

02 - Attributgap

Önskade varumärkesattribut som AI-modellerna inte associerar med er. Indikerar att rätt budskap inte återfinns i det innehåll modellerna tränas på.

Åtgärdsmönster
Publicera innehåll som explicit kopplar attributet till varumärket — case studies, produktsidor, jämförelser.

03 - Positionsgap

Prompts där ni nämns men hamnar lågt i ranking eller som passivt omnämnande. Indikerar att konkurrenter har starkare förankring.

Åtgärdsmönster

Thought leadership, expertcitations, tredjepartsomnämnanden. Bygg auktoritet, inte bara närvaro.

04 - Modellgap

AI-modeller där ni är markant sämre representerade än i andra. Indikerar att ert innehåll är osynligt för just den modellens datakällor.

Åtgärdsmönster
Identifiera modellens specifika källor (Reddit, Wikipedia, fackforum) och bygg närvaro där.
Varje gap viktas efter sin potentiella påverkan på AI-Score. Det med högst beräknad effekt visas först. Ni får inte 50 datapunkter att sortera — ni får 3–5 prioriterade åtgärder.

Vad MrSearch inte är

(och varför det spelar roll)

Alternativ 01

LLM-monitoring-verktyg

Spårar prestandan på er egen LLM-app (latency, token-användning, hallucinationer). Användbart om ni byggt en chatbot. Men det mäter er produkt — inte er synlighet i externa AI-tjänster. Helt olika problem.

Alternativ 02

Manuella prompt-tester

Att själv ställa frågor till ChatGPT är värdefullt – men subjektivt, slumpmässigt och oskalbart. Era egna prompts är dessutom färgade av att ni redan vet svaret ni hoppas på. Tjänar för utforskning, inte för mätning.

Alternativ 03

Byggt enbart för AI-synlighet

Inte ett SEO-verktyg som ”även täcker AI”. SEO-verktyg som börjat lägga till AI-mätning gör det ofta som en bisak — låg uppdateringsfrekvens, ytliga KPI:er, generiska prompts. MrSearch är byggt från grunden för AI-synlighet. Det är hela vår produkt.

Frågor från CTO:er, SEO-chefer och dataingenjörer

Variationen är inneboende i hur språkmodeller fungerar. Vi adresserar det genom (1) tio prompts per varumärke istället för en, (2) daglig körning över tid, (3) explicit beräkning av standardavvikelse i resultaten. En siffra ni ser i MrSearch är alltid ett medelvärde med dokumenterad spridning, inte en enskild snapshot.

Officiella API:er. OpenAI för ChatGPT, Anthropic för Claude, etc. Det betyder att svaren är modellens neutrala output — inte en personaliserad version som påverkas av en användares historik. Det är en kompromiss: API-svaren kan skilja sig något från vad en enskild användare ser i webgränssnittet, men de är jämförbara över tid och mellan kunder.

Vi loggar modell-version vid varje körning. När en uppdatering går ut markeras det i era trendlinjer så att ni kan se exakt när ett skifte inträffade. Vi gör inga retroaktiva justeringar av historisk data — den är vad den var, mätt mot den modell som existerade då.

Prompts kan formuleras på valfritt språk. För svenska varumärken på svenska marknader rekommenderar vi svenska prompts; för internationell synlighet körs prompts på engelska parallellt. Ni kan ha båda.

Vi använder en sekundär stor språkmodell (för närvarande Claude och GPT-4o, beroende på uppgift) med strukturerade extraktions-prompts för att kategorisera varumärkesomnämnanden, sentiment och attribut. Modellen tränas inte specifikt — den används med carefully constructed instructions och valideras kontinuerligt mot manuell annotering.

Ja. CSV-export finns idag; ett publikt API är på vägen.

Ja. Vi mäter offentligt tillgängliga AI-svar; ingen personuppgiftsbehandling. Era prompts och varumärkesdata lagras inom EU och används aldrig för att träna externa modeller.

Vill ni se metoden i drift?

Den här sidan är en sammanfattning av en produkt som är betydligt mer detaljrik än det som ryms i text. Det enklaste sättet att bedöma om MrSearch passar er är att se det live – på er egen kategori, med era egna konkurrenter, i en 20-minuters demo.