Att mäta er position på Google är (relativt sett) enkelt. Sökmotorn är deterministisk: samma sökord ger samma resultat för samma användare, varje gång. Resultaten har explicit ranking. Det finns API:er som rapporterar din position numerärt. Inget av detta gäller för AI.
Ställ samma fråga till ChatGPT två gånger med fem minuters mellanrum och ni får två olika svar. Variationen är inte ett fel — den är inbyggd i hur språkmodeller fungerar (genom temperature och top-p sampling). En enskild mätning säger lite om er faktiska synlighet.
AI-modeller listar ibland alternativ i ordning, ibland som flytande text, ibland implicit i en mening. Det finns inget ”position 1” att mäta — bara mönster över många svar.
Det finns ingen Google Search Console för ChatGPT. Inget officiellt API som säger ”din synlighet i ChatGPT är X”. Datan måste produceras genom strukturerad mätning, inte hämtas från en källa.
ChatGPT-4o är inte samma modell idag som för tre månader sedan. När OpenAI uppdaterar — och de gör det ofta — kan era resultat förändras dramatiskt över en natt. En engångsmätning är värdelös; bara kontinuerlig spårning fångar verkligheten.
Att mäta något som ingen tidigare mätt kräver en disciplinerad approach. MrSearch är byggt på tre principer som vi inte gör avkall på – eftersom det är de som garanterar att siffrorna ni får faktiskt går att lita på.
Eftersom AI-svar varierar, mäter vi i statistiskt giltiga volymer (10 prompts × dagliga körningar) och beräknar standardavvikelse explicit. Vi visar inte bara en siffra — vi visar hur säker den siffran är.
Varje KPI vi presenterar måste antingen direkt peka mot en åtgärd, eller utgöra underlag för en sådan. Datapunkter som inte kan översättas till ”vad ska jag göra på måndag morgon?” har ingen plats i produkten.
När ni lägger till ett varumärke använder MrSearch er URL, beskrivningen av er kategori och er målgrupp för att generera 10 prompts som speglar verkliga sökmönster. Ni kan justera, lägga till eller ta bort dem manuellt. De 10 prompterna är hela mätinstrumentet — väljer vi fel prompts mäter vi fel saker.
Varje prompt skickas till ChatGPT, Perplexity, Claude, Copilot, Gemini och Google AI Overviews — beroende på paket. Frågorna ställs neutralt, utan personalisering, så att resultaten är jämförbara mellan körningar och mellan kunder.
Varje svar analyseras genom en sekundär språkmodell som extraherar: vilka varumärken som nämns, i vilken ordning, hur ofta, med vilket sentiment, och vilka attribut som kopplas till vart och ett. Resultaten lagras som strukturerad data, inte fri text.
De extraherade datapunkterna matas in i tio bedömningskriterier (mer detalj i nästa sektion). Varje kriterium viktas enligt en metodologi som är offentligt dokumenterad. Resultatet är AI-Score: ett enskilt tal mellan 0 och 100.
Varje datapunkt från varje körning lagras med tidsstämpel, modell-ID och prompt-ID. Det innebär att ni kan jämföra inte bara dagens AI-Score med förra veckans, utan exakt vilka kriterier som förändrats — och i vilken modell.
Datan jämförs mot fördefinierade gap-mönster (synlighetsgap, attributgap, positionsgap, modellgap). När ett mönster matchar genereras ett förbättringsområde med konkret rekommendation och prioritering baserad på beräknad effekt på AI-Score.
AI-Score från 0 till 100 är ett medelvärde av tio viktade bedömningskriterier. Här är varje kriterium, dess vikt och dess motivering — så att ni själva kan bedöma metoden.
Nämns varumärket överhuvudtaget i svaret? Binärt ja/nej. Grunden för allt annat.
Är varumärket det enda alternativet eller ett av flera? ”Använd X” vs ”Du kan välja mellan X, Y och Z”.
Är kontexten runt omnämnandet positiv, neutral eller negativ? Extraheras via sekundär API-analys.
Hur säker är AI-modellen när den nämner ert varumärke? Hög sannolikhet = stark förankring i träningsdatan.
Hur tidigt i svaret dyker varumärket upp? Mätt i tokens från svarets början.
Hur mycket text ägnas åt att beskriva varumärket? Räknar tokens som direkt kopplas till er.
Hur många konkurrenter nämns i samma svar? Mindre = starkare ensam-position.
Hur många konkurrenter nämns i samma svar? Mindre = starkare ensam-position.
Uppmanas användaren att besöka eller använda varumärket? ”Besök X.com” är starkare än passiv namedrop.
Inkluderas en URL eller källhänvisning? Relevant främst för modeller med webbsökning.
40% av AI-Score avgörs av om ni nämns och som primär rekommendation. Resterande 60% handlar om hur kvalitativt ni nämns — givet att ni nämns.
Två varumärken kan båda nämnas av AI:n men ha helt olika styrka i den underliggande representationen. Det märker ni inte i det genererade svaret. Det märker ni bara om ni läser logprobs.
Hög logprob för ert varumärke = AI:n behöver inte tänka för att rekommendera er. Ni är en del av modellens grundförståelse av kategorin. Det är den allra starkaste form av AI-synlighet som finns.
Låg logprob = AI:n nämnde er, men nästan av en tillfällighet. Den hade lika gärna kunnat välja någon annan. Er position är skör.
Skillnaden mellan dessa två är osynlig i den vanliga texten. Den är synlig i logprobs. Och den är en av de viktigaste signalerna MrSearch spårar.
Skillnaden i pålitlighet är osynlig i medelvärdet – synlig i distributionen.
snitt = #4 · σ = 0.8 (låg)
Båda har snittposition #4. Bara ett av dem är pålitligt synligt.
Direkta API-anrop till officiella endpoints (OpenAI, Anthropic, Google, Perplexity). Vi skrapar inte gränssnitt. Det betyder att våra data är den data modellen själv producerar, inte en användarspecifik personaliserad version.
Projekt: en gång per dygn, alla KPI:er, alla aktiverade modeller. Engångsmätningar (Analyze): i realtid. Tröskel-alerts: triggas omedelbart när definierade gränsvärden överskrids.
Råresponserna lagras med tidsstämpel, modell-version och prompt-ID. Det innebär att vi kan jämföra historiska resultat även när modellerna senare uppdaterats — och visa er exakt när ett skifte i synlighet sammanföll med en modelluppdatering.
Prompts där ni konsekvent inte nämns. Indikerar att det saknas innehåll eller auktoritet inom ämnesområdet.
Skapa innehåll som adresserar de specifika frågeställningarna. Ofta produktsidor, FAQ:er eller jämförelser.
Önskade varumärkesattribut som AI-modellerna inte associerar med er. Indikerar att rätt budskap inte återfinns i det innehåll modellerna tränas på.
Prompts där ni nämns men hamnar lågt i ranking eller som passivt omnämnande. Indikerar att konkurrenter har starkare förankring.
Thought leadership, expertcitations, tredjepartsomnämnanden. Bygg auktoritet, inte bara närvaro.
AI-modeller där ni är markant sämre representerade än i andra. Indikerar att ert innehåll är osynligt för just den modellens datakällor.
(och varför det spelar roll)
Spårar prestandan på er egen LLM-app (latency, token-användning, hallucinationer). Användbart om ni byggt en chatbot. Men det mäter er produkt — inte er synlighet i externa AI-tjänster. Helt olika problem.
Att själv ställa frågor till ChatGPT är värdefullt – men subjektivt, slumpmässigt och oskalbart. Era egna prompts är dessutom färgade av att ni redan vet svaret ni hoppas på. Tjänar för utforskning, inte för mätning.
Inte ett SEO-verktyg som ”även täcker AI”. SEO-verktyg som börjat lägga till AI-mätning gör det ofta som en bisak — låg uppdateringsfrekvens, ytliga KPI:er, generiska prompts. MrSearch är byggt från grunden för AI-synlighet. Det är hela vår produkt.
Variationen är inneboende i hur språkmodeller fungerar. Vi adresserar det genom (1) tio prompts per varumärke istället för en, (2) daglig körning över tid, (3) explicit beräkning av standardavvikelse i resultaten. En siffra ni ser i MrSearch är alltid ett medelvärde med dokumenterad spridning, inte en enskild snapshot.
Officiella API:er. OpenAI för ChatGPT, Anthropic för Claude, etc. Det betyder att svaren är modellens neutrala output — inte en personaliserad version som påverkas av en användares historik. Det är en kompromiss: API-svaren kan skilja sig något från vad en enskild användare ser i webgränssnittet, men de är jämförbara över tid och mellan kunder.
Vi loggar modell-version vid varje körning. När en uppdatering går ut markeras det i era trendlinjer så att ni kan se exakt när ett skifte inträffade. Vi gör inga retroaktiva justeringar av historisk data — den är vad den var, mätt mot den modell som existerade då.
Prompts kan formuleras på valfritt språk. För svenska varumärken på svenska marknader rekommenderar vi svenska prompts; för internationell synlighet körs prompts på engelska parallellt. Ni kan ha båda.
Vi använder en sekundär stor språkmodell (för närvarande Claude och GPT-4o, beroende på uppgift) med strukturerade extraktions-prompts för att kategorisera varumärkesomnämnanden, sentiment och attribut. Modellen tränas inte specifikt — den används med carefully constructed instructions och valideras kontinuerligt mot manuell annotering.
Ja. CSV-export finns idag; ett publikt API är på vägen.
Ja. Vi mäter offentligt tillgängliga AI-svar; ingen personuppgiftsbehandling. Era prompts och varumärkesdata lagras inom EU och används aldrig för att träna externa modeller.
Den här sidan är en sammanfattning av en produkt som är betydligt mer detaljrik än det som ryms i text. Det enklaste sättet att bedöma om MrSearch passar er är att se det live – på er egen kategori, med era egna konkurrenter, i en 20-minuters demo.
Cookies och dataskydd
Vi använder nödvändiga cookies för sajtens funktion och loggar IP-adresser vid sökning för säkerhetsändamål (legitimate interest, GDPR Art. 6(1)(f)). För statistik och marknadsföring behöver vi ditt samtycke. Läs mer i vår integritetspolicy.
Nödvändiga Alltid på
Session, säkerhetslogg, rate-limit. Alltid på — krävs för att sajten ska fungera.
Statistik
Google Analytics — hjälper oss förstå hur sajten används.
Marknadsföring
Reklamspårning för riktade kampanjer.