
Experiment
A/B-test av landningssidor: så kräver du rätt trafik och signifikans
A/B-testning – även kallad split-testning – innebär att två versioner av en sida, ett formulär eller ett e-postutskick visas samtidigt för olika delar av trafiken.
Därför avgör trafik och signifikans om A/B-testet är värt något
A/B-testning – även kallad split-testning – innebär att två versioner av en sida, ett formulär eller ett e-postutskick visas samtidigt för olika delar av trafiken. Båda versionerna mäts mot samma mål, till exempel antal leads eller genomförda köp, och en vinnare utses först när skillnaden är statistiskt säkerställd. Variant A är oftast originalet (kontrollen), variant B den ändrade versionen (utmanaren), och trafiken delas slumpmässigt mellan dem.
Poängen är att båda versionerna visas samtidigt och slumpmässigt: då är det förändringen – inte vädret, en kampanj eller säsongen – som förklarar skillnaden i resultat. Det skiljer ett A/B-test från att jämföra försäljning före och efter en ändring.
Kravet på statistisk signifikans skiljer A/B-testet från en kvalificerad gissning: resultatet ska inte kunna förklaras av slumpen. Därför krävs två resurser – trafikvolym och tid.
Från insikt till testbar hypotes och ett mätmål som håller
En testbar hypotes byggs i fyra steg: datakälla, insikt, hypotes och mätmål. Utgå från det du vet – analytics, heatmaps eller sessionsinspelningar – och ta reda på var besökarna lämnar sidan och var de fastnar. Formulera insikten, till exempel att en stor andel av mobilbesökarna aldrig scrollar ner till formuläret, och skriv hypotesen som ”Om vi ändrar X förväntar vi oss Y, för att Z”. Exempel för en landningssida: ”Om vi flyttar formuläret högre upp på sidan förväntar vi oss fler leads, för att fler besökare ser det.”
Mätmålet – till exempel leads eller genomförda köp – definieras exakt innan testet startar och hålls fast. Byt inte mått efteråt för att en variant ser bättre ut på något annat. En hållbar hypotes kräver både affärsförståelse för vad som driver konvertering och teknisk förståelse för vad som går att mäta korrekt.
Vanliga element att ändra på en landningssida är rubrik, CTA-knapp, bild, produkttext och formulär. Hypotesprövningen har en nollhypotes – inget samband mellan det du jämför – och en alternativ hypotes som stöder påståendet du vill bevisa. Ett tvåsidigt test tar hänsyn till att varianten kan påverka resultatet negativt; ett ensidigt test gör det inte.
Rätt trafik: så många besökare och konverteringar behöver landningssidan
Trafiken fördelas 50/50 mellan sida A och sida B, slumpmässigt och under samma tidsperiod. Riktmärket är minst cirka 100 konverteringar per version för statistisk signifikans. Med en konverteringsgrad på 1 % – nivån i SurveyMonkeys räkneexempel, där variant A låg på 1,00 % – motsvarar 100 konverteringar per version 100 / 0,01 = 10 000 besökare per version.
Multivariata test, där rubrik, bild och knapp testas samtidigt i olika kombinationer, kräver betydligt mer trafik eftersom besökarna delas upp på många kombinationer. Saknas volymen är det A/B-testet med ett element i taget du kan dra slutsatser av.
Låg trafik gör att även stora procentuella skillnader kan vara brus. Ett A/A-test – två randomiserade grupper med exakt samma upplevelse – visar att mätvärden skiljer sig åt ändå. Alla storkunder kan råka hamna i den ena gruppen, eller så kan några fler i den andra gruppen råka ta semester och därför ha mer tid. Användarbeteenden varierar slumpvis både på individnivå och aggregerat, så slumpen kan aldrig tas bort helt. Med få konverteringar räcker några enstaka extra konverteringar för att procentskillnaden ska svänga kraftigt mellan varianterna.
Krav för statistisk signifikans i A/B-testning
- 100Minsta antal konverteringar per version
- 1%Konverteringsgrad (exempel)
Så tolkar du statistisk signifikans: p-värde, konfidens och styrka
Ett resultat är statistiskt signifikant när sannolikheten att skillnaden beror på slumpen är mindre än 5 %, alltså ett p-värde under 0,05. Då kan du vara 95 % säker på att varianten verkligen har en effekt; 95 % konfidensnivå är standard inom A/B-testning. Kalkylatorer låter dig välja 90, 95 eller 99 % konfidens, och ett tvåsidigt test tar hänsyn till att varianten kan påverka resultatet negativt.
SurveyMonkeys exempel visar sambandet: variant A på 1,00 % och variant B på 1,14 % är en skillnad på 14 %, och med 95 % konfidens går det att säga att B presterar bättre än A. P-värdet är 0,0157 och testets styrka 86,69 %. Signifikansnivån justerar risken för typ 1-fel – klassikern är 95 % – och både signifikansnivå och teststyrka påverkar risken att dra fel slutsats.
Tolkningen av ett enskilt resultat beror på nivån du kräver. En vanlig tumregel: 95–100 % är statistiskt signifikant och den vinnande versionen bör implementeras; 90–95 % är troligtvis inte signifikant, och då är det säkrare att prova ett nytt test först; under 90 %: inte signifikant alls – då ska vinnaren inte implementeras.
Testlängd: kör en hel affärscykel – inte tills det ser bra ut
Kör testet tills data räcker för signifikans. Ett gott råd är 30 dagar – en affärscykel för de flesta företag – oavsett trafikvolym, eftersom det ger ett representativt urval.
Stoppa inte testet för tidigt för att en variant tillfälligt leder; en tillfällig ledning är inget bevis. Tålamod – en förändring i taget – gör att du kan se vad som orsakar förändringen i konverteringen.
Förutsättningen är att testperioden ligger i en någorlunda stabil trafik- och kampanjperiod.
Rätt testlängd: kör en hel affärscykel
- Syfte
- Säkerställ representativitet genom att täcka en hel affärscykel.
- Viktigt att undvika
- Att avbryta testet för tidigt eftersom en variant tillfälligt leder.
Vanliga misstag som ger fel vinnare på landningssidan
Att ändra flera element samtidigt – rubrik, bild och knapp på en gång – gör att du inte vet vilken ändring som orsakade effekten. Håll dig till ett element per test, annars går det inte att avgöra vad som gav resultatet.
För liten trafik: utan tillräcklig volym ger ett A/B-test inget säkert svar, och med få konverteringar per version är bruset större än effekten.
För kort testtid. Avbryter du när en variant tillfälligt leder kan du låsa fast en slump. Förändringen måste dessutom uppfattas av besökarna i testet – annars mäter du ingen effekt.
Ignorerad mobilanpassning. En vanlig insikt från datan är att en stor andel av mobilbesökarna aldrig scrollar ner till formuläret. Testar du bara desktopversionen svarar resultatet inte på hur landningssidan fungerar för mobilbesökarna, och vinnaren kan bli fel för den trafik som faktiskt konverterar.
Vanliga misstag i A/B-testning – vad du bör undvika
- Ändra flera element samtidigtDu kan inte avgöra vilken ändring som orsakade effekten.
- För liten trafikIngen signifikans – bruset överväger effekten.
- För kort testtidRisk för slumpmässiga ledningar; testet måste vara stabil.
- Ignorera mobilanpassningTestresultat kan vara felaktiga om mobilupplevelsen inte testas.
När A/B-test inte är rätt verktyg – och vad du gör i stället
Vid små volymer är A/B-testet inte det primära verktyget. Typfallen: en produkt som precis lanserats för en liten grupp inbjudna betaanvändare, eller en b2b-lösning där den totala marknaden uppgår till ett hundratal kunder. Då finns sällan nog med konverteringar för signifikans.
Alternativet är före/efter-jämförelse, som passar när trafiken är låg eller felet uppenbart. Baksidan är att säsong, kampanjer och ändrad trafik blandas in i resultatet, så slutsatsen måste dras med försiktighet.
Kvalitativa insikter från heatmaps och sessionsinspelningar visar var besökarna lämnar sidan och var de fastnar – samma datakällor som annars ligger till grund för hypotesen. Kombinera dem med att prioritera uppenbara brister på landningssidan, till exempel ett formulär som inte fungerar, en rubrik som inte säger vad erbjudandet är eller en CTA som inte syns. Sådant behöver inget test för att åtgärdas.
Från vinnare till nästa test: låt resultatet driva nästa hypotes
Är resultatet signifikant implementerar du vinnaren. Är det inte signifikant, låt bli eller kör ett nytt test. A/B-testning är en cykel, inte en engångsinsats: beslutet matar nästa hypotes.
Dokumentera insikten och formulera nästa hypotes på samma sätt som tidigare. Efter några tester gör du en testplan för kommande kvartal baserad på hypoteser från erfarenheter, egna analyser, interna workshops eller en byrå. Börja med de hypoteser som antas ha störst inverkan på konverteringen men är enklast att testa.
När testerna är körda ser du över statistiken och modifierar testplanen. Prioriteringsordningen: implementera det som är signifikant, kassera det som inte är det, och låt resten bli nya hypoteser i nästa kvartals testplan.
