- Har en lang liste af testideer, men ingen klar måde at afgøre, hvad der skal testes først
- Har testet detaljer som knapfarve eller emojis uden at se mærkbar effekt på konverteringen
- Vil basere testprioritering på reel impact i stedet for, hvad der lige falder en ind
- Ønsker at samle kundeindsigt, adfærdsdata og kontodata i én samlet testplan
Uden en struktureret prioritering ender testarbejdet ofte med at gætte sig frem: skal CTA-knappen have en anden farve? Skal der være musik i videoen? Skal copyen have emojis? Den slags hypoteser er nemme at komme på, men deres impact ligger typisk meget lavt, ofte kun en til to på en skala fra et til fem.
Problemet er, at disse lette, lavthængende ideer ofte fylder testkalenderen, fordi de er hurtige at eksekvere og lette at diskutere. Det betyder, at den begrænsede testbandwidth, man har, bliver brugt på ændringer, der aldrig kunne have flyttet noget markant, selv i det bedste scenarie.
Ikke alle hypoteser er skabt lige. Der er en klar hierarki i, hvor stor en potentiel effekt en given test kan have:
Højeste impact: Fundamental psykologi til et stort publikum
Tests, der rører ved grundlæggende psykologiske drivere hos en bred del af markedet (jeres TAM), har det højeste potentiale, fordi de kan flytte adfærd hos en stor andel af besøgende, ikke kun en smal niche.
Høj impact: Beviste smertepunkter med skalerbart potentiale
Hypoteser bygget på allerede dokumenterede smertepunkter noget, man ved skaber friktion, baseret på reel adfærdsdata har høj impact, fordi de adresserer et kendt problem med potentiale til at skalere over hele sitet.
Lavere impact: Kosmetiske og overfladiske justeringer
Ændringer som knapfarve, emojis i copyen, eller mindre visuelle detaljer ligger typisk lavest i hierarkiet. De kan stadig have en marginal effekt, men de bør ikke optage den samme plads i testkalenderen som højere-impact hypoteser.
At prioritere korrekt kræver, at man samler flere datakilder i én roadmap, i stedet for at basere hypoteser på en enkelt kilde eller mavefornemmelse.
1. Saml kundeindsigt
Direkte feedback, anmeldelser og kundeundersøgelser afslører, hvad kunderne selv beskriver som friktion eller tvivl i deres beslutningsproces.
2. Kombinér med adfærdsdata fra heatmaps og sessionoptagelser
Reelle friktionspunkter, hvor brugere tøver, klikker uden effekt, eller falder fra, bekræfter eller udfordrer det, kundeindsigten peger på.
3. Læg kontodata oven på
Konverteringsrater, exit-rates og trafikmønstre på specifikke sider giver et billede af, hvor stort potentialet reelt er, hvis en given friktion fjernes.
4. Syntetisér til én prioriteret liste
Når disse tre kilder er samlet, kan hver hypotese vurderes ud fra, hvor solidt den er understøttet, og hvor stort det potentielle udfald er, i stedet for at blive vurderet isoleret.
For at gøre prioriteringen konsistent og ikke afhængig af, hvem der sidst havde en mening, scores hver hypotese på en skala fra 1 til 5, baseret på dens forventede impact:
1. Definér, hvad hypotesen reelt tester
Er det en fundamental antagelse om, hvad kunden værdsætter, eller er det en overfladisk detalje?
2. Vurdér, hvor bredt hypotesen rammer
Påvirker den hele TAM, eller kun et smalt segment af besøgende?
3. Tjek, om den er bygget på bevist friktion
Er hypotesen understøttet af reel adfærdsdata, eller er det et gæt uden dokumentation?
4. Placer hypotesen på skalaen, og lad scoren styre rækkefølgen
De højest scorende hypoteser testes først — ikke de letteste eller de mest diskuterede.
Tre tegn på, at jeres testarbejde mangler en reel prioriteringsstruktur:
- Testkalenderen er domineret af kosmetiske detaljer som farver, emojis eller mindre tekstændringer
- I vælger den næste test baseret på, hvad der lige er blevet diskuteret internt, ikke ud fra en score
- I har ingen samlet oversigt, der kombinerer kundeindsigt, adfærdsdata og kontodata i én prioriteret liste
Genkender du et eller flere af disse, er det sandsynligvis tid til at indføre en struktureret scoringsmodel for testhypoteser.
DVISIONMEDIAs tilgang
Vi lader aldrig testkalenderen fyldes med kosmetiske gæt. Vi bruger et dokumenteret Impact Index til at score hver hypotese, før den bliver til en test — baseret på, hvor fundamental den psykologiske antagelse er, hvor bredt den rammer, og hvor solidt den er understøttet af reel adfærdsdata.
Det betyder, at testbandwidth altid går til de hypoteser, der reelt har potentiale til at flytte væksten markant, i stedet for at blive spredt tyndt ud over overfladiske justeringer. Det er en del af den systematiske tilgang, vi bygger ind i vores CRO- og A/B-arbejde gennem E-COM OS.
1. Hvad er ICE-modellen, og hvordan bruges den til at prioritere A/B tests?
ICE-modellen scorer testhypoteser efter Impact, Confidence og Ease — hvor stor effekten potentielt er, hvor sikker man er på hypotesen, og hvor let den er at implementere. Hypoteser med de højeste samlede scores testes først.
2. Hvorfor giver kosmetiske ændringer som knapfarve lavest impact?
Fordi de sjældent rører ved en grundlæggende beslutningsfaktor hos kunden. De kan stadig give en marginal effekt, men potentialet er begrænset sammenlignet med hypoteser, der adresserer fundamentale smertepunkter eller psykologiske drivere.
3. Hvad betyder det, at en hypotese tester "fundamental psykologi til TAM"?
Det betyder, at hypotesen rører ved en grundlæggende beslutningsfaktor, der potentielt påvirker hele det samlede adresserbare marked — ikke kun et smalt segment af besøgende.
4. Hvilke datakilder bør indgå i en testroadmap?
Kundeindsigt (feedback, anmeldelser), adfærdsdata (heatmaps, sessionoptagelser) og kontodata (konverteringsrater, exit-rates). Sammen giver de et mere komplet billede end en enkelt kilde alene.
5. Kan man stadig teste mindre, kosmetiske ændringer?
Ja, men de bør ikke optage samme plads i testkalenderen som højere-impact hypoteser. De kan være relevante som lavthængende tests, når der er kapacitet til overs, ikke som hovedprioritet.

.png)



















.png)






