A/B test: velikost vzorku, délka a vyhodnocení

A/B test porovnává dvě verze téže stránky tak, že návštěvníky náhodně rozdělí na dvě skupiny a každé ukáže jinou variantu. Důvěryhodný výsledek dá jen tehdy, když se velikost vzorku a délka testu určí před spuštěním a vyhodnocení proběhne až po jejich dosažení. Většina chybných závěrů nevzniká špatným nápadem, ale tím, že se test ukončí ve chvíli, kdy čísla zrovna vypadají dobře.

Hypotéza a jediná změna

Test začíná větou, kterou lze vyvrátit: „Když poptávkový formulář zkrátíme ze sedmi polí na čtyři, odešle ho větší podíl návštěvníků, protože vyplnění zabere méně času.“ Taková věta má tři části – co se změní, jaký ukazatel se má pohnout a proč. Právě zdůvodnění je cenné, protože i neúspěšný test pak něco řekne o návštěvnících.

Varianta B se má od původní verze lišit v jedné věci. Pokud se zároveň změní nadpis, fotografie i barva tlačítka, test sice může ukázat rozdíl, ale nikdo nezjistí, která úprava ho způsobila. Hlavní ukazatel se volí jeden a předem. Kdo po skončení prochází deset různých metrik a hledá tu, která vyšla, téměř vždy nějakou najde, jenže náhodou.

Náhodné rozdělení návštěvníků

O tom, kterou verzi člověk uvidí, musí rozhodovat náhoda, nikoli čas, zařízení nebo zdroj návštěvy. Ukázat verzi A v pondělí a verzi B v úterý není test, protože se obě skupiny liší i dnem v týdnu. Testovací nástroj proto přiděluje variantu při první návštěvě a zapamatuje si ji, obvykle pomocí cookie, aby vracející se návštěvník viděl stále totéž.

Po spuštění bych jako první zkontroloval, zda poměr skupin odpovídá nastavení. Má-li být rozdělení půl na půl a jedna varianta dostává znatelně víc lidí, je chyba v technickém nasazení a výsledkům se nedá věřit. Typickou příčinou bývá přesměrování, které u jedné varianty část návštěv ztratí, nebo skript, jenž se na pomalém připojení nestihne načíst.

Velikost vzorku se počítá před startem

Potřebný počet návštěvníků v každé variantě vychází ze čtyř vstupů. Prvním je současný konverzní poměr stránky, který zjistíte z analytiky. Druhým nejmenší rozdíl, který má pro vás praktický význam a který chcete umět zachytit. Třetím hladina významnosti, tedy přípustné riziko, že test ohlásí rozdíl, který ve skutečnosti neexistuje; běžně se volí pět procent. Čtvrtým síla testu, pravděpodobnost, že skutečný rozdíl neunikne; obvyklá hodnota je osmdesát procent.

Výpočet udělá volně dostupná kalkulačka velikosti vzorku nebo statistický software. Důležitá je jedna souvislost: čím menší rozdíl chcete odhalit, tím víc návštěvníků potřebujete, a potřeba roste velmi rychle. Poloviční rozdíl vyžaduje zhruba čtyřnásobný vzorek. Podle mě je poctivé přiznat si to předem. Web s několika desítkami konverzí měsíčně drobné úpravy spolehlivě neověří a lépe poslouží rozhovory se zákazníky nebo testování velkých, odvážných změn.

Délka testu v celých týdnech

Z velikosti vzorku a běžné návštěvnosti vyjde počet dní. Ten se zaokrouhluje nahoru na celé týdny, protože chování návštěvníků se během týdne mění. Lidé, kteří na web účetní kanceláře přijdou v úterý dopoledne z pracovního počítače, se rozhodují jinak než ti, kdo ho prohlížejí v neděli večer na telefonu. Test dlouhý deset dní by některé dny zahrnul dvakrát a jiné jednou.

Zvolil bych nejméně dva celé týdny i tehdy, když se potřebný vzorek naplní dřív. Krátký test snadno zkreslí jednorázová událost, například rozesílka nebo sváteční den. U stálých návštěvníků se navíc projevuje efekt novosti: na změnu zpočátku reagují jen proto, že je nová, a po pár dnech se jejich chování vrátí k obvyklému.

Statistická významnost a proč nesledovat průběžný stav

Po skončení nástroj spočítá, jak pravděpodobné by bylo naměřit takový nebo větší rozdíl, kdyby mezi verzemi ve skutečnosti žádný nebyl. Je-li tato pravděpodobnost menší než zvolená hladina významnosti, výsledek se označí za statisticky významný. Neříká to, že varianta B je lepší s jistotou devadesáti pěti procent, ani jak velký přínos bude mít po nasazení. K tomu slouží interval spolehlivosti, který ukazuje rozmezí, v němž skutečný rozdíl nejspíš leží.

Průběžné nahlížení do výsledků je největší past. Rozdíl mezi variantami během testu kolísá a téměř v každém testu nastane okamžik, kdy na chvíli překročí hranici významnosti. Kdo test zastaví právě tehdy, mnohonásobně zvyšuje riziko falešného vítěze. Klasický výpočet počítá s jediným vyhodnocením na konci. Některé nástroje používají sekvenční metody, které průběžnou kontrolu dovolují; to je ale vlastnost konkrétního nástroje, kterou je třeba ověřit v jeho dokumentaci.

Co udělat s nerozhodným výsledkem

Většina testů skončí bez významného rozdílu a není to selhání. Nerozhodný výsledek znamená, že změna nemá vliv, nebo má vliv menší, než jaký byl test schopen zachytit. Prodlužovat test, dokud nevyjde, je jen jiná podoba průběžného nahlížení. Sám bych v takové situaci nasadil tu variantu, která je jednodušší na údržbu, zapsal předpoklad i výsledek do společného přehledu a pokračoval další otázkou.

Praktický první krok je tedy spíš papírový než technický. Vyberte stránku s nejvíce konverzemi, sepište hypotézu, spočítejte vzorek a z něj délku. Vyjde-li delší než dva měsíce, hledejte výraznější změnu nebo stránku s větší návštěvností. Hodnoty, ze kterých výpočet vychází, a rozdíl mezi relací a uživatelem vysvětluje přehled o tom, jak funguje webová analytika. Testujete-li dvě verze rozesílky nebo inzerátu, rozlišíte je v přehledech pomocí pravidel, která obsahuje návod na označování odkazů parametry UTM.

Zdroje

  • Ron Kohavi, Diane Tang, Ya Xu: Trustworthy Online Controlled Experiments – A Practical Guide to A/B Testing, Cambridge University Press
  • Evan Miller: How Not To Run an A/B Test; Sample Size Calculator (evanmiller.org)
  • Jacob Cohen: Statistical Power Analysis for the Behavioral Sciences, nakladatelství Lawrence Erlbaum Associates
  • American Statistical Association: Statement on Statistical Significance and P-Values
Našli jste v článku chybu?

Publikováno: 19. 08. 2026

Kategorie: Technologie