אסטרטגיה וצמיחה

מובהקות סטטיסטית ב-A/B: מה הנתונים באמת מראים

הדשבורד שלכם אומר "מובהק ב-95%". הנה הבדיקה העובדתית של מה זה באמת מבטיח — וכמה קל לשבור את זה רק על ידי בדיקה תכופה מדי.

צוות oToK11 דקות קריאה
מובהקות סטטיסטית ב-A/B: מה הנתונים באמת מראים

"מובהק סטטיסטית ב-95%" הוא האור הירוק שכל כלי A/B מציג בסוף — הסימן להכריז על מנצח ולשגר. רוב מה שמשווקים מאמינים לגבי המספר הזה מתברר כלא מדויק, ולפעמים ממש שגוי: מה הוא בעצם מבטיח, איך הצצה יומית בדשבורד יכולה לחבל בו בשקט, כמה תנועה תוצאה אמיתית דורשת בפועל, ובאיזו תדירות מבחן בכלל מפיק מנצח מלכתחילה.

יצאנו לחפש את המקורות המקוריים מאחורי כל אחת מהשאלות האלה — המאמרים המקוריים, העבודות שעברו ביקורת עמיתים, והבנצ'מרקים עם גודל מדגם חשוף — במקום הגרסה הממוחזרת מבלוגים. חלק ממה שחוזר בכל מקום מחזיק מעמד בדיוק כפי שטוענים. חלק מזה הוא חשבון פופולרי בלי מקור מקורי שניתן לאתר, שמתברר בכל זאת כנכון. והאמונה הנפוצה ביותר לגבי מה ש"מובהק ב-95%" בעצם אומר מתבררת כפשוט שגויה, לפי מדריך שעבר ביקורת עמיתים ונכתב במפורש כדי לתקן אותה.

עיקרי הדברים

  • בדיקת מבחן כל יום ועצירה ברגע שהוא חוצה "מובהקות של 95%" לא נותנת לכם שיעור שווא אמיתי של 5% — במקרה הגרוע היא יכולה לתפוח ל-26.1%, פי חמישה בערך (Evan Miller, 2010; אושש במאמר שעבר ביקורת עמיתים ב-Operations Research ב-2022).
  • "מובהק ב-95%" לא אומר "95% סיכוי ש-B באמת מנצח את A". מדריך שעבר ביקורת עמיתים לפרשנויות שגויות של ערכי p קורא לקריאה הזו בדיוק "לא" ישיר — ה-5% מתארים שיעור טעות ארוך-טווח של השיטה על פני חזרות רבות, לא את הסיכוי שלכם לטעות בתוצאה הספציפית הזו.
  • נתוני שיעורי הצלחה אמיתיים וחשופים לא מתקרבים ל"רוב המבחנים מנצחים". מדגמים בלתי-תלויים מצאו 8% (Airbnb, 250 רעיונות שנבדקו), 19.1% (2,288 מבחני לקוחות אמיתיים, 2026) ובערך שליש (Microsoft, לפי Ron Kohavi) ממבחנים שמגיעים למנצח מובהק סטטיסטית — ומחקר אחד מצא שכמעט 70% מהמבחנים שבדק לא היו בעלי עוצמה סטטיסטית מספקת מלכתחילה.
  • גודל המדגם הנדרש מתפוצץ ככל שהאפקט שמנסים לזהות או שיעור הבסיס קטנים יותר — מבערך 200 מבקרים לוריאציה כדי לזהות הכפלה של שיעור בסיס של 10%, ועד מעל 500,000 מבקרים לוריאציה כדי לזהות עלייה צנועה על שיעור בסיס מתחת ל-1%.
  • מעקב אחרי הרבה מדדים על מבחן אחד מטה את הסיכויים נגדכם בשקט: מעקב אחרי 20 מדדים בלתי-תלויים בסף הסטנדרטי של 5% נותן בערך 64% סיכוי שלפחות אחד מהם יראה "מובהק" מטעמי מקריות בלבד — הסתברות פשוטה, לא ממצא של מחקר ספציפי.
  • מחקר שעבר ביקורת עמיתים על אפקטי חידוש (novelty) ו"התרגלות" (primacy) מגבה את ההמלצה המעשית להריץ מבחן במשך לפחות מחזור עסקים אחד עד שניים מלאים, ולא להכריז עליו ברגע שהוא נראה גמור.

מה זה בעצם אומר "מובהק סטטיסטית ב-95%"?

מבחן מובהקות עונה על שאלה צרה אחת: אם לא הייתה שום הבדל אמיתי בין A ל-B, כמה מפתיעים היו הנתונים שנאספו בפועל? "מובהק ב-95%" (במילים אחרות, p קטן מ-0.05) אומר שהתבנית הספציפית הזו של תוצאות — או תבנית קיצונית יותר — הייתה מופיעה בפחות מ-5% מהמקרים ממש במקרה, אם A ו-B היו באמת זהים.

זו טענה הרבה יותר צרה מזו שרוב האנשים יוצאים עם ההרגשה שהם למדו. מדריך שעבר ביקורת עמיתים ונכתב במפורש כדי לתקן טעויות סטטיסטיות נפוצות — "Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations", שפורסם בכתב העת European Journal of Epidemiology ב-2016 על ידי קבוצת סטטיסטיקאים מובילים — מפרט בשם את שתי הפרשנויות השגויות הנפוצות ביותר ודוחה את שתיהן במפורש.

מה אנשים חושבים ש"מובהק ב-95%" אומרמה זה באמת אומר
"יש 95% סיכוי שהוריאציה שלי באמת מנצחת את המקור"ה-95% מתארים את ההתנהגות ארוכת-הטווח של שיטת הבדיקה, לא את התוצאה הספציפית הזו. חוזרים על אותו סוג מבחן הרבה פעמים, ובערך 95% מהטווחים שהוא מפיק יכילו את הערך האמיתי — ההסתברות שייכת לשיטה, לא למספר הספציפי הזה על המסך שלכם (GrowthBook, 2026).
"אם אשגר את זה, יש רק 5% סיכוי שאני טועה""לא" ישיר, לפי המדריך שעבר ביקורת עמיתים: ברגע שהחלטתם לשגר, הסיכוי שלכם לטעות במקרה הספציפי הזה הוא 100% או 0% — פשוט לא יודעים איזה. ה-5% הוא שיעור הטעות על פני מחקרים חוזרים רבים, לא הסתברות שמוצמדת להחלטה הספציפית הזו (Greenland ואחרים, European Journal of Epidemiology, 2016).
"מספר מובהקות גבוה יותר אומר אפקט גדול ואמיתי יותר"מובהקות מודדת כמה מפתיעים היו הנתונים בהנחה ש"אין הבדל אמיתי", לא כמה גדול האפקט האמיתי — זו שאלה נפרדת, שמקבלת תשובה טובה יותר מרווח הביטחון סביב העלייה מאשר מרמת המובהקות לבדה (Georgi Georgiev, Analytics-Toolkit).

שום דבר מזה לא אומר שמבחני מובהקות חסרי תועלת — זה אומר שהמספר עונה על שאלה טכנית וצרה יותר מהמשפט הפשוט שרוב האנשים אומרים בקול כשהם מדווחים עליו.

האם הצצה יומית במבחן שלכם משנה את התוצאה?

זו הדרך הנפוצה ביותר שמבחן A/B אמיתי מפסיק בשקט לתאר את מה שהוא טוען לתאר: משווק פותח את הדשבורד פעם ביום, וברגע שהוא חוצה "מובהקות של 95%", המבחן מוכרז והמנצח משוגר.

המאמר הידוע מ-2010 של Evan Miller, "How Not To Run An A/B Test", חישב בדיוק את ההרגל הזה. במקרה הגרוע הריאליסטי ביותר — בדיקה רציפה ועצירה ברגע שהתוצאה חוצה את סף המובהקות של 5% — שיעור השווא האמיתי הוא לא 5%. הוא 26.1%: "יותר מפי חמישה ממה שכנראה חשבתם שהיא רמת המובהקות". מאמר משנת 2022 שעבר ביקורת עמיתים בכתב העת Operations Research, מאת Johari, Koomen, Pekelis ו-Walsh (Stanford / Optimizely), הגיע לאותה מסקנה בדרך סטטיסטית פורמלית שונה לגמרי: "אפילו עם 10,000 דגימות — גודל מדגם שכיח למדי בבדיקות A/B מקוונות — טעות מסוג ראשון יכולה בקלות לעלות פי חמישה". שתי שיטות בלתי-תלויות, במרחק של יותר מעשור זו מזו, שנוחתות על בערך אותו מספר.

כמה פעמים בדקתם את המבחן לפני העצירההמובהקות שהייתם צריכים לראות כדי להחזיק שיעור אמיתי של 5%
12.9%
22.2%
31.8%
51.4%
101.0%
כמה הצצה יומית ועצירה מוקדמת מנפחות את שיעור השווא האמיתי שלכם?
גודל מדגם קבוע, בלי הצצות (השיעור שרוב האנשים מניחים)
5%
בדיקה רציפה, עצירה ברגע שה-p קטן מ-0.05 (המקרה הגרוע)
26.1%
מקור: Evan Miller, "How Not To Run An A/B Test" (2010); אושש על ידי Johari, Koomen, Pekelis ו-Walsh, Operations Research, כרך 70 (2022)

המסקנה של Miller עצמו, בציטוט ישיר: עד שעיצובים סדרתיים (sequential) או בייסיאניים ייבנו לתוך התוכנה שמריצה את הבדיקה, "כל מי שמריץ ניסויי רשת צריך להריץ רק ניסויים שבהם גודל המדגם נקבע מראש, ולדבוק בגודל המדגם הזה במשמעת כמעט-דתית".

כמה מדגם באמת צריך לפני שהתוצאה אומרת משהו?

כמות התנועה שמבחן צריך כדי לזהות אפקט אמיתי באופן אמין תלויה בשני דברים: שיעור הבסיס שלכם, וכמה קטנה העלייה שאתם מנסים לתפוס. שניהם דוחפים לאותו כיוון — שיעור בסיס נמוך יותר או אפקט קטן יותר שרוצים לזהות, שניהם אומרים הרבה יותר מבקרים, לא רק קצת יותר.

מחשבון גודל המדגם הציבורי של Evan Miller עצמו נותן נקודת נתונים מקורית ומדויקת אחת: זיהוי קפיצה משיעור בסיס של 10.2% ל-13.2% דורש 1,657 מבקרים לוריאציה. באמצעות אותה שיטה סטנדרטית שמאחורי המחשבון הזה — מבחן שתי-פרופורציות בעוצמה של 80% ורמת ביטחון של 95% — המספרים למטה מראים כמה מהר הדרישה הזו משתנה ככל שהאפקט המבוקש קטן או שיעור הבסיס יורד.

שיעור בסיסהעלייה שמנסים לזהותמבקרים נדרשים לוריאציה
10.2%3 נקודות מוחלטות, ל-13.2%1,657 (המחשבון הציבורי של Evan Miller)
10%הכפלה, ל-20%≈ 200
10%עלייה יחסית של 5%, ל-10.5%≈ 57,800
0.5%עלייה יחסית של 8%, ל-0.54%≈ 507,500

עלייה עדינה בדף עם תנועה נמוכה יכולה לדרוש יותר מבקרים ממה שרוב האתרים יראו אי-פעם, והפער הזה הוא בדיוק מה שנוטה להישאר לא נמדד: ביקורת אמיתית וחשופה של 115 מבחני A/B של לקוחות מצאה שכמעט 70% מהם לא היו בעלי עוצמה סטטיסטית מספקת מלכתחילה — כלומר לגודל המדגם מעולם לא היה סיכוי אמיתי לזהות את האפקט שהמבחן בעצם חיפש, לא משנה מה הדשבורד הראה בסוף (Georgi Georgiev, Analytics-Toolkit, 2018).

באיזו תדירות מבחן A/B באמת מפיק מנצח אמיתי?

"מריצים מבחן, משגרים את המנצח" מרמז שמנצחים הם התוצאה הרגילה. הם לא. כל מדגם חשוף ובלתי-תלוי שמצאנו שם את הנתח האמיתי של מבחנים שמגיעים למנצח מובהק סטטיסטית הרבה מתחת לחצי — המספר המדויק תלוי בעיקר במי ערך את המבחנים, ובאיזו רמת קפדנות.

Ron Kohavi, שניהל ניסויים ב-Microsoft ואחר כך ב-Airbnb, תיאר את התבנית באותה צורה על פני כמה הרצאות וראיונות: ב-Microsoft, רק בערך שליש מהרעיונות שנבדקו שיפרו בפועל את המדד שהם תוכננו לשפר. ב-Airbnb, בראיון מ-2021 שפורסם מחדש על ידי Wingify/AB Tasty, הוא נתן מספר חד יותר: מתוך 250 רעיונות שנבדקו בניסויים מבוקרים, רק 20 — 8% — הוכיחו השפעה חיובית על המדדים המרכזיים. אבל 20 המנצחים האלה לבדם עדיין היו שווים את זה: יחד הם הובילו לשיפור של 6% בהמרת הזמנות, "בשווי מאות מיליוני דולרים". בקצה השני, ביקורת של ConversionTeam על 2,288 מבחני A/B אמיתיים של לקוחות על פני 71 התקשרויות, באמצעות מבחן t חד-זנבי חשוף ברמת ביטחון של 95%, מצאה ש-19.1% הגיעו למנצח מובהק סטטיסטית — בעוד סקירה של Analytics-Toolkit על 115 מבחני לקוחות אמיתיים מצאה ש-39.13% הגיעו, עוד לפני שהוצאו המבחנים חסרי העוצמה הסטטיסטית.

באיזו תדירות מבחן A/B אמיתי מגיע למנצח מובהק סטטיסטית?
Airbnb — 20 מתוך 250 רעיונות שנבדקו (ראיון עם Kohavi, 2021)
8%
ConversionTeam — 2,288 מבחני לקוחות מבוקרים (2026)
19.1%
Analytics-Toolkit — 115 מבחני לקוחות אמיתיים (2018)
39.1%
Microsoft — "בערך שליש", לפי התיאור של Kohavi
33%
מקור: Kohavi (ראיון "1,000 Experiments Club" של Wingify/AB Tasty, 2021); ConversionTeam, "A/B Test Win Rate" (2,288 מבחנים, עודכן 2026); Georgi Georgiev, Analytics-Toolkit (115 מבחנים, 2018)

זה מתיישב עם מה שמצאנו כשבדקנו דפי נחיתה באופן ספציפי בכתבה שלנו על שיעור המרה: שיעורי הצלחה מפורסמים שם נעים בערך 12%-20% על פני פלטפורמות בדיקה מובילות. הפיזור בין כל המספרים האלה הוא לא סתירה — הוא בעיקר משקף עד כמה הרעיונות שנבדקו היו מסוננים מראש, ובאיזו קפדנות הוחזק הסף של "מובהק סטטיסטית".

אם עוקבים אחרי עשרה מדדים במבחן אחד, האם הסיכויים באמת עדיין 5%?

סף מובהקות של 5% אומר שלמדד בודד שנבחר מראש יש בערך 5% סיכוי להיראות "מובהק" באופן שגוי ממש במקרה, אם אין אפקט אמיתי. הערבות הזו מפסיקה לחול בשקט ברגע שעוקבים אחרי הרבה מדדים על אותו מבחן ומכריזים על ניצחון אם אחד מהם נדלק.

64%

הסיכוי שלפחות אחד מ-20 מדדים בלתי-תלויים שעוקבים אחריהם יראה "מובהק סטטיסטית" ממש במקרה, אם כל אחד נבדק בסף הסטנדרטי של 5% — 1 פחות 0.95 בחזקת 20, הסתברות פשוטה, לא ממצא ממחקר ספציפי. תיקונים כמו Bonferroni או Benjamini–Hochberg קיימים בדיוק כדי לשלוט בזה.

הניסוח הספציפי "20 מדדים → 64%" מופיע בעשרות בלוגים של CRO ובתיעוד של פלטפורמות בדיקה, כמעט תמיד בלי מקור מקורי מצוטט — מקרה נדיר של מספר שחוזר בהרחבה שהוא בעצם חשבון נכון, פשוט בלי זיכוי. התיקון המעשי פשוט יותר מהמתמטיקה: בוחרים מדד ראשי אחד לפני שהמבחן מתחיל, ומתייחסים לכל מה שעוקבים אחריו חוץ מזה ככיווני, לא כהוכחה.

כמה זמן באמת צריך להריץ מבחן לפני שסומכים עליו?

המדריך של CXL למבחני A/B מציג את ההמלצה המעשית בפשטות: "קובעים מראש גודל מדגם ומריצים את המבחן שבועות שלמים, בדרך כלל לפחות שני מחזורי עסקים". ההיגיון קונקרטי — מבקרים בימי חול ובסופי שבוע מתנהגים אחרת, מקורות תנועה משתנים מיום ליום, ושינוי יכול להיראות טוב יותר ממה שהוא באמת פשוט כי הוא חדש.

הנקודה האחרונה הזו — אפקט החידוש (novelty), ותמונת הראי שלו, אפקט ה"התרגלות" (primacy, שבו שינוי לא-מוכר נראה גרוע יותר בהתחלה ומשתפר ככל שאנשים מתרגלים אליו) — היא לא רק כלל אצבע. מאמר משנת 2022 שעבר ביקורת עמיתים מצוות פלטפורמת הניסויים של Microsoft עצמה, שפורסם בכתב העת Technometrics, מידל בדיוק את התבנית הזו עם נתוני ניסוי אמיתיים ואישר שהאפקט הנמדד באמצע מבחן "לא תמיד יציב לצמיתות", ולעיתים קרובות חושף מגמה עולה או יורדת ככל שהמבחן ממשיך.

הגרסה המעשית: קובעים גודל מדגם ותאריך סיום לפני שמתחילים, לא מכריזים על מבחן מוקדם רק כי הוא נראה גמור, ואם הכלי מאפשר — עוקבים אחרי המגמה של העלייה לאורך זמן. תוצאה שמתכווצת או גדלה ככל שהמבחן ממשיך היא בדיוק התבנית של חידוש/התרגלות שהמחקר מתאר, וזה אומר שהמספר ביום השלישי לא היה התשובה האמיתית.

איך בפועל מריצים מבחן שיחזיק מעמד?

  1. 1בוחרים דבר אחד לשנות ומדד ראשי אחד לפני שמתחילים — לא חמישה מדדים שתבחרו מועדף מביניהם בדיעבד.
  2. 2מחשבים את גודל המדגם הדרוש לעלייה הכי קטנה ששווה לזהות, לפי שיעור הבסיס הנוכחי שלכם — לפני שהמבחן מתחיל, לא לפי הצצה ביום השלישי.
  3. 3קובעים מראש תאריך סיום או גודל מדגם ודבקים בו. תוצאה שנראית מובהקת ביום השני היא בדרך כלל רעש, לא אות — ראו את מספרי ההצצה למעלה.
  4. 4מריצים לפחות מחזור עסקים אחד עד שניים מלאים כדי שתמהיל ימי חול/סוף שבוע ושינויים במקורות תנועה יתאזנו, ועוקבים אחרי מגמה שמרמזת על אפקט חידוש או התרגלות.
  5. 5מתייחסים לכל מדד חוץ מהמדד הראשי שלכם ככיווני. ניצחון משני אמיתי מגיע לו מבחן המשך משלו, לא החלטת שיגור על בסיסו לבד.

קמפיינים באימייל ב-oToK בודקים שתי וריאציות של שורת נושא או תוכן על חלק מהקהל ושולחים את המנצחת לכל השאר אוטומטית, עם גידור סטטיסטי מובנה כך שמדגם קטן מדי אף פעם לא יכול לבחור מנצח — זמין בכל תוכנית, כולל Free. דפי נחיתה נושאים את אותו רעיון ברמת הדף: מפצלים תנועה בין שתי גרסאות שפורסמו ומכריזים על מנצחת עם בדיקת מובהקות מובנית, זמין ב-Growth ומעלה.

שיתוף המאמר

שאלות נפוצות

האם "מובהק ב-95%" אומר שיש 95% סיכוי שהוריאציה שלי באמת מנצחת?
לא. מדריך שעבר ביקורת עמיתים לפרשנויות שגויות בסטטיסטיקה קורא לקריאה הזו "לא" ישיר: ה-95% מתארים את שיעור הטעות ארוך-הטווח של שיטת הבדיקה על פני מבחנים חוזרים רבים, לא את הסיכויים שמוצמדים לתוצאה הספציפית הזו. ברגע שהחלטתם לשגר, אתם או צודקים או טועים לגבי המקרה הספציפי הזה — פשוט לא יודעים איזה, בוודאות של 95%.
אפשר לעצור מבחן מוקדם אם הוא כבר נראה כמו מנצח ברור אחרי יומיים?
זה בדיוק ההרגל ששובר את ההבטחה של מבחן המובהקות. בדיקה רציפה ועצירה ברגע שחוצים מובהקות של 5% יכולה לדחוף את שיעור השווא האמיתי ל-26.1%, לפי הניתוח המקורי בנושא — יותר מפי חמישה מהשיעור שאתם חושבים שאתם מקבלים. קובעים גודל מדגם לפני שמתחילים ודבקים בו.
למה מקורות שונים מדווחים על שיעורי הצלחה כל כך שונים למבחני A/B — 8%, 19%, או שליש?
הפער נובע בעיקר ממתודולוגיה, לא מסתירה: באיזו קפדנות הוחזק סף המובהקות, האם מבחנים חסרי עוצמה סטטיסטית הוצאו או נספרו כהפסדים — ובעיקר, עד כמה הרעיונות שנבדקו היו מסוננים מראש. המספר של 8% מ-Airbnb מכסה 250 רעיונות גולמיים; המספר של בערך שליש מ-Microsoft, לפי Kohavi, מתאר רעיונות שכבר עברו סף פנימי לפני הבדיקה.
כמה מדדים אפשר לעקוב אחריהם בבטחה במבחן אחד?
כמה שרוצים להסתכל עליהם — אבל רק אחד צריך להחליט אם משגרים. מעקב אחרי 20 מדדים בלתי-תלויים בסף הסטנדרטי של 5% נותן בערך 64% סיכוי שלפחות אחד יראה "מובהק" ממש במקרה. בוחרים מדד ראשי יחיד לפני שהמבחן מתחיל ומתייחסים לשאר ככיווניים.
האם בדיקת ה-A/B המובנית ב-oToK מובהקת סטטיסטית, או שצריך לחשב את זה בעצמי?
מבחני A/B באימייל ב-oToK מפצלים חלק מהקהל בין שתי וריאציות ובוחרים מנצחת אוטומטית עם גידור סטטיסטי מובנה, כך שמדגם קטן מדי לא יכול להכריע תוצאה — זמין בכל תוכנית. וריאציות A/B בדפי נחיתה עובדות באותו אופן ברמת הדף, עם בדיקת מובהקות מובנית, ב-Growth ומעלה. עדיין אתם מחליטים מה לבדוק ולכמה זמן; הפלטפורמה מטפלת בחשבון המובהקות.

מוכנים לשדרג את התקשורת עם הלקוחות?

להתחיל לעבוד עם oToK — חיבור מספר WhatsApp לוקח דקות ספורות.

בלי כרטיס אשראי — אפשר להתחיל מיד