A/B testing
คำตอบ สั้น ๆ
A/B testing หรือ split testing คือการสุ่มส่ง
- ได้ผล เมื่อหน้าเก็บ conversion ได้มากพอที่จะ
ตรวจจับ การเพิ่มขึ้นที่คุณสนใจ ที่ระดับนัยสำคัญ 95% และอำนาจการทดสอบ (power) 80% ตามปกติ ต้องใช้ประมาณ 400 ครั้งต่อเวอร์ชัน สำหรับการเพิ่มขึ้นเชิงสัมพัทธ์ 20% และ 1,600 ครั้ง สำหรับการเพิ่มขึ้น 10% ล้มเหลว เมื่อหยุดทดสอบเร็วเกินไป ใช้ตัวชี้วัด ผิด หรือทดสอบกับ conversion เพียงไม่กี่สิบครั้งต่อเดือน- เมื่อ
ทราฟฟิก ไม่พอ ให้แก้ปัญหาที่เห็นชัด ทำวิจัยกับคนจริง ทดสอบการเปลี่ยนแปลงใหญ่ ๆ แทนการปรับเล็กน้อย และลองทดสอบข้อความ ในโฆษณาก่อน
A/B testing ทำงานอย่างไร
- Split URL testing ส่ง
ทราฟฟิก ไปยังสองหน้าที่อยู่คนละ URL เหมาะกับหน้าที่ออกแบบ ใหม่ทั้งหน้า - Multivariate testing ทดสอบทุกชุดผสม ของการเปลี่ยนแปลงหลายจุด
พาดหัว สองแบบ รูปสองแบบ และปุ่มสองแบบ รวมเป็นแปดเวอร์ชัน แต่ละเวอร์ชันต้องได้ทราฟฟิก ส่วนของตัวเอง จึงเหมาะกับหน้าที่มีคนเข้าเยอะมากเท่านั้น
4 ตัวเลขสำคัญในทุกการทดสอบ
เครื่องคำนวณขนาดกลุ่มตัวอย่าง (sample size calculator) ต้องการข้อมูลสี่อย่าง:
- อัตรา conversion
พื้นฐาน (baseline): หน้านั้นเกิด conversion เท่าไรกับทราฟฟิก ที่คุณจะทดสอบ ดูจาก GA4ย้อนหลัง สี่ถึงแปดสัปดาห์ - ผลต่าง
ขั้นต่ำ ที่ตรวจจับ ได้ (MDE): การปรับปรุงที่น้อยที่สุดที่คุ้มจะตรวจจับ มักคิดเป็นการเพิ่มขึ้นเชิงสัมพัทธ์ เช่น จาก 3% เป็น 3.6% คือเพิ่มขึ้น 20% - ระดับ
นัยสำคัญ (significance level): ตามธรรมเนียมคือ 5% ซึ่งเป็นที่มาของ “ความมั่นใจ 95%” ใช้จำกัดว่าคุณจะประกาศผู้ชนะ บ่อยแค่ไหน ทั้งที่ไม่มีความต่างจริง - อำนาจการทดสอบ (statistical power): ตามธรรมเนียมคือ 80% คือโอกาสที่จะ
ตรวจจับ การปรับปรุงจริง ที่มีขนาดเท่ากับ MDE ของคุณ
เช็ก ขนาดตัวอย่างก่อนลงมือสร้าง
คำนวณตัวเลขก่อน
| การเพิ่มขึ้นเชิงสัมพัทธ์ ที่ต้องการ |
Conversion ต่อเวอร์ชัน (โดยประมาณ) | |
|---|---|---|
| 10% (3.0% → 3.3%) | 1,600 | 53,000 |
| 20% (3.0% → 3.6%) | 420 | 14,000 |
| 30% (3.0% → 3.9%) | 190 | 6,500 |
| 50% (3.0% → 4.5%) | 75 | 2,500 |
สำหรับยอดรวมใน A/B test ให้คูณตัวเลขต่อเวอร์ชันด้วยสอง และบวกเพิ่มอีกหนึ่งเวอร์ชัน สำหรับทุก variant ที่เพิ่มเข้ามา เครื่องคำนวณแต่ละตัวใช้สูตรต่างกัน
ตัวอย่างการคำนวณ
- การ
ตรวจจับ การเพิ่มขึ้น 20% ต้องใช้ผู้เข้าชม รวมประมาณ 28,000 คน: ประมาณเจ็ดเดือน - การ
ตรวจจับ การเพิ่มขึ้น 50% ต้องใช้ประมาณ 5,000 คน: ห้าถึงหกสัปดาห์
หน้านี้จึงทดสอบความต่างใหญ่ ๆ ได้ เช่น
แม้จะได้กลุ่มตัวอย่างครบเร็ว ก็ควรทดสอบอย่างน้อยสองสัปดาห์เต็ม เพราะ
หยุดเร็ว ได้ผู้ชนะ ปลอม
สาเหตุที่พบบ่อยของ
ปัญหาการแอบดูผล
ช่วงแรกตัวเลขยังน้อย และความต่าง
วิธีแก้ไม่มีอะไร
ผลหลอกตาแบบอื่น ๆ
- สัดส่วนกลุ่มไม่ตรง (sample ratio mismatch) คุณตั้งไว้ 50/50 แต่ได้ 55/45 จาก
ผู้เข้าชม หลายพันคน แปลว่ามีบางอย่าง เช่น redirect กำลังทำให้ผู้เข้าชม หายไป อย่าเชื่อผลนั้น ตัวชี้วัด ผิด ยอดคลิกปุ่มเพิ่มขึ้น แต่การติดต่อสอบถามที่ส่งสำเร็จไม่เพิ่ม ให้เลือกตัวชี้วัด หลักหนึ่งตัวไว้ล่วงหน้า และตรวจให้แน่ใจว่า วัดผลใน GA4 อย่างถูกต้อง เปรียบเทียบ หลายอย่างเกินไป ถ้าดูตัวชี้วัด สิบตัว หรือแยกดูทุกอุปกรณ์และทุกประเทศก็มี แนวโน้ม ที่บางอย่างจะดูมีนัยสำคัญ เพราะความบังเอิญ- คำสาปของ
ผู้ชนะ (winner’s curse)ผู้ชนะ จากการทดสอบที่กลุ่มตัวอย่างไม่พอ มักแสดงผลเกินจริง ให้คาดว่าผลจะน้อยลงเมื่อนำไปใช้จริง - เปลี่ยนอะไร
ระหว่าง ทดสอบ โฆษณาใหม่ การปรับงบ หรือการแก้ไขหน้า จะเปลี่ยนว่าใครเข้ามาและเขาเห็นอะไร ทำให้ผลคลุมเครือ
ก่อนประกาศ
ควร A/B test อะไร และอะไรควรข้าม
หน้า
| ควรทดสอบ | ทำไมจึงเปลี่ยน conversion ได้ | ตัวอย่าง |
|---|---|---|
| เปลี่ยนสิ่งที่ |
“นัดปรึกษา” เทียบกับ “ขอราคาประเมินแบบราคาคงที่” | |
| ชี้ขาดว่า |
เน้นผลลัพธ์ เทียบกับเน้นฟีเจอร์ | |
| ตอบ |
||
| ความยาว |
แลกกัน |
สามช่อง เทียบกับเจ็ดช่อง ตัดสิน |
| ความยาวและลำดับของหน้า | ปรับความละเอียดของ |
หน้าสั้น เทียบกับหน้าที่ตอบ |
สิ่งที่ไม่ค่อยคุ้มจะทดสอบ ที่
ถ้าต้องการ
ทดสอบโดยไม่เสีย SEO และความเร็ว
ถ้าหน้านั้นปรากฏบน Google ให้ทำตามแนวทางของ Google Search Central เรื่อง การลด
- อย่า cloak คือห้ามแสดงเวอร์ชันหนึ่งให้ Googlebot แต่แสดงอีกเวอร์ชันให้คน Google ถือว่า cloaking เป็นการละเมิดนโยบายสแปม
- ใช้
rel="canonical"บน URL ของ variant โดยชี้กลับไปที่หน้าต้นฉบับ แทนการใช้noindex - ใช้ redirect แบบ 302 (ชั่วคราว) ไม่ใช่ 301 ในการทดสอบแบบ split URL เพื่อให้ Google ยังเก็บ URL เดิมไว้
- ปิดการทดสอบทันทีเมื่อเสร็จ แล้วลบ URL ของ variant การ redirect และสคริปต์ทดสอบออก
ระวังต้นทุนด้านความเร็ว
เครื่องมือ ทดสอบหลัง Google Optimize ปิดตัว
Google Optimize ปิดตัวไปเมื่อเดือนกันยายน 2023 และ GA4 เองก็ไม่มีฟีเจอร์ทำการทดลอง ณ เวลาที่เขียน (มิถุนายน 2026)
- แพลตฟอร์มแบบ client-side ที่มี
เครื่องมือ แก้ไขแบบภาพ:นักการตลาด ใช้ได้รวดเร็ว แต่มักเกิด flicker - แพลตฟอร์มแบบ server-side และ feature flag: ไม่มี flicker แต่ต้องใช้เวลาของ
นักพัฒนา เครื่องมือ สร้าง แลนดิ้งเพจ และปลั๊กอินของ CMS ที่แบ่งทราฟฟิก ระหว่าง เวอร์ชันของหน้า- ฟีเจอร์ทดลองของแพลตฟอร์มโฆษณา เช่น ใน Google Ads และ Meta
ไม่ว่าจะใช้แบบไหน ให้ตัดสินแต่ละเวอร์ชันจากการติดต่อสอบถาม ที่ KPI ของ
ทราฟฟิก น้อย ควรทำอะไรแทน
แก้สิ่งที่ไม่ต้องพิสูจน์
วิจัยกับคนจริง
การวิจัยเชิงคุณภาพแสดงให้เห็นว่า ทำไมคนถึงลังเล ซึ่งการทดสอบไม่มีวันบอกได้ บทความของ Nielsen Norman Group โดย Jakob Nielsen ซึ่งถูกอ้างถึงอย่าง
- ให้คนห้าคนจากกลุ่ม
เป้าหมาย ของคุณ ลองใช้หน้านั้นบนมือถือ เพื่อทำสิ่งที่หน้าต้องการ แล้วคอยสังเกต โดยให้เขาพูดสิ่งที่คิดออกมาดัง ๆ - ถามฝ่ายขายว่า ลูกค้าที่สนใจมักถามอะไรก่อนซื้อ แล้วตรวจว่าหน้าตอบ
คำถาม นั้นหรือยัง - ถามคนที่เพิ่งติดต่อเข้ามาว่า “อะไรที่เกือบทำให้คุณไม่ติดต่อมา?”
ทดสอบห้าวินาที
ให้ใครสักคนดูหน้านั้นห้าวินาที ซ่อนหน้า แล้วถามว่าหน้านี้เสนออะไร เหมาะกับใคร และเขาจะทำอะไรต่อ ถ้าเขาตอบไม่ได้ แปลว่า
เทียบก่อนและหลังอย่างระมัดระวัง
การเปลี่ยนแปลงที่ทำโดยไม่ได้ทดสอบ ก็ยังสอนอะไรคุณได้:
ถึงอย่างนั้น คุณก็แยกผลของการเปลี่ยนแปลง ออกจากปัจจัยอื่นที่ขยับไปพร้อมกันได้ไม่หมด จึงควรมองการเปลี่ยนแปลงที่ใหญ่และ
ทดสอบข้อความ ในโฆษณาก่อน
ลงโฆษณาที่ให้
เปลี่ยนให้ใหญ่ขึ้น หรือรวมทราฟฟิก
คำถาม ที่พบบ่อย
A/B test ควรทดสอบนานแค่ไหน?
จนกว่าจะได้ขนาดกลุ่มตัวอย่าง ที่คำนวณไว้ก่อนเริ่ม และนานอย่างน้อยสองสัปดาห์เต็ม ถ้านั่นหมายถึงนานกว่าสองสามเดือน ให้ทดสอบการเปลี่ยนแปลงที่ใหญ่กว่านี้แทน
A/B testing ทำร้าย SEO ไหม?
ไม่ ถ้าทำตามแนวทางของ Google คือไม่ cloak ใส่ canonical tag บน URL ของ variant ใช้ redirect แบบชั่วคราว และปิดการทดสอบทันทีเมื่อเสร็จ ความเสี่ยงในทางปฏิบัติที่ใหญ่กว่า คือความเร็ว เพราะสคริปต์ทดสอบอาจทำให้หน้าช้าลง
เชื่อค่า “chance to win” ในเครื่องมือ ได้ไหม?
ให้มองเป็นข้อมูลประกอบหนึ่งอย่าง ไม่ใช่คำตัดสิน แต่ละ
ขั้นตอน ต่อไป
A/B testing เป็น
ทั้งสองทางเริ่มจากหน้าที่โหลดเร็ว และโฟกัสที่