طراحی آزمایش بازاریابی؛ با کمک هوش مصنوعی چه چیزی را تست کنیم؟
آزمایش بازاریابیای طراحی کنید که بتواند تصمیمی را تغییر دهد: یک مشاهده، فرضیهٔ ابطالپذیر، مقایسهٔ منصفانه، معیارهای محافظ و بررسی حجم داده پیش از شروع. همراه با راهحل وقتی ترافیک B2B کم است.

خلاصهٔ مطلب
- از یک مسئلهٔ مشاهدهشده و بیش از یک توضیح شروع کنید، نه از فهرستی از نسخهها.
- مقایسه، واحد تخصیص، یک معیار اصلی و معیارهای محافظ را پیش از دیدن داده تعریف کنید.
- اول حجم نمونهٔ لازم را بررسی کنید. با ترافیک کم، تشخیص تفاوتهای کوچک ممکن است سالها طول بکشد؛ بهجایش سؤال را عوض کنید.
- از هوش مصنوعی برای نقد بریف استفاده کنید، نه برای پیشبینی برنده یا جایگزینی نتیجهٔ واقعی.
فهرست این نوشته
«بیایید چند تیتر را A/B تست کنیم» شروع خیلی از آزمایشهای بازاریابی است، و دلیل اینکه اغلب چیزی یادمان نمیدهند. یک هفته بعد داشبورد نشان میدهد نسخهٔ ب جلوتر است، یک نفر برنده را اعلام میکند و هیچکس نمیتواند بگوید چه چیزی یاد گرفتیم یا این نتیجه ماه بعد هم پابرجا میماند یا نه.
آزمایش مفید از یک مسئلهٔ مشاهدهشده و یک تصور روشن از دلیلش شروع میشود. یک تغییر، یک مقایسهٔ منصفانه، یک معیار اصلی و چند معیار محافظ را تعریف میکند که نباید بدتر شوند. پیش از شروع بررسی میکند آیا ترافیک موجود اصلاً میتواند به سؤال جواب بدهد یا نه، و از قبل مشخص میکند نتیجهٔ مثبت، منفی و بینتیجه هر کدام چه معنایی دارند. هوش مصنوعی منتقد خوبی برای بریف آزمایش است، اما جای نتیجه را نمیگیرد.
از یک مشاهده شروع کنید، نه از یک نسخهٔ تازه
آزمایش خوب با چیزی شروع میشود که در داده یا گفتوگوها دیدهاید: بازدیدکنندهها به صفحهٔ قیمت میرسند و میروند، یک کمپین کلیک میگیرد اما درخواست واجد شرایط نه، یا مشتریهای بالقوه در تماسها اشتباه میفهمند محصول چه کاری میکند. همین مشاهده دلیل وجود آزمایش است.
بعد بپرسید چرا ممکن است این اتفاق بیفتد و بیش از یک توضیح بنویسید. شاید بازدیدکننده صفحهٔ قیمت را ترک میکند چون قیمت بالاست، چون نمیفهمد کدام طرح به کارش میآید، یا چون از تبلیغی آمده که وعدهٔ دیگری داده بود. هر توضیح به تغییر متفاوتی اشاره میکند. آزمودن تیتر جدید وقتی مشکل واقعی سردرگمی در انتخاب طرح است، آزمایش را هدر میدهد.
فرضیهای بنویسید که بتواند غلط باشد
فرضیه یک پیشبینی مشخص و ابطالپذیر است که دلیلش هم کنارش آمده. این قالب صادق نگهش میدارد:
برای [مخاطب]، اگر [تغییر] را انجام دهیم، [نتیجهٔ اصلی] [بیشتر یا کمتر] میشود، چون [سازوکار]. آن را با [معیار] در [دوره] میسنجیم.
دو نسخه را مقایسه کنید:
- ضعیف: «تیتر جدید نرخ تبدیل را بهتر میکند.»
- مفید: «برای بازدیدکنندههایی که از تبلیغهای نرمافزار عملیات میآیند، اگر تیتر صفحهٔ فرود بهجای دستهٔ محصول، مشکل گزارش هفتگی را نام ببرد، نرخ تکمیل فرم بیشتر میشود، چون تبلیغ و صفحه یک مشکل را توصیف میکنند. آن را با تعداد فرمهای تکمیلشده به ازای هر بازدیدکنندهٔ یکتا در طول آزمایش میسنجیم و سهم درخواستهایی که فروش قبولشان میکند معیار محافظ است.»
دومی میتواند طوری غلط از آب دربیاید که متوجهش بشوید. اصل ماجرا همین است.
مقایسه، واحد، معیار و محافظها را تعریف کنید
چهار تصمیم طراحی را میسازند یا خراب میکنند:
- مقایسه. تغییر با چه چیزی رقابت میکند؟ معمولاً با نسخهٔ فعلی که همزمان اجرا میشود، تا فصل و تغییرات کمپین روی هر دو اثر یکسان بگذارند.
- واحد تخصیص. چه کسی یا چه چیزی بهطور تصادفی به نسخهها تخصیص داده میشود: بازدیدکننده، گیرندهٔ ایمیل، حساب، منطقه یا هفته. در B2B (کسبوکار به کسبوکار) ممکن است چند نفر از یک حساب از سایت بازدید کنند؛ اگر نسخههای متفاوت ببینند، مقایسه مخدوش میشود. گاهی واحد درست خود حساب است.
- معیار اصلی. یک عدد، دقیق تعریفشده، که نتیجه را تعیین میکند. پیش از دیدن هر دادهای انتخابش کنید.
- معیارهای محافظ. چیزهایی که نباید بدتر شوند: کیفیت سرنخ، پذیرش توسط فروش، نرخ لغو عضویت، هزینهٔ هر فرصت فروش واجد شرایط. فرمی که با جذب کسانی که فروش نمیتواند کمکشان کند بهتر تبدیل میکند، برنده نیست.
ببینید حجم دادهتان اصلاً جواب میدهد یا نه
این مرحلهای است که تیمهای B2B با ترافیک کم جا میاندازند، و مهمترین مرحله برای همین تیمهاست. پیش از اجرای آزمایش، تخمین بزنید برای تشخیص تفاوتی که برایتان مهم است چقدر داده لازم دارید.
یک نمونه با عددهای فرضی. یک صفحهٔ فرود ماهی ۱٬۲۰۰ بازدید دارد و ۲٪ بازدیدکنندهها فرم را تکمیل میکنند. تیم امیدوار است پیام جدید این را به ۲٫۵٪ برساند. با محاسبهٔ استاندارد حجم نمونه برای مقایسهٔ دو نسبت، و با قراردادهای رایج سطح معناداری ۵٪ (دوطرفه) و توان آزمون ۸۰٪، تشخیص این تفاوت به حدود ۱۳٬۸۰۰ بازدیدکننده برای هر نسخه نیاز دارد؛ یعنی حدود ۲۷٬۶۰۰ نفر در مجموع. با ماهی ۱٬۲۰۰ بازدید، این تقریباً دو سال است.
حتی بهبودی خیلی بزرگتر، از ۲٪ به ۳٪، حدود ۳٬۸۰۰ بازدیدکننده برای هر نسخه لازم دارد؛ بیش از شش ماه ترافیک. این عددها کاملاً به فرضها وابستهاند؛ با خط مبنای خودتان و کوچکترین اثری که ارزش اقدام دارد، از یک ماشینحساب درست استفاده کنید. اما درس کلی سر جایش است: تفاوتهای کوچک روی ترافیک کم در یک دورهٔ معمول کمپین بهطور قابلاعتماد تشخیصدادنی نیستند.
وقتی عددها جور درنمیآیند، بهجای اجرای آزمایش به هر قیمتی، سؤال را عوض کنید:
- تغییر بزرگتری را بیازمایید. یک پیشنهاد یا مخاطب متفاوت، بیشتر از یک صفت تازه احتمال دارد تفاوت قابل تشخیص ایجاد کند.
- ترافیک را تجمیع کنید. تغییر را در چند صفحه یا کمپین که یک مشکل مشترک دارند اجرا کنید.
- بهجایش از روشهای اکتشافی استفاده کنید. مصاحبه، آزمون فهم پیام و مرور تماسهای فروش میتوانند بگویند پیام فهمیده میشود یا نه. ارزشمندند، اما شاهد علّی نیستند؛ صادقانه برچسبشان بزنید.
- یک برداشت جهتدار را بپذیرید. مقایسهٔ قبل و بعد میتواند به تصمیم کمک کند، به شرطی که ثبت کنید همزمان چه چیزهای دیگری تغییر کرده و بیش از آنچه میدهد، ادعای قطعیت نکنید.
پیش از نتیجه، داده را بررسی کنید
پیش از تفسیر هر نتیجهای، بررسی کنید آزمایش همانطور که طراحی شده اجرا شده است. یک بررسی ساده: آیا هر نسخه همان سهمی از کاربران را گرفت که قرار بود؟ تیم آزمایشگری مایکروسافت این مشکل را عدم تطابق نسبت نمونه (Sample Ratio Mismatch) مینامد: تفاوت معنادار آماری بین تقسیم مشاهدهشده و تقسیمی که تنظیم شده بود. آنها توضیح میدهند کاربرانی که گم میشوند اغلب همانهاییاند که بیشترین اثر را از تغییر گرفتهاند، و به همین دلیل این عدم تطابق میتواند نتیجه را بیاعتبار کند. علتها از ریدایرکتها و تخصیص معیوب تا ادغام دادههایی که رکوردها را جا میاندازند متغیرند.
اگر آزمایشی که قرار بود ۵۰ به ۵۰ باشد تقسیم آشکارا نابرابری نشان میدهد، پیش از خواندن نتیجه علتش را پیدا کنید.
از هوش مصنوعی بهعنوان منتقد بریف استفاده کنید
هوش مصنوعی پیش از آزمایش مفید است، وقتی تغییر بریف هنوز ارزان است. مشاهده، فرضیه و طراحیتان را به آن بدهید و بخواهید نقطهضعفها را پیدا کند:
دو مرز را نگه دارید. محاسبات و فرضهای آماری را با یک ماشینحساب مناسب یا کسی که روش را بلد است بررسی کنید؛ به حسابوکتاب مدل تکیه نکنید. و پیشبینی مدل از اینکه کدام نسخه برنده میشود، یا واکنشهای شبیهسازیشدهٔ مشتری، نتیجهٔ آزمایش نیست. برای ساختن خود نسخههای تبلیغ، آزمودن تبلیغها با هوش مصنوعی را ببینید.
تفسیر نتیجهٔ مثبت، منفی و بینتیجه
پیش از شروع تصمیم بگیرید هر نتیجه چه معنایی دارد:
- مثبت: معیار اصلی از آستانه بهتر شد و محافظها سر جایشان ماندند. تغییر را اجرا کنید و بعد از اجرا هم محافظها را زیر نظر داشته باشید.
- منفی: تغییر اوضاع را بدتر کرد. این مفید است: توضیحی که پشتش بود احتمالاً غلط است و شما را از اجرای آن نجات داده است.
- بینتیجه: تفاوت قابلاعتمادی دیده نشد. با ترافیک کم، این نتیجهٔ محتملی است. یعنی آزمایش نتوانسته نسخهها را از هم جدا کند، نه اینکه آنها برابرند. از قبل تصمیم بگیرید چه میکنید: نسخهٔ سادهتر را نگه میدارید، آزمایش جسورانهتری اجرا میکنید یا سراغ توضیح دیگری میروید.
بهمحض اینکه داشبورد امیدوارکننده به نظر رسید، آزمایش را متوقف نکنید. سر زدن مکرر و توقف در اولین لحظهٔ خوب، احتمال یک «برندهٔ» کاذب را خیلی بیشتر میکند. قاعدهٔ توقف را پیش از شروع توافق کنید.
یک کارت آزمایش تکمیلشده
این کارت فرضی است. صفحه، مخاطب و عددها ساختگیاند.
| بخش | محتوا |
|---|---|
| مشاهده | بازدیدکنندههای تبلیغهای نرمافزار عملیات، صفحهٔ فرود را بدون درخواست ترک میکنند؛ تماسهای فروش نشان میدهد صفحه یک دستهٔ محصول را توصیف میکند، نه مشکل آنها را |
| فرضیه | نام بردن از مشکل گزارش هفتگی در تیتر، نرخ تکمیل فرم را بالا میبرد، چون تبلیغ و صفحه یک مشکل را توصیف میکنند |
| تغییر | تیتر و پاراگراف اول جدید؛ بقیه بدون تغییر |
| مقایسه | صفحهٔ فعلی، همزمان |
| مخاطب و تخصیص | بازدیدکنندههای سه کمپین نرمافزار عملیات، تصادفی بر اساس بازدیدکننده |
| معیار اصلی | فرمهای درخواست تکمیلشده به ازای هر بازدیدکنندهٔ یکتا |
| معیارهای محافظ | سهم درخواستهایی که فروش قبول میکند؛ هزینهٔ هر فرصت فروش واجد شرایط |
| بررسی حجم | با ماهی ۱٬۲۰۰ بازدید فقط افزایش خیلی بزرگ قابل تشخیص است؛ ترافیک سه کمپین تجمیع و پیام جسورانهتری انتخاب شد |
| قاعدهٔ توقف | تاریخ پایان ثابت که از قبل توافق شده؛ توقف زودتر فقط برای نقض محافظ یا خرابی ردیابی |
| تصمیم در صورت بینتیجه بودن | پیام روشنتر بر اساس شواهد کیفی تماسها نگه داشته میشود و این تصمیم «اثباتنشده با آزمایش» برچسب میخورد |
یک بریف معیوب را درست کنید
این بریف مشکلات رایجی دارد. سعی کنید پیش از خواندن فهرست پیدایشان کنید.
سه تیتر جدید را دو هفته با تیتر فعلی مقایسه میکنیم و هر کدام بیشترین کلیک را گرفت انتخاب میکنیم. اگر خوب پیش رفت، همهجا اجرایش میکنیم.
مشکلها: مشاهده یا فرضیهای نیست، پس هر اتفاقی بیفتد چیزی یاد گرفته نمیشود؛ چهار نسخه، ترافیکی را که از قبل کم است چهار قسمت میکند؛ «بیشترین کلیک» نتیجهٔ کسبوکار نیست و معیار محافظی ندارد؛ مدت دو هفته بر اساس بررسی حجم انتخاب نشده؛ «اگر خوب پیش رفت» تعریف نشده؛ و «همهجا اجرایش میکنیم» فرض میکند صفحههای دیگر هم همین مشکل را دارند.
کارت خالی آزمایش
| بخش | محتوا |
|---|---|
| مشاهده | [چه چیزی و کجا دیدید] |
| فرضیه | برای [مخاطب]، اگر [تغییر]، آنوقت [نتیجه] [جهت] میشود، چون [سازوکار] |
| تغییر | [دقیقاً چه چیزی تغییر میکند] |
| مقایسه | [در برابر چه چیزی اجرا میشود] |
| مخاطب و تخصیص | [چه کسانی؛ واحد تصادفیسازی] |
| معیار اصلی | [یک عدد دقیق تعریفشده] |
| معیارهای محافظ | [چه چیزی نباید بدتر شود] |
| بررسی حجم | [خط مبنا، کوچکترین اثر مفید، حجم نمونهٔ لازم، مدت مورد انتظار] |
| قاعدهٔ توقف | [آزمایش کی تمام میشود؛ چه چیزی زودتر متوقفش میکند] |
| تصمیم برای هر نتیجه | [مثبت، منفی، بینتیجه] |
آزمایشها داخل یک سؤال بزرگتر سنجش قرار میگیرند: آیا چیزی که میآزمایید اصلاً به فرصتهای فروش وصل میشود؟ این موضوع شاخصهای بازاریابی B2B؛ از کیفیت سرنخ تا فرصت فروش است. و پیامی که ارزش آزمودن دارد، از جایگاهیابی روشن شروع میشود.
منابع و مطالعهٔ بیشتر
پرسشهای رایج
آیا هر آزمایش بازاریابی همان تست A/B است؟
نه. آزمون تصادفی A/B فقط یک طراحی است. آزمایش تجمیعی روی چند صفحه، مقایسهٔ قبل و بعد با ثبت شرایط و روشهای کیفی مثل آزمون فهم پیام هم مفیدند. فقط مقایسهٔ تصادفی شاهد علّی قوی میدهد، پس بقیه را صادقانه برچسب بزنید.
اگر ترافیک برای آزمون کافی نباشد چه کنیم؟
پیش از شروع حجم نمونهٔ لازم را تخمین بزنید. اگر ماهها یا سالها طول میکشد، تغییر بزرگتری را بیازمایید، ترافیک صفحههایی را که مشکل مشترک دارند تجمیع کنید یا برای جواب جهتدار از مصاحبه و مرور تماسهای فروش کمک بگیرید. آزمایش کمتوان را اجرا نکنید تا نتیجهاش را اثبات حساب کنید.
آیا هوش مصنوعی میتواند تبلیغ برنده را پیشبینی کند؟
نه بهطور قابلاعتماد، و پیشبینیاش شاهد نیست. مدل میتواند نسخه بسازد و ضعفهای طراحی آزمایش را نشان بدهد. اینکه پیامی برای خریداران شما جواب میدهد یا نه را فقط آزمایش واقعی یا بازخورد واقعی خریدار نشان میدهد.


