علی فخار
اندازه‌گیری

طراحی آزمایش بازاریابی؛ با کمک هوش مصنوعی چه چیزی را تست کنیم؟

آزمایش بازاریابی‌ای طراحی کنید که بتواند تصمیمی را تغییر دهد: یک مشاهده، فرضیهٔ ابطال‌پذیر، مقایسهٔ منصفانه، معیارهای محافظ و بررسی حجم داده پیش از شروع. همراه با راه‌حل وقتی ترافیک B2B کم است.

marketing-experiment-design-ai

خلاصهٔ مطلب

  • از یک مسئلهٔ مشاهده‌شده و بیش از یک توضیح شروع کنید، نه از فهرستی از نسخه‌ها.
  • مقایسه، واحد تخصیص، یک معیار اصلی و معیارهای محافظ را پیش از دیدن داده تعریف کنید.
  • اول حجم نمونهٔ لازم را بررسی کنید. با ترافیک کم، تشخیص تفاوت‌های کوچک ممکن است سال‌ها طول بکشد؛ به‌جایش سؤال را عوض کنید.
  • از هوش مصنوعی برای نقد بریف استفاده کنید، نه برای پیش‌بینی برنده یا جایگزینی نتیجهٔ واقعی.
فهرست این نوشته

«بیایید چند تیتر را A/B تست کنیم» شروع خیلی از آزمایش‌های بازاریابی است، و دلیل این‌که اغلب چیزی یادمان نمی‌دهند. یک هفته بعد داشبورد نشان می‌دهد نسخهٔ ب جلوتر است، یک نفر برنده را اعلام می‌کند و هیچ‌کس نمی‌تواند بگوید چه چیزی یاد گرفتیم یا این نتیجه ماه بعد هم پابرجا می‌ماند یا نه.

آزمایش مفید از یک مسئلهٔ مشاهده‌شده و یک تصور روشن از دلیلش شروع می‌شود. یک تغییر، یک مقایسهٔ منصفانه، یک معیار اصلی و چند معیار محافظ را تعریف می‌کند که نباید بدتر شوند. پیش از شروع بررسی می‌کند آیا ترافیک موجود اصلاً می‌تواند به سؤال جواب بدهد یا نه، و از قبل مشخص می‌کند نتیجهٔ مثبت، منفی و بی‌نتیجه هر کدام چه معنایی دارند. هوش مصنوعی منتقد خوبی برای بریف آزمایش است، اما جای نتیجه را نمی‌گیرد.

از یک مشاهده شروع کنید، نه از یک نسخهٔ تازه

آزمایش خوب با چیزی شروع می‌شود که در داده یا گفت‌وگوها دیده‌اید: بازدیدکننده‌ها به صفحهٔ قیمت می‌رسند و می‌روند، یک کمپین کلیک می‌گیرد اما درخواست واجد شرایط نه، یا مشتری‌های بالقوه در تماس‌ها اشتباه می‌فهمند محصول چه کاری می‌کند. همین مشاهده دلیل وجود آزمایش است.

بعد بپرسید چرا ممکن است این اتفاق بیفتد و بیش از یک توضیح بنویسید. شاید بازدیدکننده صفحهٔ قیمت را ترک می‌کند چون قیمت بالاست، چون نمی‌فهمد کدام طرح به کارش می‌آید، یا چون از تبلیغی آمده که وعدهٔ دیگری داده بود. هر توضیح به تغییر متفاوتی اشاره می‌کند. آزمودن تیتر جدید وقتی مشکل واقعی سردرگمی در انتخاب طرح است، آزمایش را هدر می‌دهد.

فرضیه‌ای بنویسید که بتواند غلط باشد

فرضیه یک پیش‌بینی مشخص و ابطال‌پذیر است که دلیلش هم کنارش آمده. این قالب صادق نگهش می‌دارد:

برای [مخاطب]، اگر [تغییر] را انجام دهیم، [نتیجهٔ اصلی] [بیشتر یا کمتر] می‌شود، چون [سازوکار]. آن را با [معیار] در [دوره] می‌سنجیم.

دو نسخه را مقایسه کنید:

  • ضعیف: «تیتر جدید نرخ تبدیل را بهتر می‌کند.»
  • مفید: «برای بازدیدکننده‌هایی که از تبلیغ‌های نرم‌افزار عملیات می‌آیند، اگر تیتر صفحهٔ فرود به‌جای دستهٔ محصول، مشکل گزارش هفتگی را نام ببرد، نرخ تکمیل فرم بیشتر می‌شود، چون تبلیغ و صفحه یک مشکل را توصیف می‌کنند. آن را با تعداد فرم‌های تکمیل‌شده به ازای هر بازدیدکنندهٔ یکتا در طول آزمایش می‌سنجیم و سهم درخواست‌هایی که فروش قبولشان می‌کند معیار محافظ است.»

دومی می‌تواند طوری غلط از آب دربیاید که متوجهش بشوید. اصل ماجرا همین است.

مقایسه، واحد، معیار و محافظ‌ها را تعریف کنید

چهار تصمیم طراحی را می‌سازند یا خراب می‌کنند:

  • مقایسه. تغییر با چه چیزی رقابت می‌کند؟ معمولاً با نسخهٔ فعلی که هم‌زمان اجرا می‌شود، تا فصل و تغییرات کمپین روی هر دو اثر یکسان بگذارند.
  • واحد تخصیص. چه کسی یا چه چیزی به‌طور تصادفی به نسخه‌ها تخصیص داده می‌شود: بازدیدکننده، گیرندهٔ ایمیل، حساب، منطقه یا هفته. در B2B (کسب‌وکار به کسب‌وکار) ممکن است چند نفر از یک حساب از سایت بازدید کنند؛ اگر نسخه‌های متفاوت ببینند، مقایسه مخدوش می‌شود. گاهی واحد درست خود حساب است.
  • معیار اصلی. یک عدد، دقیق تعریف‌شده، که نتیجه را تعیین می‌کند. پیش از دیدن هر داده‌ای انتخابش کنید.
  • معیارهای محافظ. چیزهایی که نباید بدتر شوند: کیفیت سرنخ، پذیرش توسط فروش، نرخ لغو عضویت، هزینهٔ هر فرصت فروش واجد شرایط. فرمی که با جذب کسانی که فروش نمی‌تواند کمکشان کند بهتر تبدیل می‌کند، برنده نیست.

ببینید حجم داده‌تان اصلاً جواب می‌دهد یا نه

این مرحله‌ای است که تیم‌های B2B با ترافیک کم جا می‌اندازند، و مهم‌ترین مرحله برای همین تیم‌هاست. پیش از اجرای آزمایش، تخمین بزنید برای تشخیص تفاوتی که برایتان مهم است چقدر داده لازم دارید.

یک نمونه با عددهای فرضی. یک صفحهٔ فرود ماهی ۱٬۲۰۰ بازدید دارد و ۲٪ بازدیدکننده‌ها فرم را تکمیل می‌کنند. تیم امیدوار است پیام جدید این را به ۲٫۵٪ برساند. با محاسبهٔ استاندارد حجم نمونه برای مقایسهٔ دو نسبت، و با قراردادهای رایج سطح معناداری ۵٪ (دوطرفه) و توان آزمون ۸۰٪، تشخیص این تفاوت به حدود ۱۳٬۸۰۰ بازدیدکننده برای هر نسخه نیاز دارد؛ یعنی حدود ۲۷٬۶۰۰ نفر در مجموع. با ماهی ۱٬۲۰۰ بازدید، این تقریباً دو سال است.

حتی بهبودی خیلی بزرگ‌تر، از ۲٪ به ۳٪، حدود ۳٬۸۰۰ بازدیدکننده برای هر نسخه لازم دارد؛ بیش از شش ماه ترافیک. این عددها کاملاً به فرض‌ها وابسته‌اند؛ با خط مبنای خودتان و کوچک‌ترین اثری که ارزش اقدام دارد، از یک ماشین‌حساب درست استفاده کنید. اما درس کلی سر جایش است: تفاوت‌های کوچک روی ترافیک کم در یک دورهٔ معمول کمپین به‌طور قابل‌اعتماد تشخیص‌دادنی نیستند.

وقتی عددها جور درنمی‌آیند، به‌جای اجرای آزمایش به هر قیمتی، سؤال را عوض کنید:

  • تغییر بزرگ‌تری را بیازمایید. یک پیشنهاد یا مخاطب متفاوت، بیشتر از یک صفت تازه احتمال دارد تفاوت قابل تشخیص ایجاد کند.
  • ترافیک را تجمیع کنید. تغییر را در چند صفحه یا کمپین که یک مشکل مشترک دارند اجرا کنید.
  • به‌جایش از روش‌های اکتشافی استفاده کنید. مصاحبه، آزمون فهم پیام و مرور تماس‌های فروش می‌توانند بگویند پیام فهمیده می‌شود یا نه. ارزشمندند، اما شاهد علّی نیستند؛ صادقانه برچسبشان بزنید.
  • یک برداشت جهت‌دار را بپذیرید. مقایسهٔ قبل و بعد می‌تواند به تصمیم کمک کند، به شرطی که ثبت کنید هم‌زمان چه چیزهای دیگری تغییر کرده و بیش از آنچه می‌دهد، ادعای قطعیت نکنید.

پیش از نتیجه، داده را بررسی کنید

پیش از تفسیر هر نتیجه‌ای، بررسی کنید آزمایش همان‌طور که طراحی شده اجرا شده است. یک بررسی ساده: آیا هر نسخه همان سهمی از کاربران را گرفت که قرار بود؟ تیم آزمایش‌گری مایکروسافت این مشکل را عدم تطابق نسبت نمونه (Sample Ratio Mismatch) می‌نامد: تفاوت معنادار آماری بین تقسیم مشاهده‌شده و تقسیمی که تنظیم شده بود. آن‌ها توضیح می‌دهند کاربرانی که گم می‌شوند اغلب همان‌هایی‌اند که بیشترین اثر را از تغییر گرفته‌اند، و به همین دلیل این عدم تطابق می‌تواند نتیجه را بی‌اعتبار کند. علت‌ها از ریدایرکت‌ها و تخصیص معیوب تا ادغام داده‌هایی که رکوردها را جا می‌اندازند متغیرند.

اگر آزمایشی که قرار بود ۵۰ به ۵۰ باشد تقسیم آشکارا نابرابری نشان می‌دهد، پیش از خواندن نتیجه علتش را پیدا کنید.

از هوش مصنوعی به‌عنوان منتقد بریف استفاده کنید

هوش مصنوعی پیش از آزمایش مفید است، وقتی تغییر بریف هنوز ارزان است. مشاهده، فرضیه و طراحی‌تان را به آن بدهید و بخواهید نقطه‌ضعف‌ها را پیدا کند:

دو مرز را نگه دارید. محاسبات و فرض‌های آماری را با یک ماشین‌حساب مناسب یا کسی که روش را بلد است بررسی کنید؛ به حساب‌وکتاب مدل تکیه نکنید. و پیش‌بینی مدل از این‌که کدام نسخه برنده می‌شود، یا واکنش‌های شبیه‌سازی‌شدهٔ مشتری، نتیجهٔ آزمایش نیست. برای ساختن خود نسخه‌های تبلیغ، آزمودن تبلیغ‌ها با هوش مصنوعی را ببینید.

تفسیر نتیجهٔ مثبت، منفی و بی‌نتیجه

پیش از شروع تصمیم بگیرید هر نتیجه چه معنایی دارد:

  • مثبت: معیار اصلی از آستانه بهتر شد و محافظ‌ها سر جایشان ماندند. تغییر را اجرا کنید و بعد از اجرا هم محافظ‌ها را زیر نظر داشته باشید.
  • منفی: تغییر اوضاع را بدتر کرد. این مفید است: توضیحی که پشتش بود احتمالاً غلط است و شما را از اجرای آن نجات داده است.
  • بی‌نتیجه: تفاوت قابل‌اعتمادی دیده نشد. با ترافیک کم، این نتیجهٔ محتملی است. یعنی آزمایش نتوانسته نسخه‌ها را از هم جدا کند، نه این‌که آن‌ها برابرند. از قبل تصمیم بگیرید چه می‌کنید: نسخهٔ ساده‌تر را نگه می‌دارید، آزمایش جسورانه‌تری اجرا می‌کنید یا سراغ توضیح دیگری می‌روید.

به‌محض این‌که داشبورد امیدوارکننده به نظر رسید، آزمایش را متوقف نکنید. سر زدن مکرر و توقف در اولین لحظهٔ خوب، احتمال یک «برندهٔ» کاذب را خیلی بیشتر می‌کند. قاعدهٔ توقف را پیش از شروع توافق کنید.

یک کارت آزمایش تکمیل‌شده

این کارت فرضی است. صفحه، مخاطب و عددها ساختگی‌اند.

کارت آزمایش تکمیل‌شده (فرضی)
بخشمحتوا
مشاهدهبازدیدکننده‌های تبلیغ‌های نرم‌افزار عملیات، صفحهٔ فرود را بدون درخواست ترک می‌کنند؛ تماس‌های فروش نشان می‌دهد صفحه یک دستهٔ محصول را توصیف می‌کند، نه مشکل آن‌ها را
فرضیهنام بردن از مشکل گزارش هفتگی در تیتر، نرخ تکمیل فرم را بالا می‌برد، چون تبلیغ و صفحه یک مشکل را توصیف می‌کنند
تغییرتیتر و پاراگراف اول جدید؛ بقیه بدون تغییر
مقایسهصفحهٔ فعلی، هم‌زمان
مخاطب و تخصیصبازدیدکننده‌های سه کمپین نرم‌افزار عملیات، تصادفی بر اساس بازدیدکننده
معیار اصلیفرم‌های درخواست تکمیل‌شده به ازای هر بازدیدکنندهٔ یکتا
معیارهای محافظسهم درخواست‌هایی که فروش قبول می‌کند؛ هزینهٔ هر فرصت فروش واجد شرایط
بررسی حجمبا ماهی ۱٬۲۰۰ بازدید فقط افزایش خیلی بزرگ قابل تشخیص است؛ ترافیک سه کمپین تجمیع و پیام جسورانه‌تری انتخاب شد
قاعدهٔ توقفتاریخ پایان ثابت که از قبل توافق شده؛ توقف زودتر فقط برای نقض محافظ یا خرابی ردیابی
تصمیم در صورت بی‌نتیجه بودنپیام روشن‌تر بر اساس شواهد کیفی تماس‌ها نگه داشته می‌شود و این تصمیم «اثبات‌نشده با آزمایش» برچسب می‌خورد

یک بریف معیوب را درست کنید

این بریف مشکلات رایجی دارد. سعی کنید پیش از خواندن فهرست پیدایشان کنید.

سه تیتر جدید را دو هفته با تیتر فعلی مقایسه می‌کنیم و هر کدام بیشترین کلیک را گرفت انتخاب می‌کنیم. اگر خوب پیش رفت، همه‌جا اجرایش می‌کنیم.

مشکل‌ها: مشاهده یا فرضیه‌ای نیست، پس هر اتفاقی بیفتد چیزی یاد گرفته نمی‌شود؛ چهار نسخه، ترافیکی را که از قبل کم است چهار قسمت می‌کند؛ «بیشترین کلیک» نتیجهٔ کسب‌وکار نیست و معیار محافظی ندارد؛ مدت دو هفته بر اساس بررسی حجم انتخاب نشده؛ «اگر خوب پیش رفت» تعریف نشده؛ و «همه‌جا اجرایش می‌کنیم» فرض می‌کند صفحه‌های دیگر هم همین مشکل را دارند.

کارت خالی آزمایش

کارت خالی آزمایش
بخشمحتوا
مشاهده[چه چیزی و کجا دیدید]
فرضیهبرای [مخاطب]، اگر [تغییر]، آن‌وقت [نتیجه] [جهت] می‌شود، چون [سازوکار]
تغییر[دقیقاً چه چیزی تغییر می‌کند]
مقایسه[در برابر چه چیزی اجرا می‌شود]
مخاطب و تخصیص[چه کسانی؛ واحد تصادفی‌سازی]
معیار اصلی[یک عدد دقیق تعریف‌شده]
معیارهای محافظ[چه چیزی نباید بدتر شود]
بررسی حجم[خط مبنا، کوچک‌ترین اثر مفید، حجم نمونهٔ لازم، مدت مورد انتظار]
قاعدهٔ توقف[آزمایش کی تمام می‌شود؛ چه چیزی زودتر متوقفش می‌کند]
تصمیم برای هر نتیجه[مثبت، منفی، بی‌نتیجه]

آزمایش‌ها داخل یک سؤال بزرگ‌تر سنجش قرار می‌گیرند: آیا چیزی که می‌آزمایید اصلاً به فرصت‌های فروش وصل می‌شود؟ این موضوع شاخص‌های بازاریابی B2B؛ از کیفیت سرنخ تا فرصت فروش است. و پیامی که ارزش آزمودن دارد، از جایگاه‌یابی روشن شروع می‌شود.

منابع و مطالعهٔ بیشتر

  1. Microsoft Research: تشخیص عدم تطابق نسبت نمونه در تست A/B (انگلیسی)

پرسش‌های رایج

آیا هر آزمایش بازاریابی همان تست A/B است؟

نه. آزمون تصادفی A/B فقط یک طراحی است. آزمایش تجمیعی روی چند صفحه، مقایسهٔ قبل و بعد با ثبت شرایط و روش‌های کیفی مثل آزمون فهم پیام هم مفیدند. فقط مقایسهٔ تصادفی شاهد علّی قوی می‌دهد، پس بقیه را صادقانه برچسب بزنید.

اگر ترافیک برای آزمون کافی نباشد چه کنیم؟

پیش از شروع حجم نمونهٔ لازم را تخمین بزنید. اگر ماه‌ها یا سال‌ها طول می‌کشد، تغییر بزرگ‌تری را بیازمایید، ترافیک صفحه‌هایی را که مشکل مشترک دارند تجمیع کنید یا برای جواب جهت‌دار از مصاحبه و مرور تماس‌های فروش کمک بگیرید. آزمایش کم‌توان را اجرا نکنید تا نتیجه‌اش را اثبات حساب کنید.

آیا هوش مصنوعی می‌تواند تبلیغ برنده را پیش‌بینی کند؟

نه به‌طور قابل‌اعتماد، و پیش‌بینی‌اش شاهد نیست. مدل می‌تواند نسخه بسازد و ضعف‌های طراحی آزمایش را نشان بدهد. این‌که پیامی برای خریداران شما جواب می‌دهد یا نه را فقط آزمایش واقعی یا بازخورد واقعی خریدار نشان می‌دهد.

علی فخار
درباره نویسنده

علی فخار

علی فخار بازاریاب ساکن لندن است و در زمینه رشد کسب‌وکار، تبلیغات، محتوا و استفاده کاربردی از هوش مصنوعی کار می‌کند.

درباره علی ↗
تنظیمات آنالیتیکس

وضعیت فعلی: غیرفعال