דלג לתוכן העיקרי
WhaleBiz Logo

בדיקת סוכן AI לפני השקה: 10 מבחנים חובה

1.9.2026
11 דקות קריאה
מסך מחשב עם שיחת בדיקה של סוכן AI לפני עלייה לאוויר

איך אתם יודעים שהסוכן מוכן לדבר עם לקוח משלם? רוב בעלי העסקים עונים באותה דרך: פותחים את הצ׳אט, שואלים חמש או שש שאלות שהם עצמם היו שואלים, מקבלים תשובות שנשמעות מצוין, ומאשרים עלייה לאוויר. זו בדיקה של דבר אחד בלבד, שהסוכן יודע לענות למי שכבר יודע מה הוא רוצה. הלקוחות של השבוע הראשון לא ישאלו את השאלות האלה. הם ישאלו את מה שלא חשבתם עליו, בשעות שלא בדקתם, בניסוח שלא ציפיתם לו, ולפעמים בשפה אחרת.

למה "שאלתי אותו והוא ענה יפה" הוא לא מבחן

הבעיה בשיחת הדמו היא לא שהיא קצרה, אלא שהיא מוטה. אתם שואלים שאלות שאתם יודעים שיש עליהן תשובה, מנסחים אותן כמו במסמך שמסרתם, ומפרשים תשובה מנומסת כתשובה נכונה. שלוש ההטיות האלה גורמות לכך שהבדיקה כמעט תמיד עוברת, וזה מה שהופך אותה לחסרת ערך.

מבחן טוב עושה את ההפך: הוא מנסה להכשיל. שאלה שאין עליה תשובה בחומר, שאלה שנוגעת בגבול שהגדרתם, לקוח שמנסה להוציא הנחה, הודעה קולית באמצע, לקוח שמדבר רוסית ועובר לעברית. אלה לא מקרי קצה תיאורטיים אלא נתח ניכר מהתעבורה בשבוע הראשון.

השיקול הכלכלי פשוט. תשובה שגויה שמתגלה בבדיקה עולה תיקון של רבע שעה. אותה תשובה אחרי שלקוח הסתמך עליה עולה לפעמים את העסקה, ולפעמים ויכוח על מה בדיוק הובטח בצ׳אט. הרשימה שלמטה בנויה כדי להזיז טעויות מהצד היקר לזול.

הכנה: 40 השאלות האמיתיות שלכם

לפני המבחן הראשון צריך חומר. פתחו את היסטוריית הוואטסאפ או את תיבת הפניות של החודשיים האחרונים והעתיקו 40 הודעות ראשונות של לקוחות, כלשונן, כולל שגיאות כתיב, קיצורים והודעות בנות שלוש מילים. לצד כל אחת כתבו את התשובה הנכונה כפי שאתם הייתם עונים.

הרשימה הזאת היא הנכס המרכזי כאן, ולא רק לבדיקה הראשונה. היא הופכת אחר כך לרשימת רגרסיה: בכל פעם שתעדכנו מחירון, תוסיפו שירות או תשנו מדיניות, מריצים אותה שוב ורואים מה נשבר. מי שמדלג על השלב הזה מגלה אחרי חצי שנה שתיקון אחד הרס תשובה אחרת, בלי שאיש שם לב.

שימו לב תוך כדי לדבר נוסף: לכמה מהשאלות אין בכלל תשובה כתובה בעסק שלכם. המספר מפתיע כמעט כל בעל עסק, והוא הסיבה שרוב עבודת ההקמה היא בירור החומר ולא הגדרת הבוט.

מבחנים 1-3: ידע, דיוק ומה קורה כשאין תשובה

מבחן 1, העובדות. הריצו את כל 40 השאלות והשוו כל תשובה למקור. מה שמחפשים הוא לא ניסוח יפה אלא סטייה במספר: מחיר, שעה, משך טיפול, זמן אספקה, אזור שירות. סימן כישלון קלאסי הוא סכום שנשמע סביר ולא מופיע בשום מסמך שמסרתם. סוכן שמייצר מספר משלו הוא הסיכון הגדול ביותר, ולכן זה המבחן שמריצים ראשון.

מבחן 2, "אני לא יודע". שאלו במכוון שלוש שאלות שאין עליהן תשובה בחומר. סוכן תקין אומר שאין לו את המידע, לא ממציא, ומציע להעביר לאדם. סוכן לא תקין ממלא את החלל בניחוש הגיוני. זה נשמע כמו פרט קטן ובפועל זו ההגדרה שקובעת אם הסוכן בטוח לשימוש. ההבדל בין השניים נקבע באיכות ההגדרה ובאיכות מאגר הידע, ולא בבחירת המודל: הרחבנו על זה במדריך בניית מאגר ידע לסוכן AI.

מבחן 3, סתירות ועדכניות. קחו פרט אחד, למשל שעת סגירה בערב שישי, ובדקו אם הוא מופיע בשני מסמכים בשתי גרסאות. סתירה במקור מייצרת תשובה אקראית, וזה הקשה ביותר לאיתור אחר כך. אחר כך שנו מחיר אחד במסמך המקור ובדקו שהתשובה השתנתה. אם היא לא השתנתה, יש לכם בעיית עדכניות, לא בעיית ניסוח.

מבחנים 4-5: הגבולות והלחץ

מבחן 4, מה אסור לענות. לכל עסק יש רשימה כזאת, גם אם היא לא כתובה: מחיר סופי להצעה מורכבת, אישור הנחה, שינוי בתנאי ביטול, התחייבות לתאריך אספקה, וכל שאלה מקצועית שדורשת אחריות. במרפאה זה קו חד במיוחד: הסוכן לא מאבחן, לא נותן ייעוץ רפואי, משפטי או מינוני, ומעביר לאדם בכל שאלה קלינית. בדקו כל אחד מהגבולות בנפרד, ובדקו גם את הניסוח העוקף: לא "כמה יעלה לי" אלא "בערך כמה, רק שאדע אם זה בכלל בטווח שלי". הניסוח השני הוא זה שמפיל סוכנים.

מבחן 5, לחץ וניסיון מניפולציה. שלחו לקוח כועס, לקוח שדורש הנחה של 20 אחוז ומאיים לעבור למתחרה, ומישהו שכותב במפורש להתעלם מההוראות הקודמות ולומר את המחיר האמיתי. הסוכן אמור להישאר באותה מדיניות בשלושת המקרים, בטון רגוע, ולהעביר לאדם כשצריך. זו אחת הטעויות שראינו חוזרת הכי הרבה בפרויקטים, לצד אלה שאספנו בלמה צ׳אטבוט AI נכשל גם כשהטכנולוגיה תקינה.

מבחנים 6-7: המסירה לאדם והפנייה שנשמרת

מבחן 6, המסירה. כאן בודקים מסלול שלם ולא תשובה בודדת. בקשו במפורש לדבר עם נציג ועקבו: מי מקבל את ההתראה, כמה מהר, האם הוא רואה את כל השיחה או מתחיל מאפס, מה הלקוח רואה בינתיים, ומה קורה כשהבקשה מגיעה ברבע לאחת בלילה. מסירה שנופלת בשקט היא התקלה היקרה מכולן, כי הלקוח משוכנע שמישהו יחזור אליו.

מבחן 7, הרשומה. אחרי כל שיחת בדיקה פתחו את הפנייה שנוצרה במערכת וקראו אותה כאילו אתם העובד שמטפל בה מחר בבוקר. הטלפון שמור בפורמט בינלאומי תקין עם 972 ולא כמחרוזת חופשית, המקור מסומן, הסיכום מובן, והשלב הנכון בקנבן. בדקו גם מה קורה כשאותו מספר כותב פעמיים: פנייה כפולה או המשך של אותה רשומה. ובוויג׳ט באתר, שבו אין מספר טלפון אוטומטי, בדקו מה נשמר כשהלקוח מתחיל לכתוב ונעלם באמצע.

רוצים להתייעץ?

אנחנו יכולים לעזור לכם לבחור, לבנות ולהטמיע את הבוט המושלם לעסק שלכם. השאירו פרטים ונחזור אליכם.

מבחן 8: שלוש שפות באותה שיחה

בישראל זה לא מבחן תיאורטי. בדקו ארבעה מצבים: לקוח שכותב ברוסית ומקבל תשובה ברוסית, לקוח שכותב באנגלית באמצע שיחה שהתחילה בעברית ומצפה שהסוכן יעבור איתו, עברית שנכתבה באותיות לטיניות, והמקרה ההפוך והמביך יותר, לקוח שכתב בעברית וקיבל תשובה ברוסית מפני שהשם שלו נשמע רוסי.

שימו לב גם לצד הוויזואלי. טקסט מימין לשמאל עם מספרים או קישור באמצע המשפט נשבר לפעמים בתצוגת הערוץ עצמו ולא בגוף התשובה. זוטה, עד שלקוח מקבל שעת פתיחה עם ספרות הפוכות. הרחבנו על הנקודה הזאת בסוכן AI רב-לשוני לשוק הישראלי.

מבחנים 9-10: היומן, הערוץ והעומס

מבחן 9, זימון אמיתי. אל תסתפקו באישור מילולי. קבעו תור אמיתי דרך הסוכן ופתחו את היומן. בדקו כפילות בזמן, מרווח בין תורים, ביטול והזזה, ומה קורה כששני אנשים מבקשים את אותו חלון בהפרש של שניות. בדקו גם שעת מעבר שעון וסוף שבוע, כי שם נופלות רוב האינטגרציות. אם התור נכנס ליומן אבל בלי שם או בלי טלפון, זה כישלון גם אם המסך הראה הצלחה.

מבחן 10, עומס ותקלה. הריצו שלוש שיחות במקביל, שלחו הודעה קולית ותמונה, והכי חשוב, נתקו בכוונה את החיבור ליומן או ל-CRM ובדקו מה הלקוח רואה. התשובה הנכונה היא הודעה כנה שמישהו יחזור אליו, ורישום הפנייה בכל מקרה. התשובה השגויה היא שקט. שימו לב שכאן גם נמדדת הצריכה: נספרות תשובות של הסוכן ולא הודעות נכנסות, ותשובה להודעה קולית, לתמונה או לקובץ נספרת כשתי הודעות.

ארבע דרכים לבדוק סוכן, ומה כל אחת באמת מגלה

מדדשיחת דמו קצרהבדיקה של הצוות בלבדבטא על לקוחות אמיתייםרשימת מבחנים מובנית ✓
מה נבדק בפועלשהסוכן מדבר יפהשהוא יודע את החומרהכול, בלי שליטהידע, גבולות, מסירה, נתונים
שאלות מחוץ לתסריטכמעט איןמעטותהרבהמתוכננות מראש
מי משלם על טעותאף אחדאף אחדלקוח משלםאף אחד
זמן שנדרש10 דקותכשעהשבועות3 עד 4 שעות
אפשר לחזור עליהלאחלקיתלאכן, בכל עדכון

הטור האחרון אינו קסם טכנולוגי אלא סדר עבודה, וההבדל בינו לבין השאר הוא שהוא ניתן לחזרה, ולכן שווה משהו גם בעוד שנה. בפרויקטים שבהם יש אינטגרציה ייעודית או תהליך לא סטנדרטי, רשימת המבחנים נכתבת יחד עם האפיון ולא אחריו, וזה חלק ממה שאנחנו עושים בפיתוח פתרונות AI מותאמים.

החודש הראשון אחרי העלייה לאוויר הוא חלק מהבדיקה

גם רשימה מלאה לא תופסת הכול, כי לקוחות אמיתיים מנסחים אחרת מכל צוות בדיקה. לכן החודש הראשון בנוי מראש ככזה: אוספים את כל ההערות לרשימה אחת ושולחים כמקשה, במקום עשר הודעות נפרדות. סבב תיקונים אחד מטופל ועולה לאוויר תוך שלושה ימי עסקים, ומספר הסבבים נקבע לפי המסלול, אחד ב-Start, שניים ב-Standard ושלושה ב-Business. מעבר לכך יש עדכונים חודשיים שוטפים, 2, 5 או 10 בהתאמה, ותיקון תקלה אמיתית הוא תמיד חינם ואינו נספר. ההגדרה המדויקת של מה נחשב עדכון נמצאת בעמוד ההקמה והתמיכה.

לבסוף, שאלת המסלול נגזרת מהמבחנים ולא מהתחושה. אם מבחן 9 רלוונטי אצלכם, כלומר יש זימון תורים, או שהלידים מגיעים בוואטסאפ, נקודת הכניסה היא Standard, 490 שקל לחודש בתוספת הקמה חד-פעמית של 1,990 שקל. אתר בלבד בלי יומן מסתדר עם Start. כמה יומנים, אינסטגרם, גבייה בצ׳אט או יותר מסוכן אחד מחייבים Business, 990 שקל לחודש והקמה 2,990 שקל. כל המחירים אינם כוללים מע"מ, וההשוואה המלאה נמצאת בעמוד המחירים.

שאלות נפוצות

כמה זמן באמת לוקח לבדוק סוכן AI לפני השקה? בעסק קטן ובינוני מדובר בשלוש עד ארבע שעות עבודה מרוכזות, לא בשבועות. רוב הזמן הולך על שלב ההכנה: לאסוף 40 שאלות אמיתיות מתוך היסטוריית ההודעות ולכתוב לצידן את התשובה הנכונה. אחרי שהרשימה קיימת, ההרצה עצמה מהירה, וגם ההרצה החוזרת אחרי תיקון. הטעות הנפוצה היא לפזר את הבדיקה על פני שבועיים בהודעות בודדות. עדיף לשבת פעם אחת, לרשום את כל מה שנשבר ברשימה אחת, ולשלוח אותה כמקשה אחת. כך גם סבב התיקונים נסגר מהר יותר.

מי אמור לבדוק את הסוכן, אנחנו או הספק? שניהם, ועל דברים שונים. הספק בודק שהמערכת עובדת: החיבור לערוץ, שמירת הפנייה, היומן, המסירה לאדם, ההתנהגות תחת עומס. אתם בודקים את מה שרק אתם יודעים: שהמחירים והשעות נכונים, שהניסוח נשמע כמוכם, שהתשובה על מדיניות הביטול היא באמת המדיניות שלכם, ושהסוכן לא חורג בשום מקום מהגבולות שהגדרתם. אף ספק לא יכול לבדוק את החלק השני במקומכם, כי מקור האמת יושב אצלכם. בפועל זה אומר שהחומרים שאתם מוסרים בתחילת ההקמה הם גם מסמך הבדיקה בסופה.

מה עושים אם הסוכן כבר ענה תשובה שגויה ללקוח אמיתי? קודם כול מתקנים מול הלקוח באופן אנושי, ואז מתקנים את הסיבה. תשובה שגויה כמעט תמיד נובעת מאחד משלושה דברים: המידע במקור עצמו לא מעודכן, קיימים שני מסמכים סותרים, או שהשאלה נופלת בתחום שהסוכן היה אמור להעביר לאדם ולא הועבר. בשלושת המקרים התיקון הוא בהגדרה ולא בהתנצלות. תיקון תקלה כזאת אינו נספר במכסת העדכונים החודשית ואינו עולה כסף: זה חלק מהשירות. מה שכן חשוב הוא להוסיף את השאלה שנפלה לרשימת המבחנים, כדי שהיא תיבדק בכל שינוי עתידי.

איך אפשר לדעת מראש כמה הודעות נצרוך בחודש? נספרות תשובות של הסוכן בלבד, לא הודעות שנכנסות מהלקוח, ותשובה להודעה קולית, לתמונה או לקובץ נספרת כשתי הודעות. לכן ההערכה נעשית כך: לוקחים את מספר הפניות בחודש העמוס ביותר שהיה לכם, מכפילים במספר התשובות הממוצע בשיחה שראיתם בבדיקה, ומוסיפים תוספת לשיחות עם קול ותמונות. מסלול Standard כולל 2,000 הודעות בחודש וחריגה בעלות 0.30 שקל להודעה, ומסלול Business כולל 5,000 הודעות וחריגה 0.25 שקל. בעסק עונתי בוחרים לפי החודש העמוס ולא לפי הממוצע השנתי.

הבדיקה כלולה במחיר ההקמה או שמדובר בתוספת? היא חלק מההקמה. ההקמה היא תשלום חד-פעמי לפי מסלול: 990 שקל ב-Start, 1,990 שקל ב-Standard ו-2,990 שקל ב-Business, כל המחירים ללא מע"מ, והיא משולמת בתשלום אחד לפני תחילת העבודה. ימי העסקים של ההקמה נמנים מרגע קבלת כל החומרים מכם ולא מיום התשלום, בדיוק מפני ששלב הבדיקה תלוי בחומרים האלה. המנוי החודשי מתחיל רק ביום שהסוכן עולה לאוויר, ובחודש הראשון יש סבבי תיקונים נוספים: סבב אחד ב-Start, שניים ב-Standard ושלושה ב-Business.

David Venzhyk

David Venzhyk

דוד מתמחה בבניית REST APIs מאובטחים ופריסת אפליקציות ניתנות להרחבה באמצעות Python, FastAPI, PostgreSQL ו-AWS EC2. משלב רקע במדעי המחשב עם ניסיון ב-React ואינטגרציות API חיצוניות, ומפתח תשתית תוכנה מחוברת ומלאה.

אהבתם את המאמר? שתפו!