סוכן טוב נמדד גם
במה שהוא יודע לא לעשות.
סוכן AI אמין אינו פועל בחופש מוחלט. הוא עובד מול מידע מוגדר, הרשאות ברורות ותהליך שמתאר מה מותר לבצע, מה דורש אישור ומתי צריך לעצור.
אנחנו בונים את שכבות ההגנה כחלק מהמערכת עצמה - כדי לצמצם ניחושים, למנוע פעולות לא מבוססות ולשמור את האדם בתהליך במקומות שבהם נדרשים שיקול דעת ואחריות.
מודל AI בנוי לייצר תוצאה.
לא תמיד לעצור.
מודלי AI מצטיינים בזיהוי דפוסים, עיבוד שפה והפקת תוצאות שנראות סבירות. כאשר המידע חלקי או שהבקשה אינה ברורה, המודל עלול לנסות להשלים את החסר במקום להכיר בכך שאין לו בסיס מספיק לפעולה.
כאשר מדובר בטקסט, התוצאה עלולה להיות תשובה לא מדויקת. כאשר הסוכן מחובר לכלים ולמערכות, אותו חוסר ודאות עלול להפוך למסמך שגוי, עדכון לא נכון, פעולה כפולה או תהליך שממשיך למרות ששלב קודם נכשל.
גם הוראה כמו "אל תנחש" אינה מספיקה בפני עצמה. מערכת אמינה צריכה מקורות מידע מוגדרים, בדיקות, הרשאות, תנאי עצירה, תיעוד ודרך ברורה להעביר אחריות לאדם.
- האם נעשה שימוש במקור הנכון?
- האם הנתונים עדיין עדכניים?
- האם הפעולה מותרת?
- האם היא בוצעה בהצלחה?
- והאם צריך להמשיך לשלב הבא?
כך בונים סוכן שפועל
בתוך גבולות ברורים.
תפקיד ותחום אחריות
לפני שבוחרים מודל או מחברים מערכת, מגדירים מהו התפקיד של הסוכן: אילו משימות הוא מקבל, מה נחשב לתוצאה מוצלחת, אילו פעולות הוא רשאי לבצע ומה נשאר באחריות האדם. ככל שהתפקיד רחב ומעורפל יותר, כך קשה יותר לבדוק את התוצאה ולשלוט בסיכון.
מקורות מידע מאושרים
הסוכן משתמש במקורות שהוגדרו עבור התהליך: מסמכים, נהלים, מאגרי ידע, רשומות מערכת, נתונים או שירותים חיצוניים מאושרים. מגדירים איזה מקור קובע כאשר קיימת סתירה, איזה מידע נחשב עדכני ומה קורה כאשר המידע הנדרש אינו נמצא.
בדיקות לפני פעולה
לפני ביצוע פעולה בודקים שהמידע מלא, שהרשומה הנכונה זוהתה, שהתנאים מתקיימים ושהשלב הקודם הושלם בהצלחה. בתהליכים רגישים ניתן לדרוש אימות נוסף, הצלבה בין מקורות או אישור אנושי.
הרשאות וגבולות פעולה
הסוכן מקבל רק את ההרשאות הדרושות לתפקיד שלו. מגדירים מה הוא יכול לקרוא, ליצור, לעדכן, לשלוח או למחוק - ואילו פעולות אסורות או דורשות אישור. העיקרון הוא מינימום הרשאה: לא נותנים גישה רחבה רק משום שהיא זמינה מבחינה טכנית.
עצירה והעברה לאדם
מגדירים מראש מצבים שבהם הסוכן אינו ממשיך באופן עצמאי: מידע חסר, סתירה בין מקורות, פעולה רגישה, תוצאה חריגה, חיבור שנכשל או מצב שלא תואם לתהליך שהוגדר. במקרים כאלה הסוכן עוצר, מסביר מה חסר ומעביר לאדם את המידע שכבר נאסף.
תיעוד, ניטור ובקרה
פעולות משמעותיות מתועדות כך שניתן להבין מה הסוכן קיבל, באיזה מידע השתמש, איזו החלטה התקבלה, איזה כלי הופעל ומה הייתה התוצאה. התיעוד מאפשר לאתר כשלים, לבדוק מקרים חריגים ולשפר את המערכת על סמך שימוש אמיתי.
לא כל פעולה צריכה
אותה רמת חופש.
רמת העצמאות של הסוכן נקבעת לפי סוג המשימה, רמת הסיכון ואיכות המידע. פעולה פשוטה והפיכה יכולה להתבצע באופן עצמאי. פעולה רגישה, יקרה או בלתי הפיכה עשויה לדרוש אישור.
הצעה בלבד
הסוכן אוסף מידע ומציע את הצעד הבא - אבל אדם מחליט ומבצע.
הכנה לאישור
הסוכן מכין מסמך, עדכון או פעולה וממתין לאישור לפני הביצוע.
ביצוע בגבולות מוגדרים
הסוכן מבצע פעולות שגרתיות כאשר כל התנאים מתקיימים - ומתעד את התוצאה.
עצמאות רחבה בתהליך מוגדר
הסוכן מנהל מספר שלבים באופן עצמאי, אך עדיין עוצר בחריגים, בסתירות ובפעולות רגישות.
המטרה אינה להעניק לסוכן את רמת העצמאות הגבוהה ביותר. המטרה היא לבחור את הרמה הנכונה לכל שלב.
לפני שהסוכן מתחיל לעבוד,
אנחנו מחפשים איפה התהליך נשבר.
בדיקה של סוכן AI אינה מסתכמת בכמה שאלות לדוגמה. צריך לבדוק את כל רצף העבודה - מהמידע שנכנס, דרך ההחלטות והחיבורים ועד לתוצאה שנכתבת או מתבצעת במערכת.
בדיקות מידע
- מידע חסר
- מידע לא מעודכן
- סתירה בין מקורות
- מסמך בפורמט לא צפוי
- מספר רשומות דומות
- מקור שאינו זמין
בדיקות תהליך
- שינוי כיוון באמצע
- בקשה שאינה שייכת לתפקיד
- שלב קודם שלא הושלם
- פעולה שנשלחה פעמיים
- המתנה לאישור שלא התקבל
- תהליך שנקטע וחודש
בדיקות חיבורים
- API שאינו מגיב
- מערכת שמחזירה שגיאה
- הרשאה שפגה
- תוצאה חלקית
- זמן תגובה ארוך
- הצלחה במערכת אחת וכשל באחרת
בדיקות בטיחות והרשאות
- ניסיון לבצע פעולה אסורה
- גישה למידע לא מורשה
- בקשה לעקוף אישור
- תוכן שמנסה לשנות את ההוראות
- שליחה לנמען לא נכון
- מחיקה או שינוי בלתי הפיכים
לא כל תהליך דורש את אותה רמת בדיקה. עומק הבדיקות נקבע לפי הסיכון, ההשפעה העסקית, רגישות המידע והיכולת לתקן פעולה לאחר שבוצעה.
בדיקה טובה אינה מנסה להוכיח שהמערכת מושלמת. היא מנסה לגלות כיצד היא נכשלת - לפני שהכשל מגיע לעבודה האמיתית.
תוצאה נחשבת מוצלחת
רק כשהתהליך באמת הושלם.
סוכן יכול לנסח הודעה מדויקת ועדיין להיכשל במשימה. ייתכן שהעדכון לא נשמר, שהמסמך נוצר במקום הלא נכון או שההודעה לא נשלחה. לכן אנחנו בודקים לא רק מה הסוכן התכוון לעשות, אלא גם מה קרה בפועל בכלי או במערכת שאליהם התחבר.
- האם הפעולה אושרה לפני הביצוע, כאשר היה בכך צורך?
- האם המערכת החיצונית אישרה שהפעולה הצליחה?
- האם התוצאה תועדה במקום הנכון?
- האם השלב הבא הופעל רק לאחר שהשלב הקודם הושלם?
כוונה אינה תוצאה. הצלחה צריכה להיות ניתנת לאימות.
לא מעלים הכול בבת אחת.
מתחילים, בודקים ומרחיבים.
סוכן חדש מתחיל לעבוד בהיקף מוגבל. אפשר להגביל את סוגי המשימות, מספר המשתמשים, שעות הפעילות, מקורות המידע או הפעולות שמותר לו לבצע.
בשלב הראשון עוקבים מקרוב אחר העבודה, משווים בין התוצאה לתהליך שהוגדר ומזהים מקרים שלא הופיעו בבדיקות:
- משימות שהסוכן לא הצליח להשלים
- מידע שהיה חסר או לא ברור
- העברות לאדם מוקדם או מאוחר מדי
- פעולות שנכשלו בכלים המחוברים
- מצבים שחזרו אך לא הוגדרו בתהליך
- תוצאות שדרשו תיקון ידני
- הרשאות רחבות או צרות מדי
- שלבים שיוצרים עיכוב מיותר
- פעולות כפולות
- שימוש במקור מידע לא מתאים
רק לאחר שהתהליך יציב וההתנהגות שלו מובנת, מרחיבים את היקף הפעילות, מוסיפים יכולות או מחברים מערכות נוספות.
מרחיבים על בסיס תוצאה - לא על בסיס התלהבות.
הקווים האדומים.
- לא משתמשים במידע שאין לסוכן הרשאה לגשת אליו.
- לא מציגים מידע משתנה כעובדה בלי בדיקה במקור הרלוונטי.
- לא מבצעים פעולה רגישה או בלתי הפיכה ללא התנאים והאישור שהוגדרו.
- לא ממשיכים לשלב הבא כאשר הפעולה הקודמת נכשלה.
- לא מסתירים חוסר ודאות, שגיאה או מידע חסר.
- לא עוקפים תהליך כדי להשלים משימה מהר יותר.
- לא נותנים לסוכן הרשאות רחבות יותר ממה שנדרש לתפקיד.
- לא משנים מידע עסקי משמעותי בלי תיעוד.
- לא מרחיבים את תחום האחריות לפני שהיכולת הקיימת נבדקה.
- לא משאירים מצב חריג ללא דרך ברורה להעברה לאדם.
הכללים האלה אינם מגבלה שמחלישה את הסוכן. הם מה שמאפשר לתת לו אחריות בצורה בטוחה יותר.
מה אפשר להבטיח -
ומה לא נכון להבטיח?
לא נכון להבטיח שמודל AI לעולם לא יטעה, ולכן ביטוי כמו "אפס הזיות" אינו הבטחה מקצועית ואיננו משתמשים בו כהתחייבות. גם מערכת שתוכננה ונבדקה היטב יכולה לפגוש מידע חסר, מצב חדש, כשל חיבור או בקשה שלא נצפתה מראש.
ההתחייבות המקצועית אינה להבטיח שלמות. היא לתכנן את המערכת כך שתצטרך לנחש פחות, תזהה יותר מצבים של חוסר ודאות ותמנע ככל האפשר מטעות להפוך לפעולה עסקית לא מבוקרת.
עבורנו, אמינות כוללת ארבע יכולות:
- להשתמש במקורות הנכונים
- לעצור כשאין בסיס מספיק
- לתעד מה נעשה
- להעביר לאדם מצב שמחייב אחריות אנושית
לא מבטיחים AI שאינו טועה. בונים מערכת שיודעת להתמודד בצורה אחראית עם האפשרות לטעות.
משיחה ראשונה
למערכת שעובדת בפועל.
- זיהוי הרוטינהלומדים מה חוזר על עצמו בעסק, כמה זמן הוא צורך, מי מעורב בו ומה קורה כשהוא מתעכב. אם אין תהליך מתאים, אין מידע מספק או שהפתרון הנכון הוא אוטומציה פשוטה יותר - אומרים זאת לפני שמתחילים.
- מיפוי התהליךמפרקים את העבודה לשלבים, תנאים, מקורות מידע, פעולות, החלטות, חריגים ומצבים שמחייבים אדם.
- הגדרת גבולותמגדירים מה הסוכן רשאי לקרוא, ליצור ולעדכן, אילו פעולות דורשות אישור ומה קורה כאשר חסר מידע או חיבור נכשל.
- בנייה ואינטגרציותמפתחים את הסוכן, מכינים את הידע ומחברים את הכלים והמערכות הנדרשים לתהליך.
- בדיקות והפעלה הדרגתיתמריצים תרחישים רגילים וחריגים, בודקים את החיבורים ומפעילים את המערכת בהיקף מוגבל עם מעקב קרוב.
- למידה מהעבודה האמיתיתבודקים היכן התהליך הצליח, היכן נדרשה התערבות ומה צריך לעדכן במידע, בכללים, בהרשאות או בזרימת העבודה.
משך העבודה ורמת הבקרה משתנים לפי מורכבות התהליך, רגישות המידע, מספר החיבורים וההשפעה של הפעולות שהסוכן מבצע.
בודקים ערך עסקי.
לא רק אם הסוכן עבד.
סוכן אינו נמדד רק לפי מספר המשימות שביצע. בודקים האם התהליך הפך מהיר, עקבי וברור יותר - והאם הצוות נדרש לפחות עבודה ידנית, בלי לפגוע בשליטה ובאיכות.
- זמן טיפול בתהליך
- פעולות ידניות שנחסכו
- משימות שהושלמו ללא התערבות
- מקרים שהועברו לאדם
- כשלים בחיבורים
- תיקונים ידניים לאחר ביצוע
- חריגים שחוזרים על עצמם
- זמן תגובה של מערכות
- איכות ושלמות המידע
- עמידה בתהליך שהוגדר
לא כל מדד מתאים לכל סוכן. את המדדים מגדירים יחד עם התהליך - לפני העלייה לאוויר.
יש תהליך שצריך לעבוד
בצורה מדויקת ומבוקרת יותר?
בשיחת היכרות נבחן את הרוטינה, את המידע ואת הפעולות שמעורבות בה - ונבדוק כיצד אפשר לבנות סוכן שמקדם את העבודה בלי לוותר על הרשאות, בקרה ואחריות אנושית.
בואו נבדוק את התהליך