סימון טקסט שיוצר על ידי AI

25/08/2026

אנטרופיק הודיעו שהם מתכננים להתחיל לסמן טקסט שיוצר על ידי המודלים שלהם באמצעות סימון שלא ניתן למחיקה. המימוש מדליק למרות שכבר עורר לא מעט ביקורת וחשש בקהילה. כמה מחשבות על המנגנון והאם הוא באמת כזה נורא.

קודם כל איך זה עובד. הדרישה הבסיסית שלהם היתה לסמן טקסט שנוצר על ידי AI מתוך הטקסט עצמו כך שלא משנה כמה תעתיקו את הטקסט לקובץ אחר או תשנו פורמטים הסימון תמיד יישאר שם ואפילו בהדפסה הסימון עדיין יישאר. זה כבר פוסל כל מיני רעיונות של תווים נסתרים או Metadata.

אז מה אפשר לעשות? המנגנון פשוט וגאוני. היום, כשיש כמה אפשרויות סבירות להשלמת המילה הבאה האלגוריתם בוחר באחת מהן באקראי לפי משקלים שמשקפים כמה הגיוני לבחור כל מילה. מנגנון הסימון מעלה את הסיכוי לבחור מילים מסוימות בהקשרים מסוימים (מילים ירוקות) ומוריד את הסיכוי לבחור מילים אחרות באותם הקשרים (מילים אדומות). מי שמסתכל על קטע טקסט יכול לבדוק כמה מילים ירוקות וכמה מילים אדומות יש בקטע ולפי זה להבין אם הגיוני שהקטע נוצר על ידי קלוד - אם יש הרבה מילים ירוקות כנראה שקלוד בחר את המילים.

גוגל משתמשים בשיטה הזו כדי לסמן טקסטים ב Gemini מ 2024. יש שאומרים שבגלל זה ג'מיני מייצר תוצאות פחות טובות. אני לא בטוח שזה נכון אבל בכל מקרה מעניין לשים לב למגמה. מבחינת השלכות כמה דברים ששווה לזכור:

  1. אומנם העתקת המילים לא שוברת את הסימון אבל שינוי המילים כן. אם מבקשים מקלוד לכתוב בספרדית ואז לוקחים מודל אחר שיתרגם לאנגלית הסימון הולך לאיבוד.

  2. לא מספיק לשנות מילה אחת או כמה מילים בשביל למחוק את הסימון. הסימון בנוי על זה שסטטיסטית יהיו יותר מילים ירוקות מאדומות אז שינוי מילה פה או מילה שם לא משנה את היחס הכללי.

  3. המפתח לפיו נבחרות המילים יישאר סודי באנטרופיק. רק הם יוכלו לזהות אם טקסט מסוים יוצר על ידי קלוד או לא, בדיוק כמו שרק גוגל יודעים לזהות אם טקסט מסוים יוצר על ידי Gemini או לא.

  4. כבר היום מאוד קל לזהות טקסט שנוצר על ידי AI. המנגנון החדש כנראה לא יגרום לקלוד להגיד יותר פעמים Load bearing ואנטרופיק לא הולכים לחפש איזה טקסט יצרתם עם AI או לא - המטרה שלהם היא לזהות מתקפות דיסטילציה ממודלים סינים. ובכל זאת צריך לשים לב שעידן התמימות הסתיים. הטקסט שמודל מייצר הוא לא רק ההשלמה ההגיונית ביותר למילה הבאה אלא תוצר מסומן של חברת ענן.

  5. בהקשר הזה סימון כל טקסט שנוצר עם "מזהה יצרן" הוא עוד צעד של לקיחת בעלות על התוכן. זה לא במקרה שההסבר של אנטרופיק למהלך מתיחס לרגולציה של האיחוד האירופי בנושא AI. האם בעתיד ספקי AI יקודדו לתוך הטקסט מזהים שיאפשרו לזהות את המשתמש שיצר את הקטע? האם נרצה שכל קטע שאנחנו יוצרים עם AI יהיה מסומן על השם שלנו?

  6. כמה זמן יעבור עד שמישהו יגנוב את מפתח ההצפנה של אנטרופיק וישחרר מזהה קלוד אוניברסלי?