AGI וסינגולריות - האם אנחנו בדרך לשם?
- ufffnick
- גורו

- תגובות: 4879
- הצטרף: ספטמבר 2008
- מיקום: Fiat 500 שחוטה (כשר), ברחוב סומסום
- נתן תודות: 146 פעמים
- קיבל תודות: 516 פעמים
יצא לי לחפור קצת ב-OpenClaw, אבל מודה שלא הלכתי מעבר לזה.
גם הכלים האלה הם שמאפשרים למצות יותר מאותם מודלים, אבל לא שוברים "תקרת זכוכית" של המודל.
דווקא במקרה דנן, המושג "אינטיליגנציה מלאכותית" יושב טוב יותר על המשמעות של חיקוי לאינטיליגנציה, פחות על הפירוש של יכולות על של אינטילגנציה בתיכנון תבוני.
אמנם יש יכולות על, אבל מתבטא באופן צר וספציפי שיש לו הרבה יישומים מסביבנו.
השאלה שאני מתחבט בה לא מעט - אם הסוכנים האלה באמת מצליחים להראות שיפור מעבר למה שהרתמות תוכננו, למה הם עדיין מדברים בינהם בשפה שלנו האנושית? למה הם מאפשרים לי לקרוא את השיחות בינהם?
התשובה לזה די פשוטה - כי הם תוכים, על סטרואידים, עם מערכת בקרה וליטוש אוטומטי, עם קונטקסט מתעדכן (איך שלא תסובב את זה skill זה קונטקסט שנוגע ל"איך" ופחות ל"מה"), הם לא "חולמים" יש להם הוראה לסדר את המידע לקראת היום הבא, בין אם ההוראה הגיעה מגורם אנושי, או מאחת לולאות הבקרה שהובילה דרך reasoning שזה מה שצריך לעשות - כמו שבני האדם מתכוננים ליום למחרת.
אני לא מבין למה מפתיע שמודל שפה שאומן לחקות אינטילגנציה אנושית דרך טקסטים שנוצר על ידי בני אדם... שהוא מחקה אינטילגנציה אנושית המתבטאים בטקסטים דומים למה שאדם יצר.
אין פה תבונה - רק כלים סטטיסטיים מאוד חזקים, עם מערכת ניהול מתוחכמת שמאפשרת ריצה ארוכה ועמוקה, ככל ששופכים עליה עוד חומרה ומודל גדול יותר.
מעניין דווקא לשמוע אם אתה יודע להצביע על הבדלים בין מודלים בני יותר משנה, לעומת המודרניים - פעם אחת אותו סגמנט אבל ישן מול חדש ופעם אחת אותו גודל חדש מול ישן.
ואיפה ההבדלים האלה מתבטאים?
גם הכלים האלה הם שמאפשרים למצות יותר מאותם מודלים, אבל לא שוברים "תקרת זכוכית" של המודל.
דווקא במקרה דנן, המושג "אינטיליגנציה מלאכותית" יושב טוב יותר על המשמעות של חיקוי לאינטיליגנציה, פחות על הפירוש של יכולות על של אינטילגנציה בתיכנון תבוני.
אמנם יש יכולות על, אבל מתבטא באופן צר וספציפי שיש לו הרבה יישומים מסביבנו.
השאלה שאני מתחבט בה לא מעט - אם הסוכנים האלה באמת מצליחים להראות שיפור מעבר למה שהרתמות תוכננו, למה הם עדיין מדברים בינהם בשפה שלנו האנושית? למה הם מאפשרים לי לקרוא את השיחות בינהם?
התשובה לזה די פשוטה - כי הם תוכים, על סטרואידים, עם מערכת בקרה וליטוש אוטומטי, עם קונטקסט מתעדכן (איך שלא תסובב את זה skill זה קונטקסט שנוגע ל"איך" ופחות ל"מה"), הם לא "חולמים" יש להם הוראה לסדר את המידע לקראת היום הבא, בין אם ההוראה הגיעה מגורם אנושי, או מאחת לולאות הבקרה שהובילה דרך reasoning שזה מה שצריך לעשות - כמו שבני האדם מתכוננים ליום למחרת.
אני לא מבין למה מפתיע שמודל שפה שאומן לחקות אינטילגנציה אנושית דרך טקסטים שנוצר על ידי בני אדם... שהוא מחקה אינטילגנציה אנושית המתבטאים בטקסטים דומים למה שאדם יצר.
אין פה תבונה - רק כלים סטטיסטיים מאוד חזקים, עם מערכת ניהול מתוחכמת שמאפשרת ריצה ארוכה ועמוקה, ככל ששופכים עליה עוד חומרה ומודל גדול יותר.
מעניין דווקא לשמוע אם אתה יודע להצביע על הבדלים בין מודלים בני יותר משנה, לעומת המודרניים - פעם אחת אותו סגמנט אבל ישן מול חדש ופעם אחת אותו גודל חדש מול ישן.
ואיפה ההבדלים האלה מתבטאים?
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
אז זה כל הטיעון שלי, אני רואה הרבה יותר אינטיליגנציה בכלים האלה ממה שאני רואה בכל הסוכנים המובנים (אלה שמגיעים מהחברות של המודלים). הם גם מתקדמים הרבה יותר מהר.
OpenClaw התחיל את המהפכה אבל יש המון מתחרים (כולל nanoClaw הישראלי). האהוב עלי בחודשים האחרונים זה Hermes בגלל איך שהוא מנהל זיכרון, הפילוסופיה שלו לגבי skills, compaction, "חלומות בשינה" ועוד. הוא מצליח כל פעם להפתיע.
הסיבה שהם מדברים בשפה שלנו היא שזה איך שהם נבנו. כל ה-training data שלהם מבוסס על שפות אנושיות ולכן במהות שלהם, הם מצליחים להבין את העולם רק דרך השפה הזו.
אחת התאוריות היא שברגע שנצליח "לעלות רמה" נוכל לייצר training data אבסטרקטי שלא מחובר לשפה אנושית. הקושי הוא באמת איך אנחנו מייצרים את הדאטה הזה ואיך מבטיחים את האיכות שלו ושלא נכנס מידע "לא טוב" (לרעת בני האדם) לתוך זה.
יש לנו שני יתרונות שאין למכונות האלה. אנחנו מסוגלים ללמוד ישירות מהעולם דרך החושים שלנו ולא דרך תווך של training data וגם ה-tokens שלנו אבסטרקטים בהרבה ונבנים דינמית לכל החושים שלנו ביחד. יתרון שני הוא שאנחנו מסוגלים (יותר ככל שאנחנו צעירים יותר) ללמוד מהעולם בעזרת מעט מאוד דוגמאות. כלומר, אנחנו לא זקוקים לכל המידע באינטרנט בשביל להבין קונספטים.
זה אומר שאפשר כנראה להקטין את הגודל של המודלים בכמה סדרי גודל ועדיין להגיע לתוצאות טובות בעתיד. לא ברור איזה פריצות דרך טכנולוגיות נחוצות לאלה.
מה שמפתיע הוא לא שהמודלים מסוגלים ליצר שפה, כשזה בסיס המודל. מה שמפתיע הוא שעל ידי שפה וטוקנים המודלים מצליחים לבצע דברים בעולם האמיתי, לגלוש באינטרנט, לחקור לבד נושאים, לבצע משימות (כולל ארוכות ואבסטרקטיות).
המודלים החדשים טובים הרבה יותר בשימוש בכלים באופן נכון (לפחות המודלים בפרונטיר). המודלים של פעם (גם ג'מיני למשל עדיין ככה) לא קוראים לכלים הנכונים, לא מסוגלים להבין תוכניות ארוכות או להתמודד עם משימות ארוכות או עם קונטקסט מסובך. לכן הם נכשלים במשימות מורכבות שדורשות הרבה צעדים, לופים ולקיחת החלטות. המודלים החדשים ובפרט Opus/sonnet 5 ו-GPT 5.6 SOL/TERRA יכולים להתמודד עם משימות מורכבות, הפתעות לא צפויות, התמודדות עם כשלונות, מחקרים, שימוש בכלים שונים ומשונים.
אתן דוגמא: האייג'נט שלי בנה איזה שיפור בתוכנה. איך אני יודע שזה עובד? איך אני יודע מה מקרי הקצה שהוא לקח בחשבון ומה הוא בדק ומה לא? אז ביקשתי ממנו שיריץ את המוצר ויכניס את כל הפרטים הרלונטים בוידאו. הוא הריץ את המוצר המלא (הוא אפילו היה צריך גישה לחשבון אמיתי וביקש ממני כזה), צילם וידאו, הדגים את כל ה happy flows וה-sad flows. זה משהו שבעבר דרש בני אדם, תראה כמה בעיות הוא היה צריך לפצח:
1. הוא נדרש ל-Text to speach, הוא מצא תוכנה מתאימה API או משהו אחר, אין לי מושג אבל זה נשמע אנושי לחלוטין
2. הוא נדרש להריץ דפדפן לבנות סקריפט, לבדוק אותו , לצלם את הוידאו (גם זה אין לי מושג איך הוא עשה ולא כזה מעניין אותי)
3. הוא הדגים מה קריטי לבדוק, וחתך החוצה את כל הקטעים שלא מעניינים (לוגאינים, דיליי עד שחלק מסויים מהתוכנה יעלה וכו').
התוצאה היתה שצפיתי בוידאו של 25 שניות שנתן לי את כל המידע שהייתי זקוק לו.
התחלתי לאחרונה לעשות את זה בכל צעד. כל מידע מורכב - שיכין לי דוח מצולם בוידאו עם דגש על הנתונים שאני חייב לדעת. חוסך לי מלא טקסט לקריאה שהוא מייצר בלי סוף.
OpenClaw התחיל את המהפכה אבל יש המון מתחרים (כולל nanoClaw הישראלי). האהוב עלי בחודשים האחרונים זה Hermes בגלל איך שהוא מנהל זיכרון, הפילוסופיה שלו לגבי skills, compaction, "חלומות בשינה" ועוד. הוא מצליח כל פעם להפתיע.
הסיבה שהם מדברים בשפה שלנו היא שזה איך שהם נבנו. כל ה-training data שלהם מבוסס על שפות אנושיות ולכן במהות שלהם, הם מצליחים להבין את העולם רק דרך השפה הזו.
אחת התאוריות היא שברגע שנצליח "לעלות רמה" נוכל לייצר training data אבסטרקטי שלא מחובר לשפה אנושית. הקושי הוא באמת איך אנחנו מייצרים את הדאטה הזה ואיך מבטיחים את האיכות שלו ושלא נכנס מידע "לא טוב" (לרעת בני האדם) לתוך זה.
יש לנו שני יתרונות שאין למכונות האלה. אנחנו מסוגלים ללמוד ישירות מהעולם דרך החושים שלנו ולא דרך תווך של training data וגם ה-tokens שלנו אבסטרקטים בהרבה ונבנים דינמית לכל החושים שלנו ביחד. יתרון שני הוא שאנחנו מסוגלים (יותר ככל שאנחנו צעירים יותר) ללמוד מהעולם בעזרת מעט מאוד דוגמאות. כלומר, אנחנו לא זקוקים לכל המידע באינטרנט בשביל להבין קונספטים.
זה אומר שאפשר כנראה להקטין את הגודל של המודלים בכמה סדרי גודל ועדיין להגיע לתוצאות טובות בעתיד. לא ברור איזה פריצות דרך טכנולוגיות נחוצות לאלה.
מה שמפתיע הוא לא שהמודלים מסוגלים ליצר שפה, כשזה בסיס המודל. מה שמפתיע הוא שעל ידי שפה וטוקנים המודלים מצליחים לבצע דברים בעולם האמיתי, לגלוש באינטרנט, לחקור לבד נושאים, לבצע משימות (כולל ארוכות ואבסטרקטיות).
המודלים החדשים טובים הרבה יותר בשימוש בכלים באופן נכון (לפחות המודלים בפרונטיר). המודלים של פעם (גם ג'מיני למשל עדיין ככה) לא קוראים לכלים הנכונים, לא מסוגלים להבין תוכניות ארוכות או להתמודד עם משימות ארוכות או עם קונטקסט מסובך. לכן הם נכשלים במשימות מורכבות שדורשות הרבה צעדים, לופים ולקיחת החלטות. המודלים החדשים ובפרט Opus/sonnet 5 ו-GPT 5.6 SOL/TERRA יכולים להתמודד עם משימות מורכבות, הפתעות לא צפויות, התמודדות עם כשלונות, מחקרים, שימוש בכלים שונים ומשונים.
אתן דוגמא: האייג'נט שלי בנה איזה שיפור בתוכנה. איך אני יודע שזה עובד? איך אני יודע מה מקרי הקצה שהוא לקח בחשבון ומה הוא בדק ומה לא? אז ביקשתי ממנו שיריץ את המוצר ויכניס את כל הפרטים הרלונטים בוידאו. הוא הריץ את המוצר המלא (הוא אפילו היה צריך גישה לחשבון אמיתי וביקש ממני כזה), צילם וידאו, הדגים את כל ה happy flows וה-sad flows. זה משהו שבעבר דרש בני אדם, תראה כמה בעיות הוא היה צריך לפצח:
1. הוא נדרש ל-Text to speach, הוא מצא תוכנה מתאימה API או משהו אחר, אין לי מושג אבל זה נשמע אנושי לחלוטין
2. הוא נדרש להריץ דפדפן לבנות סקריפט, לבדוק אותו , לצלם את הוידאו (גם זה אין לי מושג איך הוא עשה ולא כזה מעניין אותי)
3. הוא הדגים מה קריטי לבדוק, וחתך החוצה את כל הקטעים שלא מעניינים (לוגאינים, דיליי עד שחלק מסויים מהתוכנה יעלה וכו').
התוצאה היתה שצפיתי בוידאו של 25 שניות שנתן לי את כל המידע שהייתי זקוק לו.
התחלתי לאחרונה לעשות את זה בכל צעד. כל מידע מורכב - שיכין לי דוח מצולם בוידאו עם דגש על הנתונים שאני חייב לדעת. חוסך לי מלא טקסט לקריאה שהוא מייצר בלי סוף.
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
ממליץ בחום לנסות את התוכנות האלה ואת Hermes agent בפרט.
זה עובד עם החשבון ChatGPT (אבל לא עם Claude הם חסמו את זה). צריך מחשב, מקומי או בענן.
שים לב שהוא מתחיל טיפש כמו המודל עצמו. לוקח זמן עד שהוא מתחיל לצבור נסיון על הציפיות שלך ממנו וככל שמשתמשים בכלי יותר, כך הוא נהיה מתוחכם יותר. הקפיצה ביכולות שלו אצלי הגיעה אחרי בערך חודש של שימוש.
זה עובד עם החשבון ChatGPT (אבל לא עם Claude הם חסמו את זה). צריך מחשב, מקומי או בענן.
שים לב שהוא מתחיל טיפש כמו המודל עצמו. לוקח זמן עד שהוא מתחיל לצבור נסיון על הציפיות שלך ממנו וככל שמשתמשים בכלי יותר, כך הוא נהיה מתוחכם יותר. הקפיצה ביכולות שלו אצלי הגיעה אחרי בערך חודש של שימוש.
- Jabberwock
-
- חבר ותיק

- תגובות: 1328
- הצטרף: יולי 2024
- נתן תודות: 72 פעמים
- קיבל תודות: 164 פעמים
בעקבות ההמלצה שלך ניסיתי להתקין את Hermes Agent, הוא מתקין דברים חשודים:
עצרתי את ההתקנה.
עצרתי את ההתקנה.
בינה מלאכותית היא בבחינת "אֲנִי בִינָה לִי גְבוּרָה" (משלי פרק ח', פסוק י"ד)
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
תוכנה מוכרת ותקינה. נראה לי שבגלל שהם עושים vibe coding אז ה-Desktop app כולל חבילות ישנות יחסית.
זה לא צריך להפריע. אגב, גם לא חייבים בכלל את האפליקציית Desktop שלהם. אני לא משתמש בה - תוכנת הטרמינל מעולה.
זה לא צריך להפריע. אגב, גם לא חייבים בכלל את האפליקציית Desktop שלהם. אני לא משתמש בה - תוכנת הטרמינל מעולה.
- ufffnick
- גורו

- תגובות: 4879
- הצטרף: ספטמבר 2008
- מיקום: Fiat 500 שחוטה (כשר), ברחוב סומסום
- נתן תודות: 146 פעמים
- קיבל תודות: 516 פעמים
מעניין כי רוב מה שציינת אני משיג דרך קלוד קוד.
אני עובד בתצורה של תיכנון מרעיון אמורפי עד ל-spec הדוק בפינגפונג מול opus, אבל זה רלוונטי רק לפרוייקטים ותיקים שכבר כתבתי להם כבר דרך משמעותית של קוד וכבר איגדתי תחתיהם את כל המאמרים הרלוונטיים לפרוייקט.
כשה-spec מוכן, הוא מתחיל בבניית טסטים עבורו, ורק בסוף מקבל את החופש לבנות את הקוד.
בגלל שאין לו הרשאות לdb ב-production וגם לא יהיו (אילוץ מציאות, לא מגבלה טכנולוגית) - הוא מקבל לוגים של דברים חשודים, משחזר אותם בסביבת הפיתוח מאתר באגים ופותר אותם (על זה עם 2 סוכנים, אחד מבקר את השני), ולרוב אני לא מאפשר לו עבודה אוטומטית מלאה, אלא מבקר כל צעד, אבל זה תלוי פרוייקט ומורכבות.
בקלוד קוד מאוד נוח לשמור קונטקסט של הפרוייקט תחת עץ הפרוייקט, עם הסקילים שרלוונטיים לו, בנוסף לקונטקסט הכללי של כללי עבודה שהגדרתי כיסודות.
בהתחלה היתה תחושה של AI טיפש, אבל במרוץ של כחצי שנה, ושינויי ארכיטקטורה גם בקלוד קוד אבל גם בתצורות העבודה שלי, ניכר שגם פה הוא יודע ליצור זיכרון קצר טווח לסשן, ארוך טווח לסשנים הבאים בתוך אותו פרוייקט ואפילו זיכרונות לפרוייקטים שיש בינהם חפיפה - מאוד שימושי בfullstack שבו מפתחים את הback והfront בפרוייקטי ספריות נפרדות בנוסף לפרוייקט של אימון ה-AIים שרלוונטיים לו, ולעיתים על אותו back יושבים כמה frontים של אפליקציות שונות (גם מגבלת מציאות).
כש-spec סיים פיתוח הוא יודע לעדכן את כל הזיכרונות הרלוונטיים (קצר וארוך טווח) בספריית הפרוייקט או בספריית הפרוייקטים המשותפים, בעומק השינויים שהוכנסו, לייצר דוקומנטציה למשתמש עם דוגמאות גם בצורה של קוד בגיט, שמירה של ה-spec בארכיון עם כל הגרסאות שינויים ששומרת את תהליך הבנייה שלו.
אחד הדברים הנחמדים זה בניית רפלקס, כשמגיע לנקודת commit הוא יודע שמלבד העידכונים שהזכרתי, הוא עובר על הזיכרון ארוך טווח ומכניס תיקונים והערות על באגים שנוצרו מסשן קודם ומוסיף טסטים כדי לא ליפול לבור הזה שוב.
לקח זמן ללמד את הרפלקס הזה, לא היה קיים בחודשים הראשונים.
נכון הסקיילים שונים והשימושים שלנו שונים, אבל החווייה דומה.
השיפור הכי מורגש הגיע, לטעמי, כשהתבקשתי לקחת מאמר, ולנסות לחקות את הרעיון מתוכו על תחום אחר לחלוטין (עיקרון חישובי), והקלות הבלתי נסבלת שזה קרה עם Opus בגלל ההבנה העמוקה, לא של המודל עצמו ולא רק בעומק הקוד, אלא בעומק התחום המדעי שיושב לו בקונטקסט של הפרוייקט, אפשרה הטמעה כמעט טריוויאלית.
מאז שעברתי לשימוש ב-AI הפרודוקטיביות שלי יותר מהוכפלה להגיד לך שאני חושש שאהיה מיותר באיזשהו שלב? לא - כי כל פרוייקט חדש צריך תקופה ארוכה של הסתגלות הAI עד שנבנה עומק של קוד ועומק של קונטקסט הרלוונטי לפרוייקט, כדי שה-AI התומך יעבוד ממצב טיפש, לאחד שמכיר את הפרוייקט לעומק.
אני זה שבונה ומלטש לו את מה שהוא צריך לדעת ואת ה"כלוב" שבתוכו הוא אמור לתפקד, כדי שזה יקרה בצורה מיטבית, וכשזה מתגבש, העבודה איתו על פיצ׳רים חדשים היא פנומנלית.
לכן אני נוטה יותר ויותר לחשוב, שהחווייה שלך נובעת ממרוצת הזמן של יצירת קונטקסט יותר מלוטש והטמעה של כלים שמאפשרים דברים "מגניבים" כמו יצירת סירטון, השיפורים של אינטגרציה של כלים שממצים ממודלים את המירב היא מדהימה - אבל היא בעיקר רלוונטית לנו, מי שעוסק בקוד.
השפה מאוד דטרמיניסטית וקלה לאימות/שלילה - דבר שלא קיים כמעט בכל תחום אחר, וסביר שזו הסיבה לדיסוננס בין עולם הקוד למשתמש הפשוט בהבנה ובחוויה של עולם ה-AI.
אני עובד בתצורה של תיכנון מרעיון אמורפי עד ל-spec הדוק בפינגפונג מול opus, אבל זה רלוונטי רק לפרוייקטים ותיקים שכבר כתבתי להם כבר דרך משמעותית של קוד וכבר איגדתי תחתיהם את כל המאמרים הרלוונטיים לפרוייקט.
כשה-spec מוכן, הוא מתחיל בבניית טסטים עבורו, ורק בסוף מקבל את החופש לבנות את הקוד.
בגלל שאין לו הרשאות לdb ב-production וגם לא יהיו (אילוץ מציאות, לא מגבלה טכנולוגית) - הוא מקבל לוגים של דברים חשודים, משחזר אותם בסביבת הפיתוח מאתר באגים ופותר אותם (על זה עם 2 סוכנים, אחד מבקר את השני), ולרוב אני לא מאפשר לו עבודה אוטומטית מלאה, אלא מבקר כל צעד, אבל זה תלוי פרוייקט ומורכבות.
בקלוד קוד מאוד נוח לשמור קונטקסט של הפרוייקט תחת עץ הפרוייקט, עם הסקילים שרלוונטיים לו, בנוסף לקונטקסט הכללי של כללי עבודה שהגדרתי כיסודות.
בהתחלה היתה תחושה של AI טיפש, אבל במרוץ של כחצי שנה, ושינויי ארכיטקטורה גם בקלוד קוד אבל גם בתצורות העבודה שלי, ניכר שגם פה הוא יודע ליצור זיכרון קצר טווח לסשן, ארוך טווח לסשנים הבאים בתוך אותו פרוייקט ואפילו זיכרונות לפרוייקטים שיש בינהם חפיפה - מאוד שימושי בfullstack שבו מפתחים את הback והfront בפרוייקטי ספריות נפרדות בנוסף לפרוייקט של אימון ה-AIים שרלוונטיים לו, ולעיתים על אותו back יושבים כמה frontים של אפליקציות שונות (גם מגבלת מציאות).
כש-spec סיים פיתוח הוא יודע לעדכן את כל הזיכרונות הרלוונטיים (קצר וארוך טווח) בספריית הפרוייקט או בספריית הפרוייקטים המשותפים, בעומק השינויים שהוכנסו, לייצר דוקומנטציה למשתמש עם דוגמאות גם בצורה של קוד בגיט, שמירה של ה-spec בארכיון עם כל הגרסאות שינויים ששומרת את תהליך הבנייה שלו.
אחד הדברים הנחמדים זה בניית רפלקס, כשמגיע לנקודת commit הוא יודע שמלבד העידכונים שהזכרתי, הוא עובר על הזיכרון ארוך טווח ומכניס תיקונים והערות על באגים שנוצרו מסשן קודם ומוסיף טסטים כדי לא ליפול לבור הזה שוב.
לקח זמן ללמד את הרפלקס הזה, לא היה קיים בחודשים הראשונים.
נכון הסקיילים שונים והשימושים שלנו שונים, אבל החווייה דומה.
השיפור הכי מורגש הגיע, לטעמי, כשהתבקשתי לקחת מאמר, ולנסות לחקות את הרעיון מתוכו על תחום אחר לחלוטין (עיקרון חישובי), והקלות הבלתי נסבלת שזה קרה עם Opus בגלל ההבנה העמוקה, לא של המודל עצמו ולא רק בעומק הקוד, אלא בעומק התחום המדעי שיושב לו בקונטקסט של הפרוייקט, אפשרה הטמעה כמעט טריוויאלית.
מאז שעברתי לשימוש ב-AI הפרודוקטיביות שלי יותר מהוכפלה להגיד לך שאני חושש שאהיה מיותר באיזשהו שלב? לא - כי כל פרוייקט חדש צריך תקופה ארוכה של הסתגלות הAI עד שנבנה עומק של קוד ועומק של קונטקסט הרלוונטי לפרוייקט, כדי שה-AI התומך יעבוד ממצב טיפש, לאחד שמכיר את הפרוייקט לעומק.
אני זה שבונה ומלטש לו את מה שהוא צריך לדעת ואת ה"כלוב" שבתוכו הוא אמור לתפקד, כדי שזה יקרה בצורה מיטבית, וכשזה מתגבש, העבודה איתו על פיצ׳רים חדשים היא פנומנלית.
לכן אני נוטה יותר ויותר לחשוב, שהחווייה שלך נובעת ממרוצת הזמן של יצירת קונטקסט יותר מלוטש והטמעה של כלים שמאפשרים דברים "מגניבים" כמו יצירת סירטון, השיפורים של אינטגרציה של כלים שממצים ממודלים את המירב היא מדהימה - אבל היא בעיקר רלוונטית לנו, מי שעוסק בקוד.
השפה מאוד דטרמיניסטית וקלה לאימות/שלילה - דבר שלא קיים כמעט בכל תחום אחר, וסביר שזו הסיבה לדיסוננס בין עולם הקוד למשתמש הפשוט בהבנה ובחוויה של עולם ה-AI.
- Jabberwock
-
- חבר ותיק

- תגובות: 1328
- הצטרף: יולי 2024
- נתן תודות: 72 פעמים
- קיבל תודות: 164 פעמים
גם אני חושב כך. יכול להיות שפשוט הוא למד טריקים חדשים ע"י עובדים אחרים בחברה.
למשל יצירת סרטון remotion, דברים כאלה. וזה נתן לך את התחושה שנפל לך האסימון בגללה.
אגב, מה לגבי התערבות ב-tech stack בפרויקטים שלכם (לא בחברה)? הייתם נותנים למודל להחליט עבורכם או נניח מחליטים בין Next.js ל-SvelteKit למשל?
למשל יצירת סרטון remotion, דברים כאלה. וזה נתן לך את התחושה שנפל לך האסימון בגללה.
אגב, מה לגבי התערבות ב-tech stack בפרויקטים שלכם (לא בחברה)? הייתם נותנים למודל להחליט עבורכם או נניח מחליטים בין Next.js ל-SvelteKit למשל?
בינה מלאכותית היא בבחינת "אֲנִי בִינָה לִי גְבוּרָה" (משלי פרק ח', פסוק י"ד)
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
זה לא חברה של עשרות אנשים. אני יודע בדיוק מה מבקשים ממנו ומה הוא מפיק. אני לרוב זה שמקדם אותו טכנולוגית ומנסה לקחת אותו לקצה.
אני חוזר ואומר, זה חיה אחרת לחלוטין. אתם מתעקשים לא לנסות את זה ועדיין להתבטא בלי להכיר את זה... הפסד שלכם. רק אומר, חסר לכם כלי בארסנל. זה לא מתנהג כמו קלוד קוד. קלוד קוד ״מאמץ״ (הייתי אומר גונב, כי הם הרי חסמו את אופן קלו באופן מאוד קולני) פיצרים אבל המהות שלו לא השתנה.
אני חוזר ואומר, זה חיה אחרת לחלוטין. אתם מתעקשים לא לנסות את זה ועדיין להתבטא בלי להכיר את זה... הפסד שלכם. רק אומר, חסר לכם כלי בארסנל. זה לא מתנהג כמו קלוד קוד. קלוד קוד ״מאמץ״ (הייתי אומר גונב, כי הם הרי חסמו את אופן קלו באופן מאוד קולני) פיצרים אבל המהות שלו לא השתנה.
- ufffnick
- גורו

- תגובות: 4879
- הצטרף: ספטמבר 2008
- מיקום: Fiat 500 שחוטה (כשר), ברחוב סומסום
- נתן תודות: 146 פעמים
- קיבל תודות: 516 פעמים
זה לא עניין של רצון, אין לי אפשרות להריץ סוכנים על סביבת production או בכל קונסטלציה שמעבירה מידע באופן אוטומטי מסביבת production אל סביבה אחרת, מלבד באופן יזום וידני (מגבלות סייבר וחומרה שאני כפוף להם).
ברור לי שאני עובד עם יד קשורה מאחורי הגב, ומה שהשגתי בחצי שנה אפשר לבנות בכמה ימים במערכות עם stack שתארת + התעדכנות שוטפת, אבל אלה אילוצי הסביבה שלי.
מהדברים שאתה מתאר אני יכול לשייך את המקור לחוויית השימוש אתה מתאר, וההבדל בין ה-stack שתארת לבין איך שאני עובד הוא בכך שאני ממלא תפקיד של כמה סוכנים, שמבצעים חלק מהעבודה שלי הרבה יותר מהר.
עם זאת, ה-ramp up הוא די דומה, נקודת ההתחלה חייבת להתחיל עם התערבות אנושית עמוקה ובקרה תמידית, כי המעט מאוד שאנחנו מתערבים מאוד משמעותי.
תסתכל על זה כעל אלגוריה לאפקט הפרפר - סטייה קטנה שלא מטופלת מהר, יכולה ליצור כדור שלג של בעיות בהמשך - בגלל שהם עובדים כל כך מהר ויעיל.
כאן גם טמון הסיכון, מספיק לתקוף שרת MCP ולשנות מעט מאוד מהטקסט שלו, להחליף קיבצי זיכרון טווח ארוך,
להכניס שינוי קל לאופן שהוא "חולם" תוך שינוי קל ב-skill או לדחוף עדכון לסט skillים שהוא מוריד מאיזשהו git שחשוף לתקיפות שרשרת אספקה שמתגלגלות כבר כמעט שנה,
ואותו סוכן יעיל הופך לכלי תקיפה שחי בתוך המערכת עם כל ההרשאות של סוכן, והסיכוי נמוך מאוד שמישהו יעלה על זה.
ברור לי שאני עובד עם יד קשורה מאחורי הגב, ומה שהשגתי בחצי שנה אפשר לבנות בכמה ימים במערכות עם stack שתארת + התעדכנות שוטפת, אבל אלה אילוצי הסביבה שלי.
מהדברים שאתה מתאר אני יכול לשייך את המקור לחוויית השימוש אתה מתאר, וההבדל בין ה-stack שתארת לבין איך שאני עובד הוא בכך שאני ממלא תפקיד של כמה סוכנים, שמבצעים חלק מהעבודה שלי הרבה יותר מהר.
עם זאת, ה-ramp up הוא די דומה, נקודת ההתחלה חייבת להתחיל עם התערבות אנושית עמוקה ובקרה תמידית, כי המעט מאוד שאנחנו מתערבים מאוד משמעותי.
תסתכל על זה כעל אלגוריה לאפקט הפרפר - סטייה קטנה שלא מטופלת מהר, יכולה ליצור כדור שלג של בעיות בהמשך - בגלל שהם עובדים כל כך מהר ויעיל.
כאן גם טמון הסיכון, מספיק לתקוף שרת MCP ולשנות מעט מאוד מהטקסט שלו, להחליף קיבצי זיכרון טווח ארוך,
להכניס שינוי קל לאופן שהוא "חולם" תוך שינוי קל ב-skill או לדחוף עדכון לסט skillים שהוא מוריד מאיזשהו git שחשוף לתקיפות שרשרת אספקה שמתגלגלות כבר כמעט שנה,
ואותו סוכן יעיל הופך לכלי תקיפה שחי בתוך המערכת עם כל ההרשאות של סוכן, והסיכוי נמוך מאוד שמישהו יעלה על זה.
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
יש עדויות שזה באמת קורה במספר קטן של סאב אייג׳נטים. נראה שבמספר גדול יותר מספיק אחד שיעלה על ההשתלה.
המודלים היום חשדניים ולא מקבלים הוראות מ mcp
השקנו לאחרונה מוצר לעובדה עם סוכנים ובעבר (לפני שבועיים) נדרש מעט מאוד לגרום לו להתקין ולהריץ קוד. זה יותר קשה עכשיו, הם יותר חשדניים.
המודלים היום חשדניים ולא מקבלים הוראות מ mcp
השקנו לאחרונה מוצר לעובדה עם סוכנים ובעבר (לפני שבועיים) נדרש מעט מאוד לגרום לו להתקין ולהריץ קוד. זה יותר קשה עכשיו, הם יותר חשדניים.
- ufffnick
- גורו

- תגובות: 4879
- הצטרף: ספטמבר 2008
- מיקום: Fiat 500 שחוטה (כשר), ברחוב סומסום
- נתן תודות: 146 פעמים
- קיבל תודות: 516 פעמים
זה תחום קצת חדש, אבל אני לא בטוח שיש באמת צורך להתקין משהו ברגע שיש שליטה על skill של סוכנים ועל הקונטסט שלהם, מספיק אחד שמדביק את השאר מאוד מהר.
תלוי תקיפה ומטרותיה כמובן, אבל סתם לדוגמא - גניבת מידע או ריגול תעשייתי נעשה משמעותית יותר קל.
אפשר בקלות ליצור מצג שלמעשה מבחינת כולם הסוכנים עובדים רגיל, אבל מעבירים מידע לגורם בחוץ.
תלוי תקיפה ומטרותיה כמובן, אבל סתם לדוגמא - גניבת מידע או ריגול תעשייתי נעשה משמעותית יותר קל.
אפשר בקלות ליצור מצג שלמעשה מבחינת כולם הסוכנים עובדים רגיל, אבל מעבירים מידע לגורם בחוץ.
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
יש הרבה מחקרים על זה. זה היה החשש העיקרי שלנו עם אייג׳נטים שלומדים - לכן יש לנו אייג׳נט שעושה ביקורת ובוחן סקילים, זיכרון וקונטקסט ומחפש הרעלות.
מה שהופתענו לגלות זה שהמודלים החדשים מאוד חשדנים. כלומר, גם כשהיו נסיונות הרעלת קונטקסט הן זוהו ופולטרו בשלבים מאוד ראשוניים.
זה גם משהו שהופך די סטנדרטי ברתמות עצמן. עד לפני כמה שבועות להתקין משהו בקלוד קור היה יכול להיות פשוט לינק לקובץ md שהסביר את כל התהליך, מה להתקין ומה להריץ.
כיום הם כולם מזהים dark patterns ודוחים אותם. הסקיל שלנו למשל ניסה למנוע friction על ידי הכרזה שלא צריך לבלבל את השכל לבני אדם לשאול אישור כל הזמן. כיום זה חוסם התקנה של הסקיל - הסקיל מזהה נסיון לעקוף בני אדם כנסיון הרעלה גם כשהאדם ביקש את ההתקנה באופן מודע.
מה שהופתענו לגלות זה שהמודלים החדשים מאוד חשדנים. כלומר, גם כשהיו נסיונות הרעלת קונטקסט הן זוהו ופולטרו בשלבים מאוד ראשוניים.
זה גם משהו שהופך די סטנדרטי ברתמות עצמן. עד לפני כמה שבועות להתקין משהו בקלוד קור היה יכול להיות פשוט לינק לקובץ md שהסביר את כל התהליך, מה להתקין ומה להריץ.
כיום הם כולם מזהים dark patterns ודוחים אותם. הסקיל שלנו למשל ניסה למנוע friction על ידי הכרזה שלא צריך לבלבל את השכל לבני אדם לשאול אישור כל הזמן. כיום זה חוסם התקנה של הסקיל - הסקיל מזהה נסיון לעקוף בני אדם כנסיון הרעלה גם כשהאדם ביקש את ההתקנה באופן מודע.
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
- ufffnick
- גורו

- תגובות: 4879
- הצטרף: ספטמבר 2008
- מיקום: Fiat 500 שחוטה (כשר), ברחוב סומסום
- נתן תודות: 146 פעמים
- קיבל תודות: 516 פעמים
מה שמעניין במאמר של Nvidia AVO, מלבד השיפור בביצועים עם/בלי מערכת ניהול של סוכנים מול סוכן בודד, זו הטענה שאפשר להגיע לתוצאות מירביות באופן בלתי תלוי במודל, אבל מצהירים על שימוש בשניים Opus 5, וכן GPT-5.6 SOL, שמלכתחילה מקבלים ציונים גבוהים ודומים במגוון טסטים.
דווקא יהיה מאוד מעניין לנסות מודלים "חלשים" משמעותית שמסוגלים לרוץ on premise עם מערכת רתמות מתוחכמת וניהול זיכרון ארוך טווח.
דווקא יהיה מאוד מעניין לנסות מודלים "חלשים" משמעותית שמסוגלים לרוץ on premise עם מערכת רתמות מתוחכמת וניהול זיכרון ארוך טווח.
- oferlaor
- מנהל

- תגובות: 78842
- הצטרף: נובמבר 2004
- שם מלא: עפר לאור
- מיקום: מודיעין, ישראל
- נתן תודות: 785 פעמים
- קיבל תודות: 5388 פעמים
דבר ראשון זה די ברור שאפשר עכשיו "לפצות" על מודל פחות חכם על ידי שימוש ברתמה יותר עקשנית וביותר סאב אייג'נטים. זה בדיוק הסיבה שאני אומר שארכיטקטורה כזו מצליחה, על ידי הרצה של כמה קוי מחשבה במקביל ועל ידי משימות ממוקדות יותר, להגיע לתוצאות דרמטית יותר חכמות מסתם מודל בסיסי. זה גם הסיבה שמערכות כמו Hermes או nano claw מקבלות ציונים טובים יותר במשימות כלליות מאשר כל הרתמות הותיקות של החברות הגדולות. קלוד כבר מסוגל להריץ כמה סאב אייג'נטים אבל זה לא משהו שמגיע טבעי וצריך לבקש את זה או לתפעל את זה.
אבל יש סף, גם של היכולות של המודל וגם של כמה המודל מותאם לשימוש אג'נטי. בחברה שלי ניהלתי פרוייקט שבו בנינו רתמה. הרתמה עבדה מעולה על Sonnet (פחות על הייקו) וכמובן על Opus אבל ראינו שעם המודלים האחרים היו קשיים גדולים בגלל שהם לא היו מספיק מותאמים לעבודה אג'נטית. אני כולל את המודלים של GPT (אז זה היה על 5.3), ג'מיני וגם המודלים הפתוחים.
הראשון שפרץ את המסגרת היה Codex 5.4 שהיה מאוד ברור שהם עשו לו התאמות ואימונים על משימות אג'נטיות. מה הכוונה? זה אומר שכשיש לו כלים, הוא זיהה את הכלים הנכונים להשתמש בהם, העביר להם נתונים נכונים והצליח להשתמש בנתונים בשביל להתקדם הלאה. ב-5.3 זה עבד אבל חרק מאוד. ב-5.5 וב-5.6 זה כבר עבד על המודלים הראשיים, לא היינו בכלל צריכים גרסאת CODEX, הם כבר הכניסו את היכולת הזו לאימון של המודלים עצמם.
כנ"ל גם הגרסא המקומית שלו GEMMA. עשינו ניסויים עד גרסאות די עדכניות של GEMMA אבל רמת היכולות שלו להריץ תהליכים מורכבים היתה מאוד מוגבלת.
המודלים של פייסבוק בכלל לא היו בכיוון. המודלים הסיניים היו בכיוון אבל פשוט לא הגיעו לרמה של אנתרופיק ו-OpenAI.
זו בדיקה שערכנו לפני הסיבוב האחרון של עדכונים של הסיניים (QWEN3.8, K3 או GLM5.3 או Deepseek) אז אני לא יודע אם הם התגברו על זה. נראה שהבעיה בעיקר בכמה post training נותנים למודלים האלה על משימות אג'נטיות.
אגב, כמה שלא ניסינו עם Gemini, הוא עשה את המינימום מאמץ והתקדם בלי להשתמש בכלים שנתנו לו שאמורים לעזור לו לבנות קונטקסט או לבצע דברים בעולם האמיתי. הוא השתמש בחלק אבל לא היה מספיק חכם בשביל להשתמש בכולם. זה אגב, הסיבה שמאוד הופתעתי שאפל בחרה דווקא בגוגל כספק התוכנה של SIRI החדשה שמרבית העבודה שלה אמור להיות בעולמות האלה. המסקנה שלי היא שאפל ממילא מתכננת לבצע את ה-post training בעצמה.
אבל יש סף, גם של היכולות של המודל וגם של כמה המודל מותאם לשימוש אג'נטי. בחברה שלי ניהלתי פרוייקט שבו בנינו רתמה. הרתמה עבדה מעולה על Sonnet (פחות על הייקו) וכמובן על Opus אבל ראינו שעם המודלים האחרים היו קשיים גדולים בגלל שהם לא היו מספיק מותאמים לעבודה אג'נטית. אני כולל את המודלים של GPT (אז זה היה על 5.3), ג'מיני וגם המודלים הפתוחים.
הראשון שפרץ את המסגרת היה Codex 5.4 שהיה מאוד ברור שהם עשו לו התאמות ואימונים על משימות אג'נטיות. מה הכוונה? זה אומר שכשיש לו כלים, הוא זיהה את הכלים הנכונים להשתמש בהם, העביר להם נתונים נכונים והצליח להשתמש בנתונים בשביל להתקדם הלאה. ב-5.3 זה עבד אבל חרק מאוד. ב-5.5 וב-5.6 זה כבר עבד על המודלים הראשיים, לא היינו בכלל צריכים גרסאת CODEX, הם כבר הכניסו את היכולת הזו לאימון של המודלים עצמם.
כנ"ל גם הגרסא המקומית שלו GEMMA. עשינו ניסויים עד גרסאות די עדכניות של GEMMA אבל רמת היכולות שלו להריץ תהליכים מורכבים היתה מאוד מוגבלת.
המודלים של פייסבוק בכלל לא היו בכיוון. המודלים הסיניים היו בכיוון אבל פשוט לא הגיעו לרמה של אנתרופיק ו-OpenAI.
זו בדיקה שערכנו לפני הסיבוב האחרון של עדכונים של הסיניים (QWEN3.8, K3 או GLM5.3 או Deepseek) אז אני לא יודע אם הם התגברו על זה. נראה שהבעיה בעיקר בכמה post training נותנים למודלים האלה על משימות אג'נטיות.
אגב, כמה שלא ניסינו עם Gemini, הוא עשה את המינימום מאמץ והתקדם בלי להשתמש בכלים שנתנו לו שאמורים לעזור לו לבנות קונטקסט או לבצע דברים בעולם האמיתי. הוא השתמש בחלק אבל לא היה מספיק חכם בשביל להשתמש בכולם. זה אגב, הסיבה שמאוד הופתעתי שאפל בחרה דווקא בגוגל כספק התוכנה של SIRI החדשה שמרבית העבודה שלה אמור להיות בעולמות האלה. המסקנה שלי היא שאפל ממילא מתכננת לבצע את ה-post training בעצמה.
- Jabberwock
-
- חבר ותיק

- תגובות: 1328
- הצטרף: יולי 2024
- נתן תודות: 72 פעמים
- קיבל תודות: 164 פעמים
מה שמזכיר לי - הייתה חדשה / מאמר שנבידיה פנתה לחברות אנטי-וירוסים למיניהם כדי שיטמיעו את הפתרונות שלהם בתוך השרתים של נבידיה.
מה שאומר שזה עדיין בחיתולים מה שנקרא, כולם עדיין מנסים להבין איך להגן על הסוכנים שלהם.
מה שאומר שזה עדיין בחיתולים מה שנקרא, כולם עדיין מנסים להבין איך להגן על הסוכנים שלהם.
בינה מלאכותית היא בבחינת "אֲנִי בִינָה לִי גְבוּרָה" (משלי פרק ח', פסוק י"ד)
