ב-22 בספטמבר 2026 חשפה Anthropic את Claude Opus 5.5 - הדגם הראשון במשפחת Claude 5.5 החדשה. הבשורה המרכזית לא רק ביצועים גבוהים יותר, אלא ירידה של 40% בעלות ההרצה לעומת Opus 5, לצד עלייה של יותר מ-30% במהירות. מדובר בשילוב נדיר בעולם מודלי השפה - קפיצת איכות שמגיעה יחד עם התייעלות משמעותית בעלות ובזמן.
TL;DR - עיקרי הדברים
- Anthropic השיקה את Claude Opus 5.5, הדגם הראשון במשפחת Claude 5.5, בביצועים הקרובים ל-Claude Fable 5.1 ברוב המשימות.
- העלות ירדה ב-40% לעומת Opus 5: קלט ב-4 דולר למיליון טוקנים, פלט ב-20 דולר, וקריאות מטמון ב-0.20 דולר בלבד - ירידה של 60%.
- בבדיקות קוד סוכנתי (Terminal-Bench 4.0) המודל הגיע ל-66.4%, לעומת 52.3% ב-Opus 5 ו-57.9% ב-GPT-6 Astra של OpenAI.
- המודל עבר את הביקורת ההתנהגותית האוטומטית המקיפה ביותר של Anthropic בציון הגבוה ביותר עד כה, כולל עמידות משופרת מול הזרקת פקודות (prompt injection).
- חברות כמו GitHub, Spotify, Optiver ו-Lovable כבר דיווחו על שימוש מוקדם, עם חיסכון של עד 50% בזמן ובטוקנים למשימות דומות.
- בקרוב יושקו גם Claude Sonnet 5.5 ו-Claude Haiku 5.5, עם שיפורים דומים בביצועים, ביעילות ובבטיחות.
מה זה בעצם Claude Opus 5.5?
Claude Opus 5.5 הוא הדגם המוביל החדש של Anthropic, ופותח את משפחת Claude 5.5. לפי ההודעה הרשמית של החברה, המודל מגיע בעקבות ההצהרה שפרסמה Anthropic על "האטת הקצב בחזית הטכנולוגית" (pacing the frontier) - גישה שמטרתה לוודא שכל דגם חדש עובר בדיקות בטיחות מקיפות לפני היציאה לשוק. בהתאם לכך, Opus 5.5 נבדק גם על ידי גופים חיצוניים בלתי תלויים, ביניהם Frontier Design ו-METR, לפני שיצא לשימוש הציבור.
מבחינת רמת הביצועים, Anthropic מתארת את Opus 5.5 כמודל שמתפקד ברוב המשימות בקרבה לרמת Claude Fable 5.1 - הדגם המתקדם ביותר שהיה עד כה בבעלות החברה - אך במחיר נמוך משמעותית. במילים אחרות, מדובר בעדכון שמצמצם את הפער בין "המודל הכי חכם" ל"מודל שאפשר להריץ בכמויות גדולות בעלות סבירה".
אילו שיפורים בביצועים מציגה Anthropic?
הדוגמאות שמפרסמת Anthropic ממחישות קפיצה בעבודה על פרויקטים ארוכים ומורכבים. בודק מוקדם השלים מיגרציית קוד בהיקף של 680,000 שורות תוך פחות מיום - משימה שהייתה דורשת צוות הנדסה שלם שבועות של עבודה. בבדיקה נוספת התבקש המודל לצמצם את זמני הטעינה בכל עמודי אפליקציית ווב, והצליח ב-39 מתוך 40 ניסיונות, בעוד ש-Opus 5 הציג שיפורים קטנים יותר שגם שינו בטעות את ההתנהגות של האפליקציה.
בבדיקה אחרת שבה ביקשו מכמה דגמי Claude לבנות משחק מפרומפט בודד, Opus 5.5 קיבל את הציון הגבוה ביותר מבין כל הדגמים, הודות לאיכות הגרפיקה והליטוש של התוצאה הסופית. בתחום הביקורת והתיקון של קוד קיים, בודק אחר סקר וטיפל בקוד בהיקף 200,000 שורות תוך פחות משלוש שעות - לעומת יותר מ-20 שעות שלקח ל-Opus 5 לאותה משימה, תוך שימוש בפי 2.5 יותר טוקנים.
כמה זה עולה, וכמה חוסך הדגם החדש?
הנקודה הבולטת ביותר בהשקה היא היחס בין ביצועים למחיר. Opus 5.5 דורש פחות משאבי חישוב מ-Opus 5, וזה מתבטא ישירות בתמחור: טוקני קלט עולים 4 דולר למיליון (ירידה של 20%), טוקני פלט עולים 20 דולר למיליון (גם כן ירידה של 20%), וקריאות ממטמון (cache reads), שמהוות את רוב עלויות העבודה הסוכנתית וכתיבת הקוד, עולות רק 0.20 דולר למיליון טוקנים - ירידה של 60% לעומת הדגם הקודם. בנוסף, המודל מייצר פלט מהר ביותר מ-30% לעומת Opus 5.
יחד עם הוזלת המחירים, Anthropic מגדילה גם את מגבלות השימוש בחלונות של חמש שעות בתוכניות Pro, Max, Team ותוכנית Enterprise מבוססת מושבים, ומאפשרת למשתמשי המנוי לשמור איפוס של מגבלת קצב ולהשתמש בו מתי שירצו.
איך זה נראה מול המתחרים?
Anthropic מציגה נתוני השוואה מול Opus 5, Claude Fable 5.1, וגם מול דגמים מתחרים של OpenAI - GPT-6 Astra ו-GPT-5.6 Sol. להלן טבלת השוואה מרכזת של הציונים הבולטים שפרסמה החברה במגוון מבחני ביצועים:
| מבחן | Opus 5.5 | Opus 5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (קוד סוכנתי) | 66.4% | 52.3% | 55.8% | 57.9% |
| FrontierCode v1.1 | 54.4% | 48.0% | 50.3% | 53.3% |
| CursorBench 4.0 | 57.8% | 46.6% | 51.8% | - |
| GDPval-AA v2.1 (עבודת ידע, Elo) | 1846 | 1708 | 1735 | 1542 |
| OSWorld 2.1 (שימוש במחשב) | 81.8% | 74.0% | 80.7% | - |
| Humanity's Last Exam (עם כלים) | 67.7% | 63.6% | 65.6% | 57.2% |
מהנתונים עולה מגמה עקבית: Opus 5.5 לא רק מוביל בציונים, אלא עושה זאת תוך שימוש בפחות משאבים. לפי Anthropic, ברמת המאמץ הבררת מחדל (medium), המודל מנצח את GPT-6 Astra ברמת המאמץ המקסימלית שלו, בעלות של כחמישית בלבד למשימה. באותו אופן, ב-Terminal-Bench 4.0 הוא משיג תוצאה דומה ל-GPT-6 Astra תמורת כ-40% מהעלות, וב-CursorBench הוא עוקף את GPT-5.6 Sol בפער של 11 נקודות תמורת כשליש מהמחיר.
מה עם בטיחות - האם דגם חזק יותר לא מסוכן יותר?
זו בדיוק השאלה ש-Anthropic מתמודדת איתה בכל השקה. לדברי החברה, Opus 5.5 עבר את הביקורת ההתנהגותית האוטומטית המקיפה ביותר שהיא מריצה, ובה השיג את הציון הגבוה ביותר מבין כל הדגמים שנבדקו עד כה. המודל פחות נוטה לנקוט בפעולות קשות להיפוך או לפעול מחוץ לגבולות שהוגדרו לו, ועמיד יותר מ-Opus 5 מול הזרקת פקודות (prompt injection) - טכניקת תקיפה שבה מנסים "להערים" על מודל שפה לבצע פעולות לא מורשות דרך תוכן חיצוני.
מכיוון שרמת היכולות של Opus 5.5 בתחומי הביולוגיה ואבטחת הסייבר קרובה לזו של Claude Mythos 5.1, Anthropic מפעילה סביבו את אותם מנגנוני הגנה שמופעלים סביב Fable 5.1. ארגונים מאושרים יכולים כבר עכשיו לבקש גישה דרך תוכנית האימות למדעי החיים (Life Sciences Verification Program), ובשבועות הקרובים תורחב גם הגישה לתוכנית האימות לאבטחת סייבר עבור אנשי מקצוע מאומתים בתחום.
מה אומרות החברות שכבר ניסו את המודל?
מספר חברות קיבלו גישה מוקדמת ל-Opus 5.5 ופרסמו משוב. ב-GitHub דיווחו שבבדיקות דרך GitHub Copilot CLI ו-VS Code, המודל השתמש בפחות טוקנים וצעדים מכל דגם אחר שנבדק, ופתר משימות מסוף בפחות מחצי מהצעדים שנדרשו ל-Opus 5. בחברת Clio תיארו הרצה של משימת הנדסה גדולה על פני שישה מאגרי קוד במשך יותר מ-18 שעות ללא השגחה, עם פחות עבודה חוזרת מהצפוי.
בחברת Quantium דיווחו שמשימת קידוד מורכבת שדרשה בעבר 38 פרומפטים על פני ארבעה ימים, הושלמה עם Opus 5.5 ב-11 פרומפטים בלבד תוך שלוש שעות. בספוטיפיי ציינו שיפור ברור ביעילות הטוקנים, ובחברת המסחר Optiver דיווחו על צמצום עלויות של 40 עד 50 אחוז במשימות קוד סוכנתי, לצד הציון הגבוה ביותר שנרשם עד כה בסוויטת התמיכה למסחר שלהם.
מה הלאה?
Anthropic מבהירה ש-Opus 5.5 הוא רק הפתיחה של משפחת Claude 5.5. בקרוב יושקו גם Claude Sonnet 5.5 ו-Claude Haiku 5.5, שיביאו איתם שיפורים דומים בביצועים, ביעילות ובבטיחות, ויאפשרו למשתמשים ולארגונים לבחור את שילוב העלות-ביצועים המתאים להם. עבור מי שכבר עובד עם Claude, ובעיקר עבור צוותי פיתוח וארגונים שמריצים עבודה סוכנתית בהיקף גדול, השילוב של ירידה במחיר עם עלייה בביצועים הופך את Opus 5.5 לשדרוג משמעותי שכדאי לבחון כבר עכשיו.

