הטמעת Prompt CachingPrompt Caching Implementation
הגדרה מהירה
מה זה Prompt Caching Implementation? (TL;DR)
Prompt Caching ב-Anthropic/Gemini מוריד את עלות החלק הקבוע של הפרומפט: באנתרופיק קריאה מה-cache עולה 0.1 ממחיר ה-input. יש אורך מינימלי שתלוי במודל. cache_control: ephemeral ב-API.
cache_control: { type: "ephemeral" } על system prompts ארוכים. ב-Gemini זה אוטומטי לכל קריאה מעל threshold. מתי משתלם: system prompts מעל 1024 tokens שחוזרים על עצמם (chatbots, RAG עם same context). חיסכון: באנתרופיק קריאה מה-cache עולה 0.1 ממחיר ה-input, וכתיבה ל-cache של 5 דקות עולה פי 1.25 - כך שקריאה חוזרת אחת כבר מחזירה את התוספת. גם ב-Gemini יש הנחה על tokens שנקראים מה-cache; השיעור מופיע בדף התמחור לפי מודל.ציטוט
השתמשתם בדף הזה? תנו קרדיט.
עתונאים, חוקרים וצוותי AI - בחרו פורמט להעתקה. ה-citation האקדמי שלנו בקליק.
מונחים קשורים
שימור פרומפטים (Prompt Caching)
מנגנון של Anthropic לשימור הוראות מערכת ארוכות וקבועות, וקריאה מה-cache עולה עשירית ממחיר ה-input הרגיל.
הגנה מפני הזרקת פרומפטים (Prompt Injection)
הזרקת פרומפטים היא התקפה שבה משתמש מטמיע הוראות זדוניות בטקסט כדי לגרום לסוכן AI להתעלם מהכללים שלו. ההגנה מבודדת קלט משתמש מהוראות המערכת.
שימור קונטקסט (Caching)
טכנולוגיית Gemini המאפשרת להקפיא זיכרון של מיליוני טוקנים כדי לחסוך בעלויות ולהזניק את המהירות.
התקפת Prompt Injection
מתקפת אבטחה שבה משתמש זדוני מזריק הוראות ל-LLM כדי לעקוף הוראות מערכת ולגנוב נתונים.
CDN ו-Edge Caching
הקטנת latency ועלויות compute ע"י caching של static assets ו-API responses ב-edge locations.
חוב טכנולוגי (Tech Debt)
העלות העתידית שנוצרת מפתרון מהיר, המייצר "כדורי בוץ" בקוד (Big Ball of Mud) ומונע הוספת פיצ'רים.
מדברים בוואטסאפ, לא בטפסים
תארו בשתי שורות מה שבור או מה החלום. ההודעה נפתחת אצלכם מוכנה. אתם רק לוחצים שלח.
מעדיפים להתקשר? 054-211-8143