→ חזרה לכל הדוחות

וידאו AI באמצע 2026 — מה סטודיו קטן באמת צריך להריץ

2026-07-26 · AI video generation

שורה תחתונה

ארבעה מהלכים, לפי סדר: (1) עבור ישירות ל-Google API עבור Veo — גוגל גובה $0.10 לשנייה על Veo 3.1 Fast ב-720p ([מחירון Gemini API](https://ai.google.dev/gemini-api/docs/pricing)), בעוד WaveSpeed גובה $0.15 לשנייה על אותו מודל ([מחירון WaveSpeed](https://wavespeed.ai/pricing)) — מרקאפ של 50% שאתה משלם על לא כלום. (2) הבעיה הכי כואבת שלך — קליפ של 10+ שניות עם דמות עקבית — נפתרה לפני עשרה ימים, ולא אצל גוגל: Seedance 2.5 של ByteDance עלה ל-API ב-16 ביולי 2026 עם 30 שניות ברצף יחיד ועד 50 חומרי רפרנס ([TechTimes, סקנדרי](https://www.techtimes.com/articles/320683/20260716/seedance-25-api-live-bytedances-30-second-ai-video-carries-unresolved-copyright-risk.htm)); Veo 3.1 עדיין תקוע על 8 שניות מקסימום לגנרציה ([תיעוד Veo](https://ai.google.dev/gemini-api/docs/veo)) — כלומר לפי כלל ה־≥10 שניות שלך, Veo נכשל מבנית בלי extend. (3) Sora מת — OpenAI מסירה את ה-Videos API ואת sora-2 ב-24.9.2026 ולא הכריזה על מחליף ([עמוד ה-deprecations הרשמי](https://developers.openai.com/api/docs/deprecations)). אל תבנה עליו כלום. (4) Replicate היא החוליה החלשה שלך לווידאו — fal הוא המקום שהמודלים החדשים נוחתים בו ראשונים.

---

מה כבר ידענו

כלום. זה הדוח הראשון במאגר בנושא הזה — לא היה שום ידע קודם מתועד על שדה מודלי הווידאו, על תמחור, או על אגרגטורים. כל מה שכתוב כאן נבדק מאפס בסבב הזה, ורוב המספרים נלקחו ישירות מדפי תמחור ותיעוד של הספקים עצמם ולא מסיכומי בלוגים.

הערה מתודית אחת שכן שווה לרשום: בסבב הזה שלושה בלוגי-סיכום שקראתי טעו במספרים שגוגל מפרסמת בעצמה (למשל "$0.15 לשנייה ל-Veo 3.1 Fast" במקום $0.10), ובלוג נוסף טען ש-Wan 2.7 שוחרר ברישיון Apache 2.0 — טענה שלא שרדה בדיקה מול המקור. אל תסמוך על roundups בתחום הזה.

---

מה חדש

א. מי באמת מוביל — לפי הצבעות עיוורות, לא לפי הצהרות

זירת Artificial Analysis (Elo מהצבעות עיוורות של משתמשים) נכון לבדיקה היום:

Image-to-Video עם אודיו ([מקור](https://artificialanalysis.ai/video/leaderboard/image-to-video)):

1. Gemini Omni Flash (Google) — 1,200

2. Dreamina Seedance 2.0 720p (ByteDance) — 1,198

3. grok-imagine-video-1.5-preview (xAI) — 1,118

4. HappyHorse-1.1 (Alibaba-ATH) — 1,110

5. Wan 2.7 (Alibaba) — 1,099

Text-to-Video עם אודיו ([מקור](https://artificialanalysis.ai/video/leaderboard/text-to-video)):

1. Gemini Omni Flash — 1,246 · 2. Seedance 2.0 720p — 1,228 · 3. Wan2.7-260612 — 1,164 · 4. HappyHorse-1.1 — 1,153 · 6. Kling 3.0 1080p Pro — 1,113 · Veo 3.1 — 1,096 (מקום 9-14).

שתי מסקנות לא נוחות: Veo 3.1 כבר לא בפסגה — הוא באמצע העשירייה. ו-Runway Gen-4.5, שהוביל בסוף 2025, נשר לגמרי מהטופ (לא הצלחתי לאמת את הדירוג המדויק שלו היום — unconfirmed).

ב. מה קרה ב-60 הימים האחרונים (מאז ~20.5.2026)

| מתי | מה | מקור |

|---|---|---|

| 17.6.2026 | Kling 3.0 Turbo + Omni — ¥0.8/שנייה ב-720p, ¥1/שנייה ב-1080p (≈$0.11/$0.14), אודיו כלול, ליפסינק ב-5 שפות: אנגלית, מנדרינית, יפנית, קוריאנית, ספרדית | [Atlas Cloud (סקנדרי)](https://www.atlascloud.ai/blog/guides/kling-3.0-turbo-kling-omni) |

| 18.6.2026 | Grok Imagine Video 1.5 (xAI) יצא ל-API | [x.ai/news](https://x.ai/news/grok-imagine-video-1-5) |

| 22-23.6.2026 | HappyHorse 1.1 (Alibaba ATH) — שיפור עקביות סובייקט ואודיו | [TechNode](https://technode.com/2026/06/23/alibaba-unveils-happyhorse-1-1-video-generation-model-launches-global-ai-filmmaking-competition/) |

| 30.6.2026 | Gemini Omni Flash נכנס ל-API בפריוויו — $0.10/שנייה בפועל (5,792 טוקנים לשנייה של 720p, $17.50 למיליון טוקני וידאו), 720p בלבד, ללא הנחת Batch | [מחירון Gemini API (פריימרי)](https://ai.google.dev/gemini-api/docs/pricing) |

| 30.6.2026 | Veo 3 ו-Veo 2 נסגרו רשמית | [מחירון Gemini API (פריימרי)](https://ai.google.dev/gemini-api/docs/pricing) |

| ~13.7.2026 | Wan-Dancer-14B — מודל music-to-dance במשקולות פתוחות (הקיום מאומת ב-HuggingFace; התאריך unconfirmed) | [Wan-AI ב-HuggingFace](https://huggingface.co/Wan-AI) |

| 16.7.2026 | Seedance 2.5 ל-API ב-BytePlus — 30 שניות ברצף יחיד, עד 50 רפרנסים, 4K, אודיו נייטיב | [TechTimes (סקנדרי)](https://www.techtimes.com/articles/320683/20260716/seedance-25-api-live-bytedances-30-second-ai-video-carries-unresolved-copyright-risk.htm) |

**מה *לא* קרה:** לא נמצאה שום הכרזת הפחתת מחיר ממשית בחלון הזה. הנרטיב של "מלחמת מחירים" שמסתובב בבלוגים — unconfirmed.

ג. מפרטים ומחירים — המספרים האמיתיים

Veo 3.1 (Google, ישירות) — [תיעוד](https://ai.google.dev/gemini-api/docs/veo) + [מחירון](https://ai.google.dev/gemini-api/docs/pricing):

Seedance 2.0 — יצא 15.4.2026 ([OpenRouter](https://openrouter.ai/bytedance/seedance-2.0)). תומך t2v, i2v עם first+last frame, ו-reference-to-video. ב-fal: גרסת Fast ב-i2v עולה $0.2419 לשנייה ב-720p, אורך 4–15 שניות, 480p/720p, אודיו מסונכרן דלוק כברירת מחדל ([דף המודל ב-fal](https://fal.ai/models/bytedance/seedance-2.0/fast/image-to-video)). ב-WaveSpeed אותו מודל מתחיל ב-$0.50 לריצה ב-480p ומטפס עד $15 ל-4K/15 שניות, עם זמן ריצה חציוני מדוד של ~139 שניות לבקשה ([דף המודל ב-WaveSpeed](https://wavespeed.ai/models/bytedance/seedance-2.0-fast/image-to-video)).

Kling — Kling O1 reference-to-video ב-fal: $0.112 לשנייה, 5 או 10 שניות, עד 7 קלטי רפרנס במקביל ([דף המודל](https://fal.ai/models/fal-ai/kling-video/o1/reference-to-video)). ב-WaveSpeed: Kling 3.0 Std ב-$0.084 לשנייה ([מחירון](https://wavespeed.ai/pricing)).

Runway Gen-4.5 — ~$0.12 לשנייה ($0.60 לקליפ של 5 שניות), API מאז 10.2.2026. כל זה מבלוגים סקנדריים — unconfirmed, לא הצלחתי לשלוף את דף התמחור הרשמי.

ד. משקולות פתוחות — התמונה השתנתה לרעה

ה. עקביות דמות — נקודת הכאב שלך

מה עובד היום, לפי סדר יורד של תמיכה נייטיבית:

1. Seedance 2.5 — עד 50 רפרנסים ו-30 שניות ברצף אחד. זה מבנית הכי טוב שיש כרגע לבעיה שלך, כי דמות לא נסחפת בתוך קליפ אחד — הסחיפה קורית בין קליפים. פחות תפרים = פחות סחיפה. (סקנדרי, unconfirmed לגבי איכות בפועל.)

2. Kling O1 reference-to-video — עד 7 קלטים, כולל דמות עם זווית פרונטלית + זוויות רפרנס נוספות, רפרנס סגנון, ופריים פתיחה ([fal](https://fal.ai/models/fal-ai/kling-video/o1/reference-to-video)). מאומת ומתומחר.

3. Veo 3.1 "Ingredients to Video" — עד 3 רפרנסים (דמות, אביזר, סגנון/מיקום). גוגל עצמה מנסחת את זה כ"משפר משמעותית עקביות זהות" ([הבלוג של גוגל](https://blog.google/innovation-and-ai/technology/ai/veo-3-1-ingredients-to-video/)).

4. Runway Gen-4 References — עד 3 רפרנסים, עם תיוג @ להפרדה בין דמויות/אובייקטים/סגנון ([מרכז העזרה של Runway](https://help.runwayml.com/hc/en-us/articles/40042718905875-Creating-with-Gen-4-Image-References)).

5. Vidu multi-reference — עד 7 רפרנסים, אבל reference-to-video חסום ל-4 שניות לגנרציה ([הבלוג של Vidu](https://www.vidu.com/blog/create-ai-animation-3-characters-1-scene-vidu-multi-reference)) — כלומר לא רלוונטי לכלל ה-≥10 שניות שלך.

6. MiniMax Hailuo S2V — דמות עקבית מתמונת רפרנס אחת, אבל מיניאמקס עצמה מזהירה שהמודל "עוקב אחרי הפרומפט פחות במדויק" ועלול לגרום ל"מורפינג סביבתי" ([הודעת MiniMax](https://www.minimax.io/news/s2v-01-release)). Hailuo גם לא מופיע בטופ-20 של הזירה.

LoRA לדמות — כדאי או לא? זול מספיק כדי לנסות:

מה שהתחזק ב-2026 כפרקטיקה: צנרת image-first — נועלים את ה"DNA הוויזואלי" של הדמות בסטיל ברזולוציה גבוהה (Nano Banana / Seedream / Flux Kontext / GPT-image), ורק אז מריצים i2v. בנוסף, שרשור frame אחרון → frame ראשון בין שוטים. שתי הטכניקות מתועדות בבלוגים של ספקים ולא במפרט רשמי — סווג אותן כפרקטיקה מקובלת, unconfirmed כמדד.

היושר הכואב: אף ספק — לא גוגל, לא Kling, לא Runway, לא Alibaba — לא מפרסם מדד כמותי לשימור זהות. כל המספרים שמסתובבים ברשת מסוג "97% עקביות פנים" מגיעים מבלוגים צד-שלישי ולא מדפי הספק ([דוגמה: הדף הרשמי של FLUX.1 Kontext](https://bfl.ai/models/flux-kontext) — טוען לשימור זהות אבל בלי מספרים). מתרגל עצמאי שתיעד בדיקה מסודרת של Veo 3 דיווח שהעקביות נשברה בפועל — שתי דמויות עם פרומפטים תואמים יצאו בסגנונות תאורה שונים ([Winterspeak](https://winterspeak.substack.com/p/veo-3-does-not-solve-the-character)). כלומר: תיאורטית פתור, מעשית לא.

ו. אגרגטורים — הסטאק שלך מול האלטרנטיבות

| | כיסוי מודלים חדשים | תמחור | מה למדתי |

|---|---|---|---|

| Google ישיר | Veo 3.1 + Omni Flash בלבד | $0.05–$0.60/ש' | הכי זול לווידאו של גוגל. Veo 3.1 Fast ב-$0.10 מול $0.15 ב-WaveSpeed |

| fal | הכי עמוק — Seedance 2.0, Kling v3, HappyHorse 1.1, PixVerse V6, LTX 2.3, Grok Imagine, Gemini Omni Flash ([גלריית המודלים](https://fal.ai/models?categories=text-to-video)) | לפי מודל; Wan 2.5 $0.05/ש', Kling 2.5 Turbo Pro $0.07/ש' ([מחירון](https://fal.ai/pricing)) | המודלים החדשים נוחתים כאן ראשונים. יש גם מאמני LoRA |

| WaveSpeed | 600+ מודלים (לפי הצהרתה שלה) | הכי זול על הנייר: Seedance 2.0 Fast $0.10/ש', Wan 2.2 Ultra Fast $0.01/ש', Kling 3.0 Std $0.084/ש' ([מחירון](https://wavespeed.ai/pricing)) | אבל מרקאפ של 50% על Veo, ודף המודל מראה תמחור-לריצה שונה מהמחירון הכללי |

| Replicate | דל בווידאו — דף התמחור מציג בעיקר Wan 2.1 i2v ($0.09/ש' ב-480p, $0.25/ש' ב-720p) ([מחירון](https://replicate.com/pricing)) | חלק מהמודלים לפי שניות GPU ולא לפי פלט — סיכון עלות | החוליה החלשה שלך לווידאו |

אזהרה חשובה: ההשוואה בין $0.10 לשנייה ב-WaveSpeed ל-$0.2419 לשנייה ב-fal על אותו Seedance 2.0 Fast אינה תפוח מול תפוח — דף המודל של WaveSpeed מתמחר $0.50 לריצה בבסיס 480p, כלומר המחיר של $0.10/ש' הוא כנראה 480p, בעוד ה-$0.2419 של fal הוא 720p. אל תעביר תקציב על סמך הטבלה הזו לפני בדיקה אמיתית של אותה רזולוציה בשני הצדדים.

ז. מהירות — למה 6 דקות אצלך זה לא בהכרח באג

המספרים המדודים היחידים שמצאתי:

כלומר: מונטאז' של 3 שוטים ב-Seedance, סדרתי, הוא כ-7 דקות של זמן מכונה בלבד. הרצפה של 68 שניות שהנחת תקפה רק אם השוטים רצים במקביל. זה ההבדל היחיד שמשנה — לא בחירת המודל.

ח. עברית ו-RTL

כאן אין חדשות טובות. הליפסינק של Kling 3.0 Turbo מכסה חמש שפות — אנגלית, מנדרינית, יפנית, קוריאנית, ספרדית — ללא עברית ([Atlas Cloud, סקנדרי](https://www.atlascloud.ai/blog/guides/kling-3.0-turbo-kling-omni)). לא מצאתי שום מודל וידאו שמצהיר על רינדור טקסט עברי על המסך. המסקנה המעשית: טקסט עברי נשרף בפוסט, לא נוצר במודל. דיבוב עברי — דרך TTS חיצוני + מודל ליפסינק ייעודי, לא נייטיב.

---

המלצה מעשית

1. פצל את הספקים לפי תפקיד, לא לפי נוחות:

2. לכלל ה-≥10 שניות שלך — Veo הוא הבחירה הלא נכונה. 8 שניות מקסימום זה מחסום מבני. או Seedance 2.0 (4–15 שניות ברצף), או Kling O1 (10 שניות), או — אם זה מחזיק את מה שהוא מבטיח — Seedance 2.5 עם 30 שניות.

3. לעקביות דמות, בסדר הזה: קודם נעל זהות בסטיל (image-first), אחר כך reference-to-video עם כמה שיותר רפרנסים (Kling O1 עם 7, Seedance 2.5 עם 50), ורק אם זו דמות חוזרת לאורך פרויקטים — אמן LoRA על Wan 2.2 ב-fal בכ-$4. LoRA היא השקעה שמשתלמת רק בחזרתיות; לקמפיין חד-פעמי היא בזבוז זמן.

4. חשבון עלות אמיתי לשוט של 10 שניות:

למונטאז' של 6 שוטים באורך 10 שניות: בין $6 ל-$15 לגרסה. זה זול מספיק כדי להריץ שלוש גרסאות ולבחור — וזה כנראה הדבר הנכון לעשות, בהינתן שאף ספק לא מבטיח עקביות.

5. הרץ הכל במקביל. זה, ולא המודל, ההבדל בין 7 דקות ל-2.5 דקות.

6. אל תיגע ב-Sora. ה-API נסגר ב-24.9.2026.

---

מה לא הצלחתי לאמת

עובדות שנשמרו

Veo 3.1 supports only 4, 6, or 8 second clip durations per generation — 8s is the maximum single generation length
https://ai.google.dev/gemini-api/docs/veo
Veo 3.1 Fast costs $0.10 per second at 720p and $0.12 per second at 1080p on the Gemini API direct
https://ai.google.dev/gemini-api/docs/pricing
Veo 3.1 Lite is the cheapest Google video tier at $0.05 per second at 720p, but does not support video extension
https://ai.google.dev/gemini-api/docs/pricing
WaveSpeed charges $0.15 per second for Veo 3.1 Fast, a 50% markup over Google's direct $0.10/second 720p rate
https://wavespeed.ai/pricing
Google states Veo 3.1 generation latency ranges from 11 seconds minimum to 6 minutes maximum during peak hours
https://ai.google.dev/gemini-api/docs/veo
Veo 3.1 accepts up to 3 reference images (Ingredients to Video) and supports first-and-last-frame conditioning plus extension of +7 seconds up to 20 times
https://ai.google.dev/gemini-api/docs/veo
OpenAI announced on 2026-03-24 that sora-2, sora-2-pro and the Videos API will be removed from the API on 2026-09-24, with no recommended replacement listed
https://developers.openai.com/api/docs/deprecations
Gemini Omni Flash ranks #1 on the Artificial Analysis blind-vote arena for both text-to-video (Elo 1246) and image-to-video (Elo 1200) with audio
https://artificialanalysis.ai/video/leaderboard/text-to-video
Veo 3.1 ranks only 9th-14th on the Artificial Analysis text-to-video arena at Elo 1096, below Seedance 2.0, Wan 2.7, HappyHorse 1.1 and Kling 3.0 Pro
https://artificialanalysis.ai/video/leaderboard/text-to-video
Gemini Omni Flash is billed at 5,792 tokens per second of 720p output at $17.50 per million video output tokens, an effective ~$0.10 per second, and outputs 720p only
https://ai.google.dev/gemini-api/docs/pricing
Seedance 2.0 Fast image-to-video on fal costs $0.2419 per second at 720p and supports 4-15 second durations with synchronized audio on by default
https://fal.ai/models/bytedance/seedance-2.0/fast/image-to-video
WaveSpeed publishes a measured median end-to-end generation time of approximately 139 seconds per request for Seedance 2.0 Fast image-to-video
https://wavespeed.ai/models/bytedance/seedance-2.0-fast/image-to-video
Kling O1 reference-to-video costs $0.112 per second, offers fixed 5s or 10s durations, and accepts up to 7 simultaneous reference inputs including per-character frontal plus additional angles
https://fal.ai/models/fal-ai/kling-video/o1/reference-to-video
Alibaba's open Wan weights stop at Wan 2.2 under Apache 2.0; Wan 2.5, 2.6 and 2.7 are closed API-only releases despite widespread blog claims otherwise
https://github.com/Wan-Video/Wan2.2
LTX-2.3 weights are downloadable on HuggingFace but under the 'ltx-2-community-license-agreement', not Apache 2.0 as several roundup blogs claim
https://huggingface.co/Lightricks/LTX-2.3
Training a character LoRA on Wan 2.2 via fal costs $0.004 per step for text-to-video (about $4 for 1000 steps) and $0.005 per step for image-to-video
https://fal.ai/models/fal-ai/wan-22-trainer/t2v-a14b
fal's own documentation states the LTX-2 video trainer is built for style and motion transfer and that character-identity training would face substantial challenges
https://fal.ai/learn/devs/ltx-2-video-trainer-user-guide
No major video model vendor (Google, Kuaishou/Kling, Runway, Alibaba, Black Forest Labs) publishes a quantitative identity-retention metric for character consistency; all circulating percentage figures come from third-party blogs
https://bfl.ai/models/flux-kontext
Veo 3 and Veo 2 were shut down on 2026-06-30 and are no longer available on the Gemini API
https://ai.google.dev/gemini-api/docs/pricing
Kling 3.0 Turbo launched 2026-06-17 at approximately $0.11/second (720p) and $0.14/second (1080p) with bundled audio and native lip-sync in English, Mandarin, Japanese, Korean and Spanish only — Hebrew is not supportedלא אומת
https://www.atlascloud.ai/blog/guides/kling-3.0-turbo-kling-omni
ByteDance opened public API access to Seedance 2.5 on BytePlus on 2026-07-16, claiming native single-pass 30-second clips, up to 50 multimodal references and 4K output; pricing has not been published on any primary sourceלא אומת
https://www.techtimes.com/articles/320683/20260716/seedance-25-api-live-bytedances-30-second-ai-video-carries-unresolved-copyright-risk.htm
Runway Gen-4.5 API pricing is approximately $0.12 per second ($0.60 per 5-second clip); this could not be confirmed against Runway's own developer pricing docsלא אומת
https://docs.dev.runwayml.com/guides/pricing/

מקורות