Qwen Image 2.0
טקסט→תמונהחזק ב
- מתמונה אחת וסאונד יוצר וידאו שבו האדם מדבר או שר — בלי וידאו מצולם
- לא מזיז רק את השפתיים: קורא את הרגש בסאונד ומשחק עם כל הגוף — דיבור נסער נותן מחוות אחרות מטון שקט וּוידויי
- מתחת עובדים שני מוחות: האחד מפענח את משמעות הסאונד ומתכנן את המחווה, השני מצייר אותה פריים אחר פריים
- השירה נלקחה בחשבון — הפסקות, שינוי מצב רוח ותנועה בימתית
- סובל כמה דמויות בפריים
- מקבל גם טקסט קצר מלבד הסאונד — איתו קובעים תנועת מצלמה, מחווה או מצב רוח
חלש ב
- האורך תלוי באיכות: עד 30 שניות סאונד ב-1080p ועד 60 שניות ב-720p
- הוא הכי טוב מתחת ל-15 שניות — מעבר לזה התוצאה מתחילה להתפרק
- הסצנה סטטית: הרקע לא משתנה, המצלמה עומדת, האדם נשאר פחות או יותר במקומו
- התוצאה תלויה לגמרי בתמונה — מתמונה גרועה יוצא וידאו גרוע
- דיבור מהיר וקטוע נותן לו פחות זמן להתמקם במחווה
אל תשתמש בו עבור
- אל תעלה תמונה מהצד, עם פנים מוסתרות או עם משקפיים שמסתירים את העיניים
- אל תיתן לו הקלטה ארוכה בבת אחת — חתוך אותה לחלקים של פחות מ-15 שניות
- אל תשתמש בו כשכבר יש לך וידאו מצולם — שם סנכרון השפתיים מדויק יותר
משימות אופייניות
- אווטאר מדבר מתמונה אחת
- פורטרט ששר
- נאום לפי טקסט וקול שסיפקת
- פורטרט ארכיוני או משפחתי שקם לחיים
- מנחה לסרטון קצר, בלי יום צילום