מה נשבר

רצינו לשמר רק את הקול - וקיבלנו שני קולות זה על זה

היה לנו טייק מוצלח של Joey ורצינו את הקול שלו לשורה חדשה. נתנו למודל את קובץ ה-MP4 של הטייק, וקיבלנו בחזרה גם את האודיו הישן וגם את הדיאלוג החדש.

היה לנו טייק של Joey שעבד. ההבעה ישבה, הקול ישב, והוא היה מאושר. רצינו לקחת את הקול הזה לשורה חדשה, אז נתנו אותו כרפרנס - את הטייק עצמו, קובץ MP4.

מה שחזר נראה טוב. ההבעה הייתה בסדר, הווידאו היה בסדר. הבעיה הייתה בפס הקול: האודיו המקורי מהרפרנס לא הוחלף בדיאלוג החדש, הוא התערבב איתו. בפועל נשמעו שתי שכבות קול בו זמנית.

הטייק לא היה שמיש. הוא עלה בערך 90 קרדיטים.

מה שהחמצנו

בראש שלנו רפרנס הייתה מילה אחת. נתנו למודל את הטייק כדי שיסתכל על הקול. אבל קובץ MP4 אינו שכבת קול, הוא וידאו ואודיו יחד. מה שנתנו הכיל את שניהם, ובפועל האודיו הישן נשאר חלק מהתוצאה.

מה אנחנו בודקים במקום

אם המטרה היא לשמר רק את הקול, הצעד הבא שלנו הוא להפריד אותו מהווידאו ולתת ל-H3 קובץ Audio נקי בלבד. זה מצמצם את הרפרנס בדיוק למידע שאנחנו רוצים לשמר.

עדיין לא בדקנו מספיק כדי לטעון שזה תמיד פותר את הבעיה, וגם לא כדי לטעון שכל רפרנס וידאו מתנהג ככה. מה שאנחנו כן יודעים הוא שה-MP4 שנתנו במקרה הזה הכניס לתהליך גם אודיו שלא רצינו.