→ כל המאמרים

אודיו/וידאו ← טקסט וכתוביות בחינם: תמלול בדפדפן

סטודיו מואר: מחשב נייד עם חלון תמלול פתוח, לצד גל אודיו וקווים מסודרים של כתוביות, דגשים בהירים רכים

כעת תוכל לתמלל אודיו או וידאו לטקסט בחינם ישירות בדפדפן שלך: בקטע "וִידֵאוֹ" הופיע כלי "אודיו/וידאו ← טקסט + כתוביות (חינם)". הוא מזהה דיבור, מציג אותו בטקסט עם חותמות זמן, ומספק כתוביות מוכנות - ולא מוחק אסימונים.

קטע וידאו: הכלי אודיו/וידאו לטקסט + כתוביות (חינם) עם סרטון נטען, הטקסט המזוהה עם חותמות זמן וכפתורי הורדת הכתוביות

למה זה בחינם

בדרך כלל הפענוח מתבצע בשרת של שירות בתשלום: הקובץ מוורד, הדקות נספרות ומשלמים עבור כל דקה. כאן מודל זיהוי הדיבור נטען לתוך הדפדפן ופועל במחשב שלך. השרת נותן רק את הקוד של הכלי ואת משקל הדגם: אין לו מה לספור, אז אסימונים לא נמחקים, ומספר הפענוחים אינו מוגבל.

מכאן הפרטיות: ההקלטה לא עוזבת את המחשב שלך. זה חשוב אם אתה מתמלל ראיונות, שיחות עבודה, הרצאות או הערות אישיות.

כיצד לתמלל אודיו או וידאו: צעד אחר צעד

  1. לִפְתוֹחַ קטע "וידאו". ובחר מרשימת הדגמים "אודיו/וידאו ← טקסט + כתוביות (חינם)" - הכלי ממוקם בתחתית, ליד כלים חינמיים אחרים.
  2. העלה קובץ: לחץ על שדה הבחירה או גרור ושחרר אודיו או וידאו ישירות לתוכו.
  3. בחר את שפת הדיבור שלך - או השאר אותה ב"זיהוי אוטומטי". כברירת מחדל, שפת ממשק האתר מוגדרת, אך תמיד ניתן לשנות אותה באופן ידני.
  4. לחץ על "זיהוי דיבור" והמתן עד שהוא יהיה מוכן. ההשקה הראשונה אורכת זמן רב יותר: הדפדפן מוריד את הדגם פעם אחת ושומר אותו במטמון.
  5. בדוק את הטקסט, השבת חותמות זמן במידת הצורך, והעתק את התוצאה.
  6. הורד כתוביות בפורמט הרצוי - TXT, SRT, VTT או JSON. עבור סרטון, אתה יכול להרכיב מיד סרטון עם כתוביות צרובות.

אילו קבצים מתאימים?

אודיו: MP3, WAV, M4A, AAC, OGG, OPUS, FLAC ופורמטים נפוצים אחרים. סרטונים: MP4, MOV, M4V, MKV, AVI, OGV, WebM. הסאונד מהסרטון נחלץ ישירות בדפדפן; אין צורך להמיר את הקובץ בנפרד.

מה תקבל

  • טקסט דיבור - תמלול עם חותמות זמן, שניתן להשבית ולקבל טקסט ברור.
  • לְהַעְתִיק - כל הטקסט המוכר עם כפתור אחד ללוח.
  • TXT - טקסט פשוט להערות ומסמכים.
  • SRT - כתוביות עבור רוב הנגנים ועורכי הווידאו.
  • VTT - כתוביות לנגני אינטרנט ו-HTML.
  • JSON - קטעים מסומנים עם תזמונים לתסריטים שלהם.

סרטון עם כתוביות צרובות

אם אתה מעלה סרטון, הכלי יכול לצרוב כתוביות ישירות לתוך הפריימים: סרטון כזה מתנגן בכל מקום, גם במקום שבו אין תמיכה בכתוביות. הצליל של המקור נשמר. הצריבה מתבצעת במכשיר שלך, הקובץ לא נשלח לשום מקום.

הכל נחשב במכשיר שלך

הדיבור מזהה את הדגם Whisper עד Transformers.js: תחילה הוא מנסה WebGPU (כרטיס מסך), ואם אין מתאם, הוא עובר בכנות ל- WASM וסומך על המעבד. אין כאן API בתשלום, אסימונים לא נמחקים, וההקלטה לא עוברת לשרת. עיבוד רשומות ארוכות לוקח יותר זמן - הכל מחושב במחשב שלך.

מה הכלי לא עושה

בכנות לגבי הגבולות: זה זיהוי דיבור, לא תרגום. הכלי אינו מתרגם טקסט לשפה אחרת או עושה דיבוב. האיכות תלויה בהקלטה: עם דיבור ברור ללא הרבה רעש ומוזיקה, התוצאה טובה יותר באופן ניכר. סרטונים עם כתוביות צרובות דורשים דפדפן מודרני - שלב זה דורש Chrome או Edge.

מי ימצא את זה שימושי?

הכלי שימושי לכל מי שעובד עם הקלטות: עיתונאים ופודקאסטים - תמלול ראיונות, סטודנטים - הערות הרצאות, עורכים - כתוביות לסרטונים וכן לאלו שמנהלים פרוטוקולים של פגישות. אם אתה צריך עוד משהו בתיאום מראש, במדור "וִידֵאוֹ" יֵשׁ הסרת רקע, יוקרתי ו מפת עומק - הם גם מחשבים ישירות בדפדפן.

שאלות נפוצות

זה באמת בחינם? כֵּן. אסימונים עבור כלי זה אינם מחויבים, אין לו API בתשלום - המחשב שלך מחשב זאת.

האם הקובץ עובר לשרת? לא. ההקלטה והתוצאה נשארות במכשיר שלך; רק קוד הכלי ומשקולות הדגם מגיעים מהשרת.

כמה שפות נתמכות? Whisper מזהה 99 שפות. אתה יכול לבחור את השפה באופן ידני או לסמוך על זיהוי אוטומטי.

האם אפשר לקבל כתוביות כקובץ? כֵּן. TXT, SRT, VTT ו-JSON מורידים באמצעות לחצנים נפרדים.

האם הכלי מתרגם דיבור? לא. הוא מזהה דיבור בשפה שנבחרה, אך אינו מתרגם אותו לשפה אחרת.

מדוע ההשקה הראשונה נמשכת זמן רב יותר? הדפדפן מוריד את מודל הזיהוי פעם אחת ושומר אותו במטמון - ההשקות הבאות מתחילות מיד.