← सभी लेख

एआई टेक्स्ट टू स्पीच फ्री: अपने ब्राउज़र में न्यूरल नेटवर्क के साथ अपने टेक्स्ट को आवाज दें

उज्ज्वल स्टूडियो: एक माइक्रोफोन और ज्वलंत ध्वनि तरंगें - सीधे ब्राउज़र में तंत्रिका पाठ से वाक् तक

अब आप अपने टेक्स्ट को न्यूरल नेटवर्क के साथ मुफ्त में आवाज दे सकते हैं, बिना कुछ इंस्टॉल किए: टेक्स्ट टू स्पीच (निःशुल्क) मॉडल आ गया है वीडियो अनुभाग। यह सीधे आपके ब्राउज़र में चलता है - टेक्स्ट टाइप करें, एक भाषा और एक आवाज़ चुनें, और कुछ सेकंड बाद आप तैयार ऑडियो फ़ाइल को सुनें और डाउनलोड करें। न तो पाठ और न ही ध्वनि रिकॉर्डिंग कहीं भी अपलोड की जाती है: सब कुछ आपके अपने डिवाइस पर गणना की जाती है।

वीडियो अनुभाग: टेक्स्ट, भाषा और ध्वनि फ़ील्ड के साथ सूची के नीचे चयनित टेक्स्ट टू स्पीच (मुक्त) मॉडल

यह मुफ़्त क्यों है?

नियमित भाषण सेवाएँ अपने स्वयं के सर्वर पर ऑडियो का संश्लेषण करती हैं और इसके लिए पैसे या टोकन लेती हैं। यहां मॉडल ब्राउज़र में लोड किया गया है और आपके कंप्यूटर के ग्राफिक्स कार्ड (WebGPU, प्रोसेसर के साथ फ़ॉलबैक के रूप में) का उपयोग करता है। सर्वर केवल टूल के कोड और मॉडल वेट की सेवा करता है - इसमें गणना करने के लिए कुछ भी नहीं है, इसलिए कोई टोकन चार्ज नहीं किया जाता है और पीढ़ियों की संख्या असीमित है।

गोपनीयता भी निःशुल्क मिलती है: आपके द्वारा आवाज दिया गया पाठ और आपकी आवाज रिकॉर्डिंग आपके डिवाइस पर रहती है। यह तब मायने रखता है जब आप संदेश, दस्तावेज़ या व्यक्तिगत नोट्स व्यक्त कर रहे हों।

न्यूरल नेटवर्क के साथ टेक्स्ट को आवाज कैसे दें: चरण दर चरण

  1. खोलें वीडियो अनुभाग और चुनें टेक्स्ट टू स्पीच (निःशुल्क) मॉडल सूची में - यह अन्य मुफ़्त टूल के बगल में सबसे नीचे बैठता है।
  2. अपने टेक्स्ट को "टेक्स्ट टू वॉइस" फ़ील्ड में पेस्ट करें - एक समय में अधिकतम 2000 अक्षर।
  3. भाषा चुनें. यदि आप निश्चित नहीं हैं, तो "स्वचालित रूप से पता लगाएं" छोड़ दें।
  4. एक आवाज चुनें: महिला या पुरुष, ऊंची या निचली, फुसफुसाहट - या आपकी सहेजी गई आवाजों में से एक।
  5. "भाषण उत्पन्न करें" दबाएँ और इसके समाप्त होने तक प्रतीक्षा करें। आप परिणाम को पृष्ठ पर चला सकते हैं और इसे WAV फ़ाइल के रूप में डाउनलोड कर सकते हैं।

600+ भाषाएँ

मॉडल बहुभाषी है: यह 600 से अधिक भाषाएँ जानता है। मिश्रित पाठ के लिए आप स्वचालित भाषा पहचान को चालू रख सकते हैं, या अपनी ज़रूरत की भाषा चुन सकते हैं - सूची में अंग्रेजी, जर्मन, फ्रेंच, स्पेनिश, चीनी, जापानी, अरबी और दर्जनों अन्य भाषाएं शामिल हैं, जो कई देशों के लिए वीडियो को आवाज देने के लिए उपयोगी हैं।

आवाज का क्लोन कैसे बनाएं

आप किसी आवाज़ को दो तरीकों से क्लोन कर सकते हैं - दोनों मुफ़्त हैं और दोनों की गणना आपके डिवाइस पर की जाती है:

  • एक ऑडियो फ़ाइल अपलोड करें. MP3, WAV, M4A, OGG या WebM 30 सेकंड तक अच्छा काम करता है।
  • अपने माइक्रोफ़ोन से रिकॉर्ड करें. संगीत या शोर के बिना 10-20 सेकंड का स्वच्छ भाषण पर्याप्त है।

विश्लेषण के बाद टूल रिकॉर्डिंग को वॉयस प्रोफ़ाइल में बदल देता है और इसे आपके ब्राउज़र में संग्रहीत करता है। तब से आप बस सूची से उस आवाज को चुनें और रिकॉर्डिंग को दोबारा अपलोड किए बिना किसी भी पाठ को अपनी आवाज में आवाज दें। प्रोफ़ाइल स्थानीय रूप से रखी जाती हैं और पृष्ठ पुनः लोड होने पर भी जीवित रहती हैं।

पहली बार दौड़ने से पहले क्या जानना चाहिए?

  • ब्राउज़र. डेस्कटॉप पर हाल का Chrome या Edge सबसे अच्छा काम करता है। WebGPU के बिना मॉडल प्रोसेसर पर वापस आ जाता है और काफी धीमा हो जाता है - टूल आपको इसके बारे में ईमानदारी से चेतावनी देता है।
  • पहली दौड़। ब्राउज़र मॉडल वज़न को एक बार (लगभग 3 GB) डाउनलोड करता है और उन्हें कैश करता है। बाद में रन तुरंत शुरू हो जाते हैं।
  • याद। लगभग 3 GB निःशुल्क मेमोरी की आवश्यकता है। किसी कमज़ोर डिवाइस पर टूल क्रैश होने के बजाय स्पष्ट चेतावनी दिखाता है।
  • परिणाम। तैयार फ़ाइल 24 kHz WAV है, जो आपके संपादन समयरेखा में डालने के लिए तैयार है।

यह किसके लिए है

न्यूरल टेक्स्ट टू स्पीच में रोज़मर्रा के बहुत सारे काम शामिल हैं: सोशल मीडिया के लिए एक क्लिप को आवाज देना, एक लेख का ऑडियो संस्करण बनाना, एक प्रस्तुति का वर्णन करना, यह जाँचना कि कोई स्क्रिप्ट कैसी लगती है, या किसी दस्तावेज़ को पढ़ने के बजाय बस सुनना। यदि आपको किसी विशिष्ट व्यक्ति की आवाज़ की आवश्यकता है, तो उसे एक छोटी रिकॉर्डिंग से क्लोन करें।

इसी अनुभाग में अन्य निःशुल्क टूल भी हैं जो सीधे ब्राउज़र में चलते हैं: गहराई का नक्शा, वीडियो पृष्ठभूमि हटानेवाला और वीडियो और छवि अपस्केलर.

अक्सर पूछे जाने वाले प्रश्नों

क्या यह सचमुच मुफ़्त है? हाँ। इस मॉडल के लिए कोई टोकन शुल्क नहीं लिया जाता है और इसमें कोई भुगतान एपीआई नहीं है - आपका कंप्यूटर काम करता है।

क्या मेरा टेक्स्ट अपलोड हो गया है? नहीं, न तो पाठ और न ही ऑडियो आपके डिवाइस को छोड़ता है; केवल टूल का कोड और मॉडल वेट सर्वर से आते हैं।

इसमें कितना समय लगता है? मॉडल को एक बार डाउनलोड करने के बाद एक संक्षिप्त वाक्यांश में आमतौर पर एक मिनट से भी कम समय लगता है; लंबा पाठ अधिक समय लेता है, और प्रगति पट्टी दिखाती है कि वह कहाँ है।