ऑडियो ट्रांसक्रिप्ट
ऑडियो रिकॉर्डिंग को टाइमस्टैम्प वाले टेक्स्ट में बदलता है।
यह टूल JavaScript से चलता है। इसे इस्तेमाल करने के लिए ब्राउज़र में JavaScript चालू करें और पेज रीलोड करें।
रिकॉर्डिंग को टेक्स्ट बनाएँ।
ऑडियो ट्रांसक्रिप्ट किसी ऑडियो या वीडियो रिकॉर्डिंग की बोली को टेक्स्ट में बदलता है। तीन आउटपुट हैं: सादा टेक्स्ट बोली को वाक्य के अंत पर पैराग्राफ़ में समेटता है और सीधे लेख बनाने के लिए उपयुक्त है; समय-चिह्न वाला टेक्स्ट हर पंक्ति की शुरुआत में [00:01:23] रूप में समय रखता है, जो मीटिंग नोट और इंटरव्यू की नक़ल के लिए काम का है; JSON हर शब्द का आरंभ और अंत समय देता है, अपने ऐप या एडिटिंग में इस्तेमाल के लिए। बोली पहचानने के लिए OpenAI का खुला Whisper मॉडल सर्वर पर चलता है; तुर्की समेत 16 भाषाएँ चुनी जा सकती हैं या अपने आप पहचानी जाती है।
रिकॉर्डिंग सिर्फ़ अपने डिवाइस से अपलोड होती है; लिंक डालने का कोई खाना नहीं है। फ़ाइल से ऑडियो अलग करके 16 kHz मोनो में बदला जाता है और सर्वर पर Whisper मॉडल को दिया जाता है; यह किसी बाहरी सेवा को नहीं जाता और काम ख़त्म होते ही मिट जाता है। बिना बोली वाले हिस्से (आधे सेकंड से लंबी चुप्पी, इंतज़ार) लिखने से पहले ही हटा दिए जाते हैं। तीन मॉडल हैं: “तेज़” मोटा-मोटा ड्राफ़्ट देता है; “संतुलित” ज़्यादातर रिकॉर्डिंग के लिए काफ़ी है; “सर्वश्रेष्ठ” नाम ज़्यादा सही पकड़ता है पर 3–4 गुना धीमा है और 10 मिनट तक की रिकॉर्डिंग पर चलता है। एक रिकॉर्डिंग अधिकतम 30 मिनट की हो सकती है; लंबे लेक्चर या मीटिंग को “ऑडियो कटर” से हिस्सों में बाँटकर एक-एक करके अपलोड करें। भाषा पता हो तो चुनें; अपने आप पहचान पक्की न हो तो नतीजे की स्क्रीन बता देती है।
शुरू से आख़िर तक
- अपनी ऑडियो या वीडियो फ़ाइल अपलोड करें। MP3, WAV, M4A, FLAC, MP4, MOV, MKV… अवधि पढ़ी जाती है।
- भाषा और आउटपुट चुनें। सादा टेक्स्ट, टाइमस्टैम्प वाला टेक्स्ट या JSON। मॉडल: संतुलित; नाम ज़रूरी हों तो सर्वश्रेष्ठ।
- टेक्स्ट डाउनलोड करें। टेक्स्ट स्क्रीन पर दिखता है और कॉपी किया जा सकता है; फ़ाइल डाउनलोड होती है। पढ़ें और सुधारें।
अक्सर पूछे जाने वाले सवाल
टाइमस्टैम्प वाला टेक्स्ट किस काम का है?
हर पंक्ति की शुरुआत का समय बताता है कि वह वाक्य रिकॉर्डिंग में कहाँ है; इसे मीटिंग नोट्स, इंटरव्यू ट्रांसक्रिप्ट और वीडियो के अंदर कोई हिस्सा ढूँढने में इस्तेमाल किया जाता है। JSON आउटपुट वही जानकारी शब्द-दर-शब्द देता है।
क्या यह बोलने वालों को अलग करता है?
नहीं। टेक्स्ट एक ही धारा में आता है; कौन बोल रहा है, यह चिह्नित नहीं होता। दो लोगों के इंटरव्यू में सबसे तेज़ तरीक़ा है “टाइमस्टैम्प वाला टेक्स्ट” चुनना और रिकॉर्डिंग सुनते हुए पंक्तियों की शुरुआत में नाम जोड़ना।
सादे टेक्स्ट में पैराग्राफ़ कैसे बनते हैं?
मॉडल बोली को टुकड़ों में लिखता है; सादा टेक्स्ट आउटपुट इन टुकड़ों को जोड़ता है और लगभग 400 अक्षर के बाद पहले वाक्य-अंत पर नया पैराग्राफ़ शुरू करता है। विराम चिह्न और बड़े अक्षर भी मॉडल से आते हैं; तेज़ या शोर वाली बोली में छूट सकते हैं। प्रकाशित करने से पहले टेक्स्ट एक बार पढ़ें और ख़ास तौर पर नाम जाँचें।
क्या मेरी फ़ाइल सर्वर पर रहती है?
नहीं। आपकी फ़ाइल सिर्फ़ प्रोसेसिंग के लिए सर्वर पर आती है और काम पूरा होते ही हटा दी जाती है; नतीजा डाउनलोड करके टूल से बाहर निकलने पर आउटपुट भी हटा दिया जाता है। अकाउंट, नाम या ईमेल की ज़रूरत नहीं है, और आपकी फ़ाइलें किसी थर्ड-पार्टी सेवा को नहीं भेजी जातीं। इस्तेमाल मुफ़्त है: काम की संख्या पर कोई घंटेवार या रोज़ाना सीमा नहीं है, प्रोसेसिंग से पहले विज्ञापन देखना नहीं पड़ता और आउटपुट पर कोई वॉटरमार्क नहीं लगाया जाता।
और ऑडियो टूल
RUPO Studio