26 अगस्त 2026 को लॉन्च हुआ Gemini 3.5 Transcribe
Google का Gemini 3.5 Transcribe और OpenAI का GPT-Transcribe एक साथ जारी हुए, जो ट्रांसक्रिप्शन तकनीक में महत्वपूर्ण प्रगति दर्शाते हैं।
Gemini 3.5 Transcribe अपने पूर्ववर्ती की तुलना में ट्रांसक्रिप्शन गति में 70% सुधार प्रदान करता है।
OpenAI का GPT-Transcribe शब्द त्रुटि दर को 19.27% तक कम करता है।
दोनों मॉडल विभिन्न आवश्यकताओं को पूरा करते हैं: Gemini बहु-वार्ताकार परिदृश्यों में उत्कृष्ट है, जबकि GPT-Transcribe एकल-वार्ताकार ट्रांसक्रिप्शन के लिए अनुकूलित है।
26 अगस्त 2026 को, Google ने अपने नवीनतम ट्रांसक्रिप्शन मॉडल, Gemini 3.5 Transcribe, को पेश किया, जो OpenAI के GPT-Transcribe के 28 जुलाई 2026 को लॉन्च होने के कुछ हफ्तों बाद आया। यह समय एक महत्वपूर्ण तुलना की अनुमति देता है, क्योंकि दोनों उन्नत ट्रांसक्रिप्शन तकनीकें लगभग एक साथ उभरी हैं, जो ऑडियो ट्रांसक्रिप्शन में विशिष्ट उपयोग के मामलों को पूरा करने के लिए डिज़ाइन की गई हैं।
Gemini 3.5 Transcribe, Google के पिछले मॉडल, Chirp 3, का उत्तराधिकारी है और इसमें ट्रांसक्रिप्शन गति में 70% का उल्लेखनीय सुधार है। यह दो अलग-अलग मॉडल आईडी के तहत कार्य करता है: gemini-3.5-transcribe-live रीयल-टाइम स्ट्रीमिंग के लिए और gemini-3.5-transcribe प्री-रिकॉर्डेड ऑडियो के लिए। यह मॉडल स्ट्रीमिंग के लिए 4.0% और नॉन-स्ट्रीमिंग के लिए 2.6% की शब्द त्रुटि दर (WER) प्राप्त करता है, और इसमें बहु-वार्ताकार पहचान और शब्द-स्तरीय टाइमस्टैम्प जैसी अतिरिक्त क्षमताएं हैं, जो 85 से अधिक भाषाओं का समर्थन करती हैं।
इसके विपरीत, OpenAI का GPT-Transcribe, जो gpt-4o-transcribe मॉडल का अनुसरण करता है, महत्वपूर्ण सुधार भी दर्शाता है। यह अपने पूर्ववर्ती, Whisper, की तुलना में शब्द त्रुटि दर को आधा कर देता है, जो Common Voice बेंचमार्क पर लगभग 19.27% प्राप्त करता है। इसकी मूल्य संरचना भी प्रतिस्पर्धात्मक है, जिसमें फ़ाइल ट्रांसक्रिप्शन के लिए $0.0045 प्रति मिनट और स्ट्रीमिंग ऑडियो के लिए $0.017 प्रति मिनट की लागत निर्धारित की गई है। हालाँकि, इसमें अंतर्निहित स्पीकर डायरीज़ेशन और शब्द-स्तरीय टाइमस्टैम्प की कमी है, जिसके लिए इन सुविधाओं के लिए अतिरिक्त मॉडलों की आवश्यकता होती है।
इन प्रगति के प्रभाव विभिन्न क्षेत्रों के लिए महत्वपूर्ण हैं। Gemini 3.5 Transcribe उन वातावरणों के लिए विशेष रूप से फायदेमंद है जहाँ कई वार्ताकार शामिल होते हैं, जैसे बैठकें या सम्मेलन, जो स्पीकर के बीच स्पष्ट अंतर करने में सक्षम बनाता है। दूसरी ओर, GPT-Transcribe उन परिदृश्यों में अच्छी तरह से कार्य करता है जहाँ त्वरित, लागत-कुशल ट्रांसक्रिप्शन की आवश्यकता होती है, जैसे लाइव इवेंट या एकल-वार्ताकार रिकॉर्डिंग।
आगे देखते हुए, Google और OpenAI दोनों को अपनी ट्रांसक्रिप्शन तकनीकों को और सुधारने की उम्मीद है। उपयोगकर्ता सटीकता और कार्यक्षमता में आगे के सुधारों की उम्मीद कर सकते हैं, साथ ही मूल्य निर्धारण मॉडलों में संभावित अपडेट, जो ऑडियो प्रसंस्करण परिदृश्य में विविध अनुप्रयोगों के लिए इन उपकरणों को अधिक सुलभ बनाते हैं।



