26 अगस्त 2026 को लॉन्च हुआ Gemini 3.5 Transcribe

Google का Gemini 3.5 Transcribe और OpenAI का GPT-Transcribe एक साथ जारी हुए, जो ट्रांसक्रिप्शन तकनीक में महत्वपूर्ण प्रगति दर्शाते हैं।

A
Apla Nagpur Desk
28 Sept 2026, 7:49 PM IST · 2 मिनट वाचन
Source: Kdnuggets
26 अगस्त 2026 को लॉन्च हुआ Gemini 3.5 Transcribe
खास बातें
1

Gemini 3.5 Transcribe अपने पूर्ववर्ती की तुलना में ट्रांसक्रिप्शन गति में 70% सुधार प्रदान करता है।

2

OpenAI का GPT-Transcribe शब्द त्रुटि दर को 19.27% तक कम करता है।

3

दोनों मॉडल विभिन्न आवश्यकताओं को पूरा करते हैं: Gemini बहु-वार्ताकार परिदृश्यों में उत्कृष्ट है, जबकि GPT-Transcribe एकल-वार्ताकार ट्रांसक्रिप्शन के लिए अनुकूलित है।

26 अगस्त 2026 को, Google ने अपने नवीनतम ट्रांसक्रिप्शन मॉडल, Gemini 3.5 Transcribe, को पेश किया, जो OpenAI के GPT-Transcribe के 28 जुलाई 2026 को लॉन्च होने के कुछ हफ्तों बाद आया। यह समय एक महत्वपूर्ण तुलना की अनुमति देता है, क्योंकि दोनों उन्नत ट्रांसक्रिप्शन तकनीकें लगभग एक साथ उभरी हैं, जो ऑडियो ट्रांसक्रिप्शन में विशिष्ट उपयोग के मामलों को पूरा करने के लिए डिज़ाइन की गई हैं।

Gemini 3.5 Transcribe, Google के पिछले मॉडल, Chirp 3, का उत्तराधिकारी है और इसमें ट्रांसक्रिप्शन गति में 70% का उल्लेखनीय सुधार है। यह दो अलग-अलग मॉडल आईडी के तहत कार्य करता है: gemini-3.5-transcribe-live रीयल-टाइम स्ट्रीमिंग के लिए और gemini-3.5-transcribe प्री-रिकॉर्डेड ऑडियो के लिए। यह मॉडल स्ट्रीमिंग के लिए 4.0% और नॉन-स्ट्रीमिंग के लिए 2.6% की शब्द त्रुटि दर (WER) प्राप्त करता है, और इसमें बहु-वार्ताकार पहचान और शब्द-स्तरीय टाइमस्टैम्प जैसी अतिरिक्त क्षमताएं हैं, जो 85 से अधिक भाषाओं का समर्थन करती हैं।

इसके विपरीत, OpenAI का GPT-Transcribe, जो gpt-4o-transcribe मॉडल का अनुसरण करता है, महत्वपूर्ण सुधार भी दर्शाता है। यह अपने पूर्ववर्ती, Whisper, की तुलना में शब्द त्रुटि दर को आधा कर देता है, जो Common Voice बेंचमार्क पर लगभग 19.27% प्राप्त करता है। इसकी मूल्य संरचना भी प्रतिस्पर्धात्मक है, जिसमें फ़ाइल ट्रांसक्रिप्शन के लिए $0.0045 प्रति मिनट और स्ट्रीमिंग ऑडियो के लिए $0.017 प्रति मिनट की लागत निर्धारित की गई है। हालाँकि, इसमें अंतर्निहित स्पीकर डायरीज़ेशन और शब्द-स्तरीय टाइमस्टैम्प की कमी है, जिसके लिए इन सुविधाओं के लिए अतिरिक्त मॉडलों की आवश्यकता होती है।

इन प्रगति के प्रभाव विभिन्न क्षेत्रों के लिए महत्वपूर्ण हैं। Gemini 3.5 Transcribe उन वातावरणों के लिए विशेष रूप से फायदेमंद है जहाँ कई वार्ताकार शामिल होते हैं, जैसे बैठकें या सम्मेलन, जो स्पीकर के बीच स्पष्ट अंतर करने में सक्षम बनाता है। दूसरी ओर, GPT-Transcribe उन परिदृश्यों में अच्छी तरह से कार्य करता है जहाँ त्वरित, लागत-कुशल ट्रांसक्रिप्शन की आवश्यकता होती है, जैसे लाइव इवेंट या एकल-वार्ताकार रिकॉर्डिंग।

आगे देखते हुए, Google और OpenAI दोनों को अपनी ट्रांसक्रिप्शन तकनीकों को और सुधारने की उम्मीद है। उपयोगकर्ता सटीकता और कार्यक्षमता में आगे के सुधारों की उम्मीद कर सकते हैं, साथ ही मूल्य निर्धारण मॉडलों में संभावित अपडेट, जो ऑडियो प्रसंस्करण परिदृश्य में विविध अनुप्रयोगों के लिए इन उपकरणों को अधिक सुलभ बनाते हैं।

💬इस खबर पर आपकी क्या राय है?आपकी राय क्या है?

आगे पढ़ें

Gemini 3.5 Transcribe और GPT-Transcribe: तुलना