கூகுள் இந்த வாரம் 48 மணி நேரத்திற்குள் இரண்டு குறிப்பிடத்தக்க ஜெமினி மாடல் புதுப்பிப்புகளை அமைதியாக அனுப்பியது, மேலும் இரண்டுமே டெவலப்பர்கள் உற்பத்தி பயன்பாடுகளை உருவாக்குவதை நோக்கமாகக் கொண்டுள்ளன. ஜெமினி 3.5 டிரான்ஸ்கிரைப், ஆகஸ்ட் 26 அன்று அறிமுகப்படுத்தப்பட்டது, கூகுளின் அதிகாரப்பூர்வ வலைப்பதிவின் படி, நிறுவனத்தின் மிகத் துல்லியமான பேச்சு-க்கு-உரை மாடல். ஜெமினி ஓம்னி 1.1 ஃப்ளாஷ், ஆகஸ்ட் 27 அன்று அறிவிக்கப்பட்டது, 40 வினாடிகள் வரை காட்சி நீட்டிப்பு மற்றும் 4K மேம்பாடு உட்பட, உருவாக்கும் வீடியோவிற்கு தொழில்முறை தரக் கட்டுப்பாடுகளைக் கொண்டுவருகிறது. இரண்டு மாடல்களும் Google AI ஸ்டுடியோவில் உள்ள Gemini API மற்றும் ஜெமினி எண்டர்பிரைஸ் ஏஜென்ட் பிளாட்ஃபார்ம் மூலம் கிடைக்கும்.

ஜெமினி 3.5 எழுத்துப்பெயர்ப்பு: பேச்சு-க்கு-உரை For more context on this story, see our ongoing AI industry coverage.

ஜெமினி 3.5 டிரான்ஸ்கிரிப்டை வழக்கமான பேச்சு அங்கீகாரத்திலிருந்து வேறுபடுத்துவது என்னவென்றால், இது ரா ஆடியோவை நேரடியாக மெருகூட்டப்பட்ட, வடிவமைக்கப்பட்ட உரையாக மாற்றுகிறது, மாறாக ஒரு மூல டிரான்ஸ்கிரிப்ட்டை மாற்றுகிறது. மாடல் பின்னணி இரைச்சல், சிக்கலான வாசகங்கள் மற்றும் டிஸ்ஃப்ளூயன்சி கிளீனப்பை இயல்பாகவே கையாளுகிறது - இது "ums" மற்றும் "ahs" போன்ற நிரப்பு வார்த்தைகளை நீக்குகிறது, "செவ்வாய்-இல்லை, புதன்கிழமை சந்திப்போம்" போன்ற சுய-திருத்தங்களைத் தீர்க்கிறது மற்றும் வெளியீட்டை தானாக வடிவமைக்கிறது.

கூகுள் மேற்கோள் காட்டிய பெஞ்ச்மார்க் எண்கள் குறிப்பிடத்தக்கவை. செயற்கைப் பகுப்பாய்வால் அளவிடப்பட்டபடி, மாதிரியானது ஸ்ட்ரீமிங் பயன்பாட்டு நிகழ்வுகளுக்கு 4.0 சதவிகிதம் மற்றும் ஸ்ட்ரீமிங் அல்லாத ஆடியோவிற்கு 2.6 சதவிகிதம் சராசரி சொல் பிழை விகிதத்தை (WER) அடைகிறது. சிறந்த மொழிகளில் FLEURS பன்மொழி அளவுகோலில், ஸ்ட்ரீமிங் பயன்முறையில் 5.50 சதவிகிதம் WER மற்றும் 5.04 சதவிகிதம் ஸ்ட்ரீமிங் அல்லாதது, இது Google இன் முந்தைய டிரான்ஸ்கிரிப்ஷன் மாடலான Chirp 3 ஐ மேம்படுத்துகிறது. சிர்ப் 3 உடன் ஒப்பிடும்போது இறுதி டிரான்ஸ்கிரிப்ஷனுக்கான நேரம் 70 சதவிகிதம் அதிகரிக்கிறது, மீண்டும் செயற்கையாக அனாசிஸ் மூலம் அளவிடப்படுகிறது.

மாடல் இரண்டு பணிப்பாய்வுகளுக்கு இரண்டு வகைகளில் அனுப்பப்படுகிறது. நேரடிப் பயன்பாடுகளுக்கு, `gemini-3.5-transcribe-live` ஆனது லைவ் ஏபிஐ மூலம் துணை-இரண்டாவது தாமதத்துடன் தொடர்ச்சியான இருதரப்பு ஸ்ட்ரீமிங்கை வழங்குகிறது, குரல் முகவர்கள் மற்றும் நிகழ்நேர தலைப்புகளை குறிவைக்கிறது. பதிவுசெய்யப்பட்ட ஆடியோ — சந்திப்புகள், அழைப்பு பதிவுகள், காப்பகங்கள் — `gemini-3.5-transcribe` ஆனது மூன்று ஸ்பீக்கர்களுக்கான ஸ்பீக்கர் பண்புக்கூறு (சோதனை பயன்முறையில் மேலும் பலவற்றிற்கான ஆதரவுடன்) மற்றும் Interactions API வழியாக வார்த்தை-நிலை நேர முத்திரைகளை வழங்குகிறது.

மற்ற திறன்களில், 85க்கும் மேற்பட்ட மொழிகளில் உச்சரிப்பு மற்றும் பேச்சுவழக்கு கையாளுதலுடன் தானியங்கி கண்டறிதல் மற்றும் படியெடுத்தல் மற்றும் தனிப்பயன் சொல்லகராதி ஆதரவு ஆகியவை அடங்கும், எனவே மாடல் சிறப்பு வாசகங்கள் மற்றும் தனித்துவமான எழுத்துப்பிழைகளுக்கு ஏற்றது. கூகிள் ஒரு வகையான மாதிரிக் கண்களையும் வழங்கியது: செயல்பாட்டு அழைப்பின் மூலம், இது படத்தை உருவாக்குதல் அல்லது கோப்பு பகுப்பாய்வு போன்ற பணிகளை மற்ற ஜெமினி மாடல்களுக்கு வழங்க முடியும் - இது தற்போது மேகோஸில் உள்ள ஜெமினி பயன்பாட்டில் உள்ளது.

ஜெமினி ஆம்னி 1.1 ஃப்ளாஷ்: வீடியோ உருவாக்கம் ஒரு காலவரிசையை வளர்க்கிறது

இரண்டாவது வெளியீடு AI வீடியோ பற்றிய பொதுவான புகாரை நிவர்த்தி செய்கிறது: கட்டுப்பாடு. ஜெமினி ஓம்னி 1.1 ஃப்ளாஷ் என்பது தயாரிப்பு-மையப்படுத்தப்பட்ட புதுப்பிப்பாகும், இது அதன் முன்னோடி இல்லாத வழிகளில் உருவாக்க வீடியோவை இயக்கக்கூடியதாக ஆக்குகிறது, Google DeepMind தயாரிப்பு மேலாளர்கள் அனிஷ் நங்கியா மற்றும் அலிசா ஃபோர்டின் ஆகியோர் இந்த வெளியீட்டை ஆம்னி 1.1 "தொழில்முறை பயன்பாட்டிற்கு தயாரிப்புக்கு தயார்" செய்வதாக விவரிக்கின்றனர்.

காட்சி நீட்டிப்பு என்பது தலைப்பு அம்சம். டெவலப்பர்கள் இப்போது இருக்கும் கிளிப்பில் இருந்து தொடர்ந்து காட்சிகளை உருவாக்குவதைத் தொடரலாம், மாடல் 10 வினாடிகள் வரை முந்தைய சூழலை பகுப்பாய்வு செய்கிறது - இது முந்தைய மாடல்களில் இருந்து இறுதி வினாடியை மட்டுமே குறிப்பிடுகிறது. வீடியோக்களை 10-வினாடி அதிகரிப்புகளில் 40 வினாடிகளின் ஒட்டுமொத்த நீளம் வரை நீட்டிக்க முடியும், இது காட்சி நிலைத்தன்மையை மேம்படுத்துகிறது மற்றும் நீண்ட கதைகளுக்கான கதைகளை பின்பற்றுகிறது.

புதுப்பிப்பு முதல் மற்றும் கடைசி-பிரேம் இடைக்கணிப்பைச் சேர்க்கிறது, மென்மையான, வேண்டுமென்றே கேமரா இயக்கங்கள் மற்றும் காட்சிகளுக்கு இடையில் மாற்றங்களை உருவாக்க டெவலப்பர்கள் தொடக்க மற்றும் இறுதி பிரேம்களைக் குறிப்பிட அனுமதிக்கிறது. டெலிவரிக்காக, முடிக்கப்பட்ட திட்டப்பணிகளை 4K தெளிவுத்திறனுக்கு உயர்த்தலாம், அதே சமயம் 360p மாதிரிக்காட்சி பயன்முறையானது, இறுதி ரெண்டரைச் செய்வதற்கு முன், விரைவாகவும் மலிவாகவும் கேட்கும் செய்திகளை உருவாக்குபவர்களை அனுமதிக்கிறது.

API இலிருந்து அன்றாட மேற்பரப்புகளுக்கு

கூகிள் இரண்டு மாடல்களையும் அதன் நுகர்வோர் தயாரிப்புகளில் இணைக்கிறது, இது அதன் விநியோக நன்மையைக் காட்டுகிறது. ஆண்ட்ராய்டில், Gboard இல் உள்ள புதிய "Rambler" அம்சம், நிரப்பு வார்த்தைகளை வடிகட்டும்போது பேசும் எண்ணங்களை நன்கு வடிவமைக்கப்பட்ட உரையாக மாற்ற 3.5 டிரான்ஸ்கிரைப்பைப் பயன்படுத்துகிறது - பயனர்கள் குரல் மூலமாகவும் திருத்தங்களைச் செய்யலாம். இந்த மாடல், மேகோஸில் உள்ள ஜெமினி பயன்பாட்டில் டிக்டேஷனை வழங்குகிறது, கூகுள் ஆண்டிகிராவிட்டியில் திரை சூழலுடன் இணைந்து செயல்படுகிறது, மேலும் இது Chrome இல் ஒருங்கிணைக்கப்படுகிறது.

டெவலப்பர்களைப் பொறுத்தவரை, இரண்டு வெளியீடுகளும் ஒரு உத்தியாகப் படிக்கப்படுகின்றன: கூகுள் ஜெமினியை நீங்கள் பேசும் சாட்பாட்டிலிருந்து மீடியாவைப் பார்க்கும், கேட்கும் மற்றும் உருவாக்கும் உள்கட்டமைப்பில் தள்ளுகிறது. OpenAI, ElevenLabs மற்றும் வீடியோ ஸ்டார்ட்அப்களின் கூட்டமைப்பு ஆகியவை ஒரே பிராந்தியத்தில் போட்டியிடுவதால், 2.6 சதவிகித வார்த்தை பிழை விகிதம் மற்றும் 40-வினாடி ஒத்திசைவான காட்சிகள் ஆகியவை உண்மையில் வருவாயை உருவாக்கும் உற்பத்திப் பணிச்சுமைக்கான Google இன் தொடக்க முயற்சியாகும் - குரல் முகவர்கள், தலைப்புகள் மற்றும் ஆக்கப்பூர்வமான கருவிகள். டெவலப்பர்கள் இன்று Google AI ஸ்டுடியோவில் இரண்டு மாடல்களையும் உருவாக்கத் தொடங்கலாம்.

ஏன் சொல் பிழை விகிதம் இன்னும் முக்கியமானது

சொல் பிழை விகிதம் ஒரு கல்வி புள்ளிவிவரம் போல் தெரிகிறது, ஆனால் உற்பத்தியில் இது வேலை செய்யும் குரல் தயாரிப்புக்கும் ஏமாற்றமளிக்கும் ஒன்றுக்கும் உள்ள வித்தியாசம். குரல் ஏஜெண்டில் தவறாகப் புரிந்து கொள்ளப்பட்ட ஒவ்வொரு பேச்சும் ஒரு பணியை முறியடிக்கிறது: தவறாகக் கேட்கப்பட்ட ஆர்டர் ஐடி தோல்வியுற்ற தேடலைத் தூண்டுகிறது, தவறான முகவரி தவறான நகரத்திற்கு ஒரு தொகுப்பை அனுப்புகிறது. அதனால்தான், ஸ்ட்ரீமிங் அல்லாத ஆடியோவில் 2.6 சதவிகிதம் WER மற்றும் உயர்-ஒற்றை-இலக்க விகிதங்களுக்கு இடையே உள்ள இடைவெளியானது, ஒரு தலைமுறைக்கு முன்பு மாதிரிகள் பொதுவானதாக இருந்தது.

கூகிள் அறிவித்த இரண்டு முறைகளுக்கு இடையிலான வேறுபாடு கட்டிடக் கலைஞர்களுக்கும் முக்கியமானது. ஸ்ட்ரீமிங் டிரான்ஸ்கிரிப்ஷன் - 4.0 சதவிகிதம் WER எண்ணிக்கை - துணை-இரண்டாவது தாமதத்திற்கு சில துல்லியத்தை வர்த்தகம் செய்கிறது, இது நேரடி குரல் முகவர்கள் போன்ற ஊடாடும் பயன்பாட்டு நிகழ்வுகளுக்குத் தேவைப்படுகிறது. பதிவுசெய்யப்பட்ட ஆடியோவின் தொகுப்பு டிரான்ஸ்கிரிப்ஷன் மெதுவாக இயங்குகிறது, ஆனால் 2.6 சதவீதத்தை அடைகிறது, அதனால்தான் அழைப்புக்குப் பிந்தைய பகுப்பாய்வு மற்றும் காப்பகச் செயலாக்கம் அதிக தேவையாக இருக்கும். ஒரு அனுசரிப்பு அமைப்பைக் காட்டிலும் தனித்தனி மாதிரி எண்ட்பாயிண்ட்ஸ் என இரண்டையும் வெளிப்படுத்தும் Google இன் முடிவு, டெவலப்பர்கள் அந்த பரிமாற்றத்தின் இருபுறமும் வெவ்வேறு தயாரிப்புகளை உருவாக்குவதை ஒப்புக்கொள்கிறது.

வீடியோ தயாரிப்பிற்கான வரிசைப்படுத்தப்பட்ட பணிப்பாய்வு

ஆம்னி 1.1 ஃபிளாஷ் புதுப்பிப்பு, ஆக்கப்பூர்வமான வேலைகள் உண்மையில் எவ்வாறு நிகழ்கின்றன என்பதைப் பற்றிய நடைமுறைக்கு சமமானதாகும். ஜெனரேட்டிவ் வீடியோவை மீண்டும் கூறுவது விலை உயர்ந்தது: ஒவ்வொரு உடனடி பரிசோதனையும் முழு ரெண்டரைக் குறிக்கிறது. புதிய 360p மாதிரிக்காட்சி பயன்முறையானது டெலிவரியில் இருந்து ஆய்வுகளை பிரிக்கிறது, கிரியேட்டர்கள் மலிவாக விரைவான மாறுபாடுகள் மூலம் சுழற்சி செய்ய அனுமதிக்கிறது மற்றும் மதிப்பாய்வில் தப்பிப்பிழைக்கும் காட்சிகளில் 4K உயர்வை மட்டுமே செலுத்துகிறது.

காட்சி நீட்டிப்பு இயக்கவியல் AI வீடியோவை கிளிப்-அளவிலான கெட்டோவில் வைத்திருக்கும் ஒத்திசைவு சிக்கலைக் குறிக்கிறது. இறுதிச் சட்டத்திற்குப் பதிலாக 10 வினாடிகள் முந்தைய சூழலை பகுப்பாய்வு செய்வதன் மூலம், மாதிரியானது 10-வினாடி அதிகரிப்புகளில் ஒரு காட்சியை 40 வினாடிகள் வரை நீட்டிக்க முடியும், அதே நேரத்தில் எழுத்துக்கள், விளக்குகள் மற்றும் காட்சி பாணியை சீராக வைத்திருக்கும். முதல் மற்றும் கடைசி-பிரேம் இடைக்கணிப்புடன் இணைந்து - இது எடிட்டர்களுக்கு நிர்ணயிக்கும் கட்டுப்பாட்டு புள்ளிகளை வழங்குகிறது, வழக்கமான எடிட்டிங்கில் குறிப்பான்கள் வேலை செய்யும் மற்றும் வெளியேறும் வழி - AI-உருவாக்கிய காட்சிகள் மொத்த விற்பனைக்கு பதிலாக உண்மையான தயாரிப்புக்கு பிந்தைய பைப்லைன்களில் பொருந்தத் தொடங்குகிறது.

போட்டி படம்

இரண்டு துவக்கங்களும் Google ஐ இலக்கை விட உள்கட்டமைப்பாக நிலைநிறுத்துகின்றன. பேச்சில், கூகுள் தனது டெவலப்பர்கள் ஏற்கனவே பயன்படுத்தும் ஜெமினி ஏபிஐயில் அதிநவீன துல்லியத்தை இணைப்பதன் மூலம் சிறப்பு டிரான்ஸ்கிரிப்ஷன் விற்பனையாளர்களையும் அதன் கிளவுட் போட்டியாளர்களின் குரல் அடுக்குகளையும் எடுத்துக்கொள்கிறது. வீடியோவில், இது ரா ஸ்பெக்டலின் மீது கட்டுப்பாடு மற்றும் பணிப்பாய்வு ஒருங்கிணைப்பை வலியுறுத்துவதன் மூலம் நன்கு நிதியளிக்கப்பட்ட ஸ்டார்ட்அப்கள் நிறைந்த சந்தையில் போட்டியிடுகிறது.

விநியோக நன்மை தீர்மானிக்கும் காரணியாக இருக்கலாம். ஜெமினி API இலிருந்து டெவலப்பர்கள் அழைக்கக்கூடிய அதே டிரான்ஸ்கிரிப்ஷன் மாடல், ஆண்ட்ராய்டில் Gboard இன் ராம்ப்ளர் டிக்டேஷன், macOS இல் ஜெமினி ஆப்ஸ், Google Antigravity மற்றும் Chrome - அதாவது Google பலகோடி பயனர் தொடர்புகளில் மாடல் மேம்பாட்டை மாற்றியமைக்க முடியும். 2026 இல் பேச்சு அல்லது வீடியோ அடுக்கைத் தேர்ந்தெடுக்கும் டெவலப்பர்களுக்கு, அந்த ஃப்ளைவீல் இப்போது பிட்சின் ஒரு பகுதியாகும்.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →