"غوغل" تطلق "Gemini 3.5 Transcribe": جيل جديد يعيد تعريف النسخ الصوتي بالذكاء الاصطناعي



واشنطن — وكالات

أعلنت شركة "غوغل" رسمياً عن إطلاق أحدث نماذجها المخصصة لتحويل الصوت إلى نصوص تحت اسم "Gemini 3.5 Transcribe"، في خطوة تمثل قفزة نوعية لتعزيز دقة وسرعة معالجة الكلام المنطوق وفهم سياقه اللغوي المعقد.

يأتي هذا الإطلاق ليحل النموذج الجديد كلياً محل الجيل السابق "Chirp 3"، حيث صرحت الشركة بأنه يُعد النموذج الأكثر دقة وتطوراً في تاريخها ضمن هذه الفئة. ولا تقتصر قدرات النموذج على تفريغ الكلمات حرفياً فحسب، بل تمتد إلى فهم السياق العام للحديث بدقة متناهية، والتعرف التلقائي والفوري على اللغات المختلفة حتى في حال التبديل بين أكثر من لغة في الجملة ذاتها.

طفرة في الأداء والتنقيح التلقائي

يقدم النموذج تحسيناً ملحوظاً في زمن الاستجابة، إذ يقلل الوقت اللازم لمعالجة الصوت إلى النص النهائي بنسبة تصل إلى 70%، مع خفض كبير في معدلات الخطأ مقارنة بالإصدارات السابقة. وإلى جانب ذلك، زُوّد النموذج بخوارزميات ذكية قادرة على تنقيح النص تلقائياً عبر إزالة كلمات الحشو والتردد، والتعامل بمرونة مع التصحيحات اللحظية التي يقوم بها المتحدث، فضلاً عن إضافة علامات الترقيم والتنسيق وفصل المتحدثين بدقة.

منصات التوفر والتكامل

أتاحت "غوغل" النموذج الجديد مبدئياً للمستخدمين والمطورين عبر منصة Google Antigravity، وكذلك عبر تطبيق "جيميناي" المخصص لنظام التشغيل macOS.

ومن المنتظر أن تشهد المرحلة المقبلة توسعاً أكبر في دمج النموذج، حيث أكدت الشركة توفيره قريباً على متصفح "غوغل كروم" لتمكين خاصية "التحدث للكتابة" (Talk-to-Type) في أي حقل نصي عبر الويب، إلى جانب دعمه للمطورين عبر واجهات برمجة التطبيقات السحابية.

ليست هناك تعليقات:

إرسال تعليق