التخطي إلى المحتوى

أعلنت شركة ميتا عن إطلاق خدمة جديدة لتحويل الكلام إلى نص تحمل اسم «Muse Voice Transcribe»، ضمن توجه متسارع لتعزيز قدراتها في مجال الذكاء الاصطناعي والصوتيات. وتدعم الخدمة أكثر من 70 لغة حول العالم، من بينها خمس لغات هندية رئيسية ضمن المرحلة الحالية، ما يتيح استخدامها في نطاق واسع من البيئات التعليمية والمهنية واللغوية.

تركز «Muse Voice Transcribe» على تحويل الكلام إلى نص بشكل لحظي أثناء التحدث، بدلاً من انتظار انتهاء التسجيل بالكامل قبل بدء المعالجة. ويمثل هذا الأسلوب نقلة مهمة في تجربة الاستخدام، لأنه يقلل زمن التأخير ويجعل الأداة مناسبة للاجتماعات المطولة، والمحادثات اليومية، وكذلك تطبيقات الإملاء المباشر التي تتطلب استجابة سريعة.

من أبرز مميزات الخدمة قدرتها على التمييز بين أكثر من متحدث داخل التسجيل نفسه. فحسب ما ذكرته ميتا، يمكن للنظام تحديد بداية ونهاية الحديث تلقائياً، والتمييز بين أكثر من 20 متحدثاً، مع فصل أصواتهم بما يساعد على إنتاج تفريغ صوتي أوضح وأكثر تنظيماً، خاصة في السيناريوهات التي تتداخل فيها الأدوار مثل الاجتماعات الجماعية والمقابلات.

كما تدعم «Muse Voice Transcribe» سيناريوهات التبديل بين اللغات دون الحاجة إلى ضبط اللغة يدوياً في كل مرة. ويمكن للتقنية التعامل مع التسجيلات الطويلة التي تتجاوز ساعة كاملة، إضافة إلى دعم المحادثات التي ينتقل خلالها المتحدثون بين أكثر من لغة، وحتى عند حدوث تغيير اللغة داخل الجملة الواحدة. وتأتي هذه المرونة لتخدم الواقع اليومي الذي تتسم فيه محادثات كثيرة بالتعدد اللغوي، خصوصاً في بيئات العمل أو المجتمعات متعددة الثقافات.

وبحسب الشركة، يعتمد النموذج على معالجة الصوت على دفعات قصيرة جداً، مع تحديد الوقت المناسب لنسخ الكلمات وفقاً لدرجة وضوحها. وتهدف هذه الآلية إلى تحقيق توازن بين سرعة الاستجابة ودقة تحويل الكلام إلى نص، بحيث لا يتأثر الأداء عند اختلاف اللهجات أو مستويات الضوضاء أو سرعة الإلقاء.

ضمن اللغات الهندية المدعومة حالياً، أشارت ميتا إلى الهندية والتاميلية والتيلوجوية والكانادية والمالايالامية، إلى جانب منظومة دعم لغوي واسعة تتجاوز 70 لغة إجمالاً.

وأتاحت ميتا الخدمة للمطورين عبر واجهة «Meta Model API»، ما يسهل دمج قدرات تحويل الصوت إلى نص داخل التطبيقات والخدمات المختلفة. كما أوضحت الشركة أن بعض أدوات ميتا تستخدم هذه التقنية بالفعل في ميزات الإملاء، ضمن استراتيجية أوسع لنشر الذكاء الاصطناعي في التعامل مع الصوت والمحادثات وتحسين إنتاجية المستخدمين.

من جهة التكلفة، تبلغ رسوم استخدام واجهة البرمجة 3 دولارات لكل 1000 دقيقة من الصوت، وهو ما يعادل نحو 0.18 دولار لكل ساعة. وبذلك تستهدف ميتا تقديم حل قابل للاستخدام في المنتجات التي تتعامل مع محتوى صوتي على نطاق يومي، مثل تطبيقات الملاحظات والاجتماعات، وأنظمة خدمة العملاء، ومنصات التعليم التي تعتمد على تفريغ المحتوى الصوتي.

وتأتي هذه الخطوة في سياق الاهتمام المتزايد بتقنيات فهم الكلام في الوقت الحقيقي، خصوصاً مع انتشار المساعدات الذكية، وخيارات الإملاء الصوتي، والحاجة إلى تفريغ الاجتماعات والمحتوى الصوتي وتحويله إلى نص قابل للبحث والتحرير. ومع دعم التمييز بين المتحدثين والتبديل اللغوي وإنتاج تفريغ شبه فوري، تستهدف «Muse Voice Transcribe» تقديم تجربة أكثر عملية لمستخدمي اللغات المتعددة والمحتوى الديناميكي.

التعليقات

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *