في هذا الأسبوع، حققت عائلة النماذج الكبيرة للصوت من شركة علي بابا إنجازات بارزة على منصة التقييم الاصطناعية العالمية Artificial Analysis:

نال النظام Fun-Realtime-ASR المرتبة الأولى عالمياً بنسبة خطأ في الكلمات قدرها 1.8٪ فقط؛

وحقق النظام Fun-Realtime-AudioChat أعلى الدرجات عالمياً في مؤشري الاستدلال الصوتي وسلاسة الحوار؛

بينما حصل النظام Fun-Realtime-TTS-Preview على تقييم إلو (Elo) مقداره 1190 نقطة، ليحتل المرتبة الأولى محلياً بين المنتجات الصينية.

وبذلك، أصبحت نماذج الصوت من علي بابا الرائدة محلياً في المجالات الثلاثة الرئيسية: ASR (التعرف على الكلام)، TTS (تحويل النص إلى كلام)، وChat (الحوار الصوتي)، محققةً ما يُعرف بـ"الكأس الكاملة".

تم دمج الذكاء الصوتي بشكل عميق في تجربة منتجات DingTalk وWukong

باعتبارها إحدى المنصات الرئيسية لتطبيق النماذج الكبيرة من علي بابا، تم تحويل قدرات النماذج الصوتية إلى تجارب منتجات ملموسة عبر منصتي DingTalk وWukong. يمكن للمستخدمين الاستفادة من هذه التقنيات في اجتماعات DingTalk، ووظيفة التسجيل الصوتي بالذكاء الاصطناعي، والرسائل الصوتية في الدردشة الفورية، بالإضافة إلى الأجهزة مثل DingTalk A1 والسماعات الذكية Cleer. حيث توفر هذه التطبيقات سيناريوهات ذكاء صوتي كاملة، تمتد من الاجتماعات عبر الإنترنت إلى اللقاءات الشخصية، ومن العمل النصي إلى التفاعل الصوتي، مع القدرة على فهم اللهجات المحلية والمصطلحات المتخصصة بدقة عالية.

ستُدمج النماذج التي ظهرت في القوائم المذكورة أعلاه تدريجياً في هذه المنتجات، مما سيؤدي باستمرار إلى تحسين تجربة المستخدم ورفع كفاءة العمل.

القدرات الأساسية الثلاثة للتفاعل الصوتي: الاستماع الدقيق، والنطق الجيد، والمحادثة السلسة

يمكن تقسيم قدرات النماذج الكبيرة للصوت إلى ثلاث مستويات: "الاستماع الدقيق" (ASR: تحويل الصوت إلى نص)، و"النطق الجيد" (TTS: تحويل النص إلى صوت)، و"المحادثة السلسة" (Chat: الفهم الصوتي الشامل والحوار من البداية إلى النهاية). تعمل هذه العناصر الثلاثة معاً لتوفير تجربة تفاعل صوتي كاملة.

في العام الماضي، تم استخدام نموذج Fun-ASR الكبير، الذي طورته كل من DingTalk ومختبر Tongyi، على نطاق واسع داخل منتجات DingTalk.

الاستماع الدقيق: التقاط دقيق للمؤتمرات المعقدة والتعبيرات المتخصصة

في اجتماعات DingTalk، يستطيع نموذج Fun-ASR التعرف بدقة على المحتوى حتى في الحالات المعقدة التي تتضمن مناقشات جماعية، ومقاطعة السpeaker بسرعة، واستخدام مصطلحات متخصصة. وبعد انتهاء الاجتماع، يتم إنشاء ملخص للمحاضر شبه خالٍ من الأخطاء تلقائياً، دون الحاجة إلى تسجيل يدوي.

في الأجهزة الذكية من سلسلة DingTalk A1 وفي ميزة التسجيل الصوتي بالذكاء الاصطناعي، يمكن بضغطة زر واحدة تحويل المقاطع المسجلة - سواء كانت مقابلات أو ملاحظات دروس أو جلسات توليد أفكار - إلى نصوص منظمة ذات جودة عالية. وبفضل قدرات الاستدلال الصوتي، لا يستطيع الذكاء الاصطناعي فقط "فهم ما قيل"، بل أيضاً استخلاص الملخصات تلقائياً، وتحديد النقاط المهمة، وتنظيم قائمة المهام.

تحويل الرسائل الصوتية في الدردشة الفورية إلى نص بنقرة واحدة، مع دعم شامل لل لهجات واللهجات الإقليمية

في رسائل الدردشة الفورية، يمكن تحويل الرسائل الصوتية الطويلة (تصل إلى 60 ثانية) إلى نصوص بنقرة واحدة، وبدرجة عالية جداً من الدقة، مع دعم شامل للهجات المحلية، واللهجات المختلفة، والمصطلحات المهنية.

تُعد التنوع اللغوي في الصين أحد أكبر التحديات أمام أنظمة التعرف الصوتي. وباعتماد النماذج الصوتية الكبيرة من علي بابا، غطت كل من DingTalk وWukong ثماني مناطق لهجوية رئيسية: اللهجة الماندارينية، ولهجة وو، والكانتونية، ولهجة مين، ولهجة هاكا، ولهجة كان، ولهجة شيانغ، ولهجة جين. وبلغت دقة التعرف على اللهجات المحلية في عشرات المدن مستويات رائدة على المستوى الوطني، مع معدل دقة يتجاوز 90٪ للمتحدثين باللهجات الشائعة.

سواء كنت موظفاً في القطاع المالي تتحدث باللهجة الشنغهاوية، أو تاجراً دولياً يستخدم الكانتونية، أو عاملاً ميدانياً يتواصل باللهجة السِتشوانية أو الهينانية أو الشنشانية، فإن DingTalk ستكون قادرة على "فهمك".

وتشير قائمة Artificial Analysis إلى أن أحدث نموذج ASR يحقق نسبة خطأ في الكلمات لا تزيد عن 1.8٪، ما سيعزز دقة الترجمة الفورية للنصوص الحية ولتوثيق الاجتماعات.

النطق الجيد والمحادثة السلسة: حوار طبيعي واستجابة ذكية

التفاعل الصوتي لا يتطلب فقط "الاستماع بدقة"، بل أيضاً "النطق بطلاقة" و"القدرة على الحوار السلس". في الأجهزة مثل السماعات الذكية Cleer، تجعل قدرات التعرف والتركيب الصوتي القوية من تلقي الرسائل، والإجابة شفوياً، وإصدار الأوامر الصوتية أثناء التنقل أمراً أكثر سلاسة وطبيعية.

حصل نظام Fun-Realtime-TTS-Preview على المركز الأول محلياً في مجال تركيب الصوت (TTS) برصيد 1190 نقطة في تقييم إلو (Elo)، ما يجعل الصوت الصادر من الذكاء الاصطناعي أكثر طبيعية وحرارة، ويحسن بشكل شامل تجربة الإخراج الصوتي في منتجات DingTalk وWukong.

أما نظام Fun-Realtime-AudioChat فقد تصدر القوائم العالمية في مؤشري الاستدلال الصوتي (بنسبة 97.6٪) وسلاسة الحوار (بنسبة 97.8٪). فهو لا يستطيع فقط فهم المنطق الدلالي، بل أيضاً التعامل مع مقاطعات الحديث، والاستفسارات اللاحقة، وتغير المواضيع كما يحدث في المحادثات الواقعية، حيث تقارب سلاسة التفاعل مستوى الإنسان.

نماذج لغوية مخصصة حسب القطاعات، لتفهم "لغة المجال" حقاً

غالباً ما تفشل النماذج العامة في فهم مصطلحات مثل "LPR"، و"شروط الرهان المتقابل"، و"Glivec"، و"إعادة المحاكمة المدنية"، ما يشكل خطراً على أدائها في السيناريوهات المهنية.

بالتعاون بين فريق DingTalk وفريق الصوت في علي بابا، تم تدريب نماذج لغوية متخصصة تغطي بشكل كامل المصطلحات المستخدمة في القطاعات الرئيسية والتخصصية مثل الإنترنت، والذكاء الاصطناعي، والمالية، والرعاية الصحية، والقانون، وصناعة السيارات، والتصنيع، والتعليم، والحكومة.

في المجال المالي، يمكن للنموذج التعرف بدقة على مصطلحات مثل "الاسترداد العكسي"، و"MLF"، و"القواعد الجديدة لإدارة الأصول"، ما يحسن بشكل كبير من جودة تسجيلات الاجتماعات ووثائق الامتثال.

في المجال الطبي، لم تعد مصطلحات معقدة مثل "ميثوتريكسات"، و"العلاج المستهدف EGFR"، و"الاستشارة متعددة التخصصات MDT" من الثغرات المعرفية.

في المجال القانوني، يمكن إعادة إنتاج محتوى جلسات المحكمة والمقابلات مع المحامين بدقة عالية، من "الاستفادة غير المشروعة" إلى "الحيازة الحسنة النية".

في قطاع التصنيع، ارتفعت دقة التعرف على مصطلحات مثل "التسامح والملاءمة"، و"معالجة CNC"، و"PPAP" بشكل كبير، ما ضاعف كفاءة اجتماعات الإنتاج.

ولا يقتصر التخصيص على مجرد إضافة كلمات إلى القاموس، بل يتم تحسين النموذج اللغوي بمستوى أعمق، بحيث يفهم الخوارزمي السياق المهني حقاً، ويفصل بين الكلمات المتشابهة في النطق، ويتعرف على الاختصارات والمصطلحات العامية الخاصة بكل مجال، لضمان أن يكون كل تفاعل صوتي "يتحدث بلغة المهنة ويفهم سلوكها".

الصوت هو الوسيلة الأكثر طبيعية للتواصل. من "الاستماع بدقة" إلى "الفهم الحقيقي"، ومن "القدرة على الكلام" إلى "القدرة على الحوار"، لا يمثل "الكأس الكاملة" الذي حققته نماذج الصوت الكبيرة من علي بابا تقدماً تقنياً فحسب، بل يمثل أيضاً قفزة نوعية في تجربة المنتج. ستواصل DingTalk وWukong تحويل قدرات الذكاء الاصطناعي الصوتي الرائدة عالمياً إلى تجارب عمل ملموسة: لجعل الاجتماعات أكثر كفاءة، وتسهيل التوثيق، وتمكين التواصل عبر الحواجز اللغوية واللهجات المختلفة.

We dedicated to serving clients with professional DingTalk solutions. If you'd like to learn more about DingTalk platform applications, feel free to contact our online customer service or email at عنوان البريد الإلكتروني هذا محمي من روبوتات السبام. يجب عليك تفعيل الجافاسكربت لرؤيته.. With a skilled development and operations team and extensive market experience, we’re ready to deliver expert DingTalk services and solutions tailored to your needs!

Using DingTalk: Before & After

Before

  • × Team Chaos: Team members are all busy with their own tasks, standards are inconsistent, and the more communication there is, the more chaotic things become, leading to decreased motivation.
  • × Info Silos: Important information is scattered across WhatsApp/group chats, emails, Excel spreadsheets, and numerous apps, often resulting in lost, missed, or misdirected messages.
  • × Manual Workflow: Tasks are still handled manually: approvals, scheduling, repair requests, store visits, and reports are all slow, hindering frontline responsiveness.
  • × Admin Burden: Clocking in, leave requests, overtime, and payroll are handled in different systems or calculated using spreadsheets, leading to time-consuming statistics and errors.

After

  • Unified Platform: By using a unified platform to bring people and tasks together, communication flows smoothly, collaboration improves, and turnover rates are more easily reduced.
  • Official Channel: Information has an "official channel": whoever is entitled to see it can see it, it can be tracked and reviewed, and there's no fear of messages being skipped.
  • Digital Agility: Processes run online: approvals are faster, tasks are clearer, and store/on-site feedback is more timely, directly improving overall efficiency.
  • Automated HR: Clocking in, leave requests, and overtime are automatically summarized, and attendance reports can be exported with one click for easy payroll calculation.

Operate smarter, spend less

Streamline ops, reduce costs, and keep HQ and frontline in sync—all in one platform.

9.5x

Operational efficiency

72%

Cost savings

35%

Faster team syncs

Want to a Free Trial? Please book our Demo meeting with our AI specilist as below link:
https://www.dingtalk-global.com/contact

WhatsApp