۱۶ مرداد ۱۴۰۵

اوپن‌ای‌آی نسل تازه مدل‌های صوتی API را برای ترجمه زنده و مکالمه هوشمند معرفی کرد

اوپن‌ای‌آی در 7 مه 2026 از نسل تازه‌ای از مدل‌های صوتی در API خود رونمایی کرد؛ مجموعه‌ای که قرار است اپلیکیشن‌های صوتی را از یک ابزار ساده تشخیص گفتار، به رابط‌هایی هوشمندتر، زنده‌تر و چندزبانه‌تر ادامه مطلب

Visit11 3 ماه پیش

اوپن‌ای‌آی در 7 مه 2026 از نسل تازه‌ای از مدل‌های صوتی در API خود رونمایی کرد؛ مجموعه‌ای که قرار است اپلیکیشن‌های صوتی را از یک ابزار ساده تشخیص گفتار، به رابط‌هایی هوشمندتر، زنده‌تر و چندزبانه‌تر تبدیل کند. این معرفی شامل سه مدل جدید است که روی استدلال صوتی، ترجمه زنده و رونویسی کم‌تأخیر تمرکز دارند.

سه مدل تازه برای موج بعدی اپ‌های صوتی

در معرفی رسمی اوپن‌ای‌آی، سه مدل اصلی محور خبر بودند: GPT-Realtime-2، GPT-Realtime-Translate و GPT-Realtime-Whisper. به گفته شرکت، GPT-Realtime-2 نخستین مدل صوتی این خانواده است که از استدلال در کلاس GPT-5 بهره می‌برد و می‌تواند درخواست‌های پیچیده‌تر را بهتر بفهمد، پاسخ‌های طبیعی‌تری بدهد و مکالمه را هوشمندانه‌تر جلو ببرد.

در کنار آن، GPT-Realtime-Translate برای ترجمه زنده طراحی شده و اوپن‌ای‌آی می‌گوید می‌تواند گفتار را از بیش از 70 زبان ورودی به 13 زبان خروجی ترجمه کند، آن هم در حالی که سرعت مکالمه را حفظ می‌کند. مدل سوم یعنی GPT-Realtime-Whisper هم روی transcription کم‌تأخیر تمرکز دارد؛ موضوعی که برای تماس‌های زنده، دستیارهای صوتی، ابزارهای پشتیبانی و سرویس‌های دسترس‌پذیری اهمیت مستقیم دارد.

تمرکز اصلی روی voice apps واقعی است، نه فقط demo

آنچه این خبر را مهم می‌کند، فقط اسم مدل‌ها نیست؛ بلکه جهتی است که اوپن‌ای‌آی برای voice interface ترسیم می‌کند. در نگاه این شرکت، صدا باید به یک لایه طبیعی بین انسان و محصول تبدیل شود؛ لایه‌ای که فقط حرف‌ها را به متن تبدیل نمی‌کند، بلکه منظور را می‌فهمد، در لحظه واکنش نشان می‌دهد، اقدام می‌کند و حتی بین زبان‌ها پل می‌زند.

اوپن‌ای‌آی در مثال‌های خود به سناریوهایی اشاره کرده که در آن‌ها شرکت‌ها می‌توانند تجربه پشتیبانی مشتری، ترجمه زنده، و تعامل چندزبانه را روان‌تر کنند. اگر این مدل‌ها در عمل هم به همان سطحی برسند که شرکت وعده داده، رقابت در رابط‌های صوتی می‌تواند وارد فاز تازه‌ای شود؛ فازی که در آن تجربه گفت‌وگو با ماشین کمتر مصنوعی و بیشتر شبیه تعامل واقعی خواهد بود.

قیمت‌گذاری و دسترس‌پذیری هم بخشی از پیام خبر است

اوپن‌ای‌آی هم‌زمان جزئیات قیمت‌گذاری این مدل‌ها را هم منتشر کرده است. GPT-Realtime-2 با مدل قیمت‌گذاری مبتنی بر توکن صوتی عرضه می‌شود، در حالی که مدل‌های ترجمه و رونویسی بر پایه قیمت‌گذاری دقیقه‌ای معرفی شده‌اند. این یعنی شرکت فقط از یک قابلیت تحقیقاتی حرف نمی‌زند، بلکه دارد آن را به‌عنوان یک محصول آماده استفاده برای توسعه‌دهندگان و کسب‌وکارها عرضه می‌کند.

چرا این خبر مهم است؟

بازار AI در ماه‌های اخیر بیشتر روی agentها و مدل‌های استدلالی متمرکز بوده، اما این خبر یادآوری می‌کند که صدا همچنان یکی از مهم‌ترین میدان‌های رقابت است. هرچه مدل‌های صوتی طبیعی‌تر، سریع‌تر و چندزبانه‌تر شوند، کاربردهای تجاری آن‌ها از مرکز تماس و پشتیبانی تا آموزش، سفر، سلامت و ابزارهای بهره‌وری گسترده‌تر خواهد شد. معرفی مدل‌های جدید اوپن‌ای‌آی را باید قدمی جدی در همین مسیر دانست.


منبع: OpenAI

لینک خبر اصلی: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/

تاریخ انتشار منبع: 2026-05-07

اشتراک گذاری

دنبال کنید نوشته شده توسط:

محسن جدیدی

Comments