اوپنایآی در 7 مه 2026 از نسل تازهای از مدلهای صوتی در API خود رونمایی کرد؛ مجموعهای که قرار است اپلیکیشنهای صوتی را از یک ابزار ساده تشخیص گفتار، به رابطهایی هوشمندتر، زندهتر و چندزبانهتر تبدیل کند. این معرفی شامل سه مدل جدید است که روی استدلال صوتی، ترجمه زنده و رونویسی کمتأخیر تمرکز دارند.
سه مدل تازه برای موج بعدی اپهای صوتی
در معرفی رسمی اوپنایآی، سه مدل اصلی محور خبر بودند: GPT-Realtime-2، GPT-Realtime-Translate و GPT-Realtime-Whisper. به گفته شرکت، GPT-Realtime-2 نخستین مدل صوتی این خانواده است که از استدلال در کلاس GPT-5 بهره میبرد و میتواند درخواستهای پیچیدهتر را بهتر بفهمد، پاسخهای طبیعیتری بدهد و مکالمه را هوشمندانهتر جلو ببرد.
در کنار آن، GPT-Realtime-Translate برای ترجمه زنده طراحی شده و اوپنایآی میگوید میتواند گفتار را از بیش از 70 زبان ورودی به 13 زبان خروجی ترجمه کند، آن هم در حالی که سرعت مکالمه را حفظ میکند. مدل سوم یعنی GPT-Realtime-Whisper هم روی transcription کمتأخیر تمرکز دارد؛ موضوعی که برای تماسهای زنده، دستیارهای صوتی، ابزارهای پشتیبانی و سرویسهای دسترسپذیری اهمیت مستقیم دارد.
تمرکز اصلی روی voice apps واقعی است، نه فقط demo
آنچه این خبر را مهم میکند، فقط اسم مدلها نیست؛ بلکه جهتی است که اوپنایآی برای voice interface ترسیم میکند. در نگاه این شرکت، صدا باید به یک لایه طبیعی بین انسان و محصول تبدیل شود؛ لایهای که فقط حرفها را به متن تبدیل نمیکند، بلکه منظور را میفهمد، در لحظه واکنش نشان میدهد، اقدام میکند و حتی بین زبانها پل میزند.
اوپنایآی در مثالهای خود به سناریوهایی اشاره کرده که در آنها شرکتها میتوانند تجربه پشتیبانی مشتری، ترجمه زنده، و تعامل چندزبانه را روانتر کنند. اگر این مدلها در عمل هم به همان سطحی برسند که شرکت وعده داده، رقابت در رابطهای صوتی میتواند وارد فاز تازهای شود؛ فازی که در آن تجربه گفتوگو با ماشین کمتر مصنوعی و بیشتر شبیه تعامل واقعی خواهد بود.
قیمتگذاری و دسترسپذیری هم بخشی از پیام خبر است
اوپنایآی همزمان جزئیات قیمتگذاری این مدلها را هم منتشر کرده است. GPT-Realtime-2 با مدل قیمتگذاری مبتنی بر توکن صوتی عرضه میشود، در حالی که مدلهای ترجمه و رونویسی بر پایه قیمتگذاری دقیقهای معرفی شدهاند. این یعنی شرکت فقط از یک قابلیت تحقیقاتی حرف نمیزند، بلکه دارد آن را بهعنوان یک محصول آماده استفاده برای توسعهدهندگان و کسبوکارها عرضه میکند.
چرا این خبر مهم است؟
بازار AI در ماههای اخیر بیشتر روی agentها و مدلهای استدلالی متمرکز بوده، اما این خبر یادآوری میکند که صدا همچنان یکی از مهمترین میدانهای رقابت است. هرچه مدلهای صوتی طبیعیتر، سریعتر و چندزبانهتر شوند، کاربردهای تجاری آنها از مرکز تماس و پشتیبانی تا آموزش، سفر، سلامت و ابزارهای بهرهوری گستردهتر خواهد شد. معرفی مدلهای جدید اوپنایآی را باید قدمی جدی در همین مسیر دانست.
منبع: OpenAI
لینک خبر اصلی: https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
تاریخ انتشار منبع: 2026-05-07
Comments