OpenAI đã bắt đầu triển khai "ChatGPT Voice" trên ứng dụng ChatGPT dành cho macOS và Windows, mở rộng khả năng tương tác bằng giọng nói từ hội thoại sang hỗ trợ xử lý công việc. Tính năng được phát hành trong bản cập nhật ứng dụng desktop phiên bản 26.715 từ ngày 23/7/2026.
ChatGPT Voice được xây dựng trên “GPT-Live”, thế hệ mô hình giọng nói mới mà OpenAI giới thiệu trong tháng 7/2026. Với kiến trúc song công toàn phần (full-duplex), GPT-Live có thể nghe và nói cùng lúc, giúp cuộc hội thoại diễn ra tự nhiên hơn, kể cả khi người dùng ngắt lời hoặc chuyển chủ đề.
OpenAI đã triển khai công nghệ này dưới hai phiên bản. Trong đó, “GPT-Live-1” tiêu chuẩn dành cho người dùng các gói Plus, Pro, Business, Edu và Enterprise, còn “GPT-Live-1 mini” phục vụ người dùng miễn phí. Tuy nhiên, ở thời điểm hiện tại, ChatGPT Voice trên ứng dụng desktop mới chỉ được mở cho các gói trả phí.
Khác với Advanced Voice Mode vốn chủ yếu phục vụ hội thoại, ChatGPT Voice trên desktop được tích hợp với ba không gian làm việc Chat, Work và Codex. Người dùng có thể sử dụng giọng nói để khởi tạo tác vụ, theo dõi tiến độ hoặc điều chỉnh quá trình xử lý mà không cần thao tác qua từng bước.
Ví dụ, một lập trình viên có thể yêu cầu Codex kiểm tra lỗi trong mã nguồn, chạy thử nghiệm hoặc chuẩn bị các thay đổi cần thiết mà không phải nhập từng câu lệnh. Trong lúc hệ thống xử lý các tác vụ, người này vẫn có thể tiếp tục trao đổi, bổ sung yêu cầu hoặc chuyển sang công việc khác mà không cần chờ nhiệm vụ trước hoàn tất.

Advanced Voice Mode là thế hệ chế độ giọng nói trước đó của ChatGPT, cho phép người dùng lựa chọn nhiều giọng nói khác nhau và trò chuyện với AI theo thời gian thực
Với các tác vụ cần tìm kiếm trên web, suy luận sâu hoặc xử lý phức tạp, GPT-Live sẽ chuyển yêu cầu sang một mô hình có năng lực xử lý cao hơn trước khi trả kết quả về cuộc hội thoại. Tại thời điểm ra mắt, GPT-Live sử dụng GPT-5.5 làm mô hình nền.

GPT-5.5 hỗ trợ nhiều mức độ suy luận (reasoning effort), giúp người dùng cân bằng giữa tốc độ phản hồi và khả năng xử lý các tác vụ phức tạp
ChatGPT Voice đồng thời sử dụng các công cụ và quyền truy cập tương ứng với từng không gian làm việc. Khi được người dùng cấp quyền, Work và Codex có thể truy cập tệp cục bộ hoặc thư mục dự án để hỗ trợ xử lý tác vụ. Với macOS, tính năng Screen Context cho phép ChatGPT tham chiếu cửa sổ ứng dụng đang được mở để đưa ra phản hồi phù hợp hơn với ngữ cảnh làm việc.
Người dùng cũng có thể thiết lập phím tắt (hotkey) để kích hoạt ChatGPT Voice khi đang làm việc trong ứng dụng khác mà không cần chuyển sang cửa sổ ChatGPT. Bên cạnh đó, tính năng còn hỗ trợ người dùng truy cập các phiên làm việc trên máy tính thông qua tính năng Remote trong ứng dụng ChatGPT dành cho iOS sau khi hai thiết bị được ghép nối.
Các tác vụ được khởi tạo bằng ChatGPT Voice vẫn sử dụng chung hạn mức của Work hoặc Codex, thay vì có cơ chế tính riêng. Đối với khách hàng Enterprise và Edu, ChatGPT Voice sẽ được triển khai theo lộ trình truy cập sớm trong hai tuần trước khi được mở mặc định trên toàn bộ workspace.
Những động thái trên diễn ra trong bối cảnh cạnh tranh gay gắt về trợ lý giọng nói AI. Cùng thời điểm, Anthropic cũng nâng cấp chế độ giọng nói cho Claude, cho phép mô hình Opus, Sonnet và Haiku thực hiện tác vụ trực tiếp trong các ứng dụng như Gmail, Calendar, Slack, Notion và Canva.
Việc mở rộng ChatGPT Voice lên desktop cho thấy OpenAI đang tiếp tục tăng tốc trong cuộc đua này, với mục tiêu đưa giọng nói trở thành một phần quan trọng của trải nghiệm làm việc với AI.
Yến Lan
Subscribe Newsletter của Advertising Vietnam để theo dõi nhiều tin tức hấp dẫn về ngành quảng cáo.





