ai insightsDoc trong 21 phut

Google tiến bước với dịch giọng nói trực tiếp, OpenAI mở API thoại song công: điều gì còn lại sau cuộc trò chuyện?

GPT-Live-1 có mặt trên API với giá 0,05 USD mỗi phút thoại, ba tháng sau tính năng dịch giọng nói trực tiếp 70 ngôn ngữ của Google. Giá và điểm benchmark được công bố đo được gì, không đo được gì, và vì sao biên bản họp, ý tưởng được chia sẻ cùng nguồn tài liệu đã lưu càng quan trọng khi trò chuyện ngày càng dễ dàng.

K
Ken Jo
#full-duplex-voice#gpt-live#gemini-live#speech-translation#meeting-notes#knowledge-management

Hai luồng giọng nói chồng chéo tiếp tục tạo thành một bản ghi lâu dài về cuộc hội thoại, các quyết định và nguồn của cuộc trò chuyện đó

Một minh họa khái niệm ban đầu. Cuộc trò chuyện tự nhiên hơn và bản ghi hữu ích về cuộc trò chuyện đó là các mục tiêu thiết kế bổ sung chứ không phải các giai đoạn được đo lường trong quá trình phát hành sản phẩm.

Điều đáng mong đợi nhất từ các thông báo AI thoại gần đây rất gần gũi: nói hết suy nghĩ bằng ngôn ngữ quen thuộc, bổ sung hoặc sửa ngay khi đang nói mà vẫn tham gia cuộc trò chuyện một cách tự nhiên. Ít phải chờ bản dịch, ít phải nhẩm đi nhẩm lại câu nói trước khi lên tiếng. Nhờ vậy, ta có thể chú ý hơn đến điều người đối diện thực sự muốn truyền đạt.

Google đã giới thiệu Gemini 3.5 Live Translate vào ngày 9 tháng 6 năm 2026. OpenAI đã giới thiệu các mẫu GPT-Live song công hoàn toàn trong ChatGPT vào ngày 8 tháng 7, sau đó phát hành GPT-Live-1 trong API vào ngày 10 tháng 9. Đây là những sản phẩm khác nhau phục vụ các mục đích khác nhau, nhưng trình tự hướng tới nhiều mục đích hơn tương tác bằng lời nói liên tục. Thông báo OpenAI mới nhất mở rộng quyền truy cập cho các nhà phát triển; đây không phải là lần xuất hiện đầu tiên của GPT-Live. Thông báo tháng 6 của Google, Giới thiệu tháng 7 của OpenAI, Bản phát hành API tháng 9 của OpenAI.

Theo tôi, những tiến bộ này đưa chúng ta đến gần hơn với cuộc sống ít rào cản ngôn ngữ. Chúng cũng làm rõ một câu hỏi khác: khi trò chuyện trở nên dễ dàng, làm sao giữ lại giá trị của cuộc trò chuyện ấy? Biên bản họp, ý tưởng chia sẻ và tài liệu tham khảo được lưu là một phần câu trả lời.

Thoại song công thay đổi cách chờ lượt trong hội thoại

Full-duplex có nghĩa là hệ thống có thể nghe và nói cùng một lúc. OpenAI mô tả GPT-Live-1 theo cách này trong tài liệu mô hình hiện tại, cùng với khả năng ủy quyền lý luận và sử dụng công cụ cho tác nhân phụ trợ. Đó là tuyên bố về sự tương tác đồng thời chứ không phải là chứng chỉ dịch thuật hoàn hảo. Tài liệu về mẫu GPT-Live-1, được kiểm tra vào ngày 11 tháng 9 năm 2026.

Hãy tưởng tượng bạn đang sửa lỗi cho một trợ lý trong khi giải thích một kế hoạch: “Thực ra, khách hàng ở Madrid chứ không phải Thành phố Mexico.” Một giao diện nói hữu ích cần lưu ý sự điều chỉnh đó trước khi tiếp tục giả định sai. Nó cũng cần phân biệt sự điều chỉnh với một lời thừa nhận ngắn gọn, hay sự tạm dừng để suy nghĩ với lời mời tiếp quản. Chất lượng của cuộc trao đổi phụ thuộc vào những đánh giá nhỏ đó.

Các giao diện giọng nói cũ hơn thường làm cho cấu trúc theo lượt của chúng trở nên dễ thấy. Bạn nói, đợi hệ thống xử lý, nghe rồi thử lại. Quá trình xử lý nhanh hơn sẽ hữu ích nhưng việc tương tác vẫn có thể khiến bạn cảm thấy khó xử khi hệ thống đoán rằng bạn đã hoàn thành quá sớm. Thiết kế song công hoàn toàn giải quyết sự chồng chéo, thay vì coi mọi khoảnh khắc của lời nói như một thông điệp được đóng gọn gàng.

Đã có tín hiệu cụ thể, nếu có giới hạn, về lý do tại sao điều đó lại quan trọng. OpenAI báo cáo rằng công ty học ngôn ngữ Speak nhận thấy tình trạng gián đoạn trong quá trình tạm dừng suy nghĩ của người học ít hơn gần 80% trong các đánh giá ban đầu so với các hệ thống theo lượt trước đó. Đó là kết quả của đối tác do nhà cung cấp báo cáo, không phải là kết quả độc lập cho mọi ngôn ngữ hoặc cài đặt. Nó đo lường hành vi gián đoạn, không cải thiện 80% độ chính xác của bản dịch. Báo cáo ra mắt API của OpenAI, ngày 10 tháng 9 năm 2026.

Các con số rộng hơn mà OpenAI công bố cũng cho thấy cùng xu hướng, và cũng có cùng giới hạn. Theo OpenAI, GPT-Live-1 đạt điểm cao hơn GPT-Realtime-2.1 tới 30 điểm phần trăm trên Full Duplex Bench, bài kiểm tra về khoảng dừng, luân phiên lượt nói, ngắt lời và những phản hồi ngắn như “ừ”, “vâng” khi đang nghe. Khi kết hợp với GPT-6 Astra ở mức suy luận trung bình, mô hình này đứng đầu Tau3, bộ đánh giá chấm điểm các tác vụ chăm sóc khách hàng và ngân hàng bằng giọng nói theo Pass@1, bao gồm 97 tác vụ về kiến thức ngân hàng. Cả hai đều là đánh giá do chính OpenAI thực hiện về hành vi hội thoại và khả năng hoàn thành tác vụ; không cái nào là điểm độ chính xác của bản dịch. Tóm tắt đánh giá của OpenAI, ngày 10 tháng 9 năm 2026.

Đối với người nói ngôn ngữ thứ hai, việc tạm dừng suy nghĩ có thể chính xác là lúc việc tham gia trở nên khó khăn. Một trợ lý chờ đợi thích hợp sẽ rời khỏi phòng để tìm một từ. Một trợ lý chấp nhận sự điều chỉnh sẽ giúp việc thử ít tốn kém hơn. Đó là những lý do thực tế để bạn hào hứng với sự tương tác bằng giọng nói tự nhiên ngoài mức độ ấn tượng của một bản trình diễn.

Sự so sánh đơn giản giữa các lượt nói xen kẽ và nghe và nói chồng chéo, với sự điều chỉnh được kết hợp trong quá trình phản hồi

Chỉ tính thời gian theo khái niệm; các thanh không đại diện cho độ trễ đo được. Full-duplex mô tả đầu vào và đầu ra đồng thời, trong khi việc xử lý gián đoạn hữu ích vẫn phụ thuộc vào kiểu máy và ứng dụng.

Dịch trực tiếp và trợ lý hội thoại có vai trò khác nhau

Thông báo tháng 6 của Google mô tả tính năng dịch giọng nói liên tục trên hơn 70 ngôn ngữ. Mô hình tạo ra lời nói được dịch trong khi nghe, cân bằng giữa nhu cầu có thêm ngữ cảnh và việc ở gần người nói. Google cho biết nó vẫn chậm hơn một vài giây, đây là một kỳ vọng hữu ích hơn so với việc tưởng tượng độ trễ bằng 0. Bản phát hành dành cho nhà phát triển là bản xem trước công khai. Mô tả ra mắt Google, ngày 9 tháng 6 năm 2026.

Các con số về quy mô trong thông báo đó khá cụ thể. Tính năng dịch giọng nói trong Google Meet sẽ mở rộng từ 5 ngôn ngữ được hỗ trợ lên hơn 70, và từ chỗ chỉ dịch sang hoặc từ tiếng Anh lên hơn 2.000 tổ hợp ngôn ngữ trong cùng một cuộc họp. Tính năng này bắt đầu dưới dạng bản xem trước riêng tư cho một số khách hàng Workspace doanh nghiệp được chọn, rồi mới triển khai rộng hơn vào cuối năm 2026. Grab đang thử nghiệm mô hình cho việc đón khách giữa tài xế và hành khách, một tình huống có hơn 10 triệu cuộc gọi thoại mỗi tháng. Thông báo dẫn lời khen của đối tác về chất lượng, độ chính xác và độ trễ thấp nhưng không công bố điểm số cụ thể nào. Số liệu ra mắt của Google, ngày 9 tháng 6 năm 2026.

Có một sự khác biệt đáng được lưu ý. Hướng dẫn dịch trực tiếp của Google mô tả trình thông dịch xử lý luồng âm thanh liên tục, với cài đặt dành riêng cho bản dịch và không hỗ trợ các công cụ hoặc hướng dẫn chung. GPT-Live-1 là mô hình đàm thoại có thể hoạt động với một tác nhân riêng biệt. Một giúp chuyển ý nghĩa của người nói sang ngôn ngữ khác; người kia tham gia trao đổi. Chúng không nên được trình bày dưới dạng dịch vụ có thể hoán đổi cho nhau. Hướng dẫn dịch trực tiếp của Google, Tài liệu về mẫu của OpenAI, được kiểm tra vào ngày 11 tháng 9 năm 2026.

Cột mốc quan trọngNhững gì đã được công bốNhững gì nó không thiết lập
Google, ngày 9 tháng 6 năm 2026Gemini 3.5 Live Translate; dịch lời nói liên tục; bản xem trước công khai của nhà phát triểnChất lượng như nhau cho mọi cặp ngôn ngữ hoặc quyền truy cập ngay lập tức trong mọi sản phẩm Google
OpenAI, ngày 8 tháng 7 năm 2026Triển khai GPT-Live trong ChatGPT, với khả năng nghe và nói đồng thờiĐộ chính xác ở cấp độ thông dịch viên phổ quát
OpenAI, ngày 10 tháng 9 năm 2026Truy cập API GPT-Live-1 để xây dựng các ứng dụng thoạiTự động tích hợp vào mọi cuộc họp hoặc dịch vụ ghi chú

Phạm vi phát hành xuất phát từ ba thông báo được liên kết ở trên. Đây là dòng thời gian, không phải là xếp hạng hiệu suất.

Kết hợp lại với nhau, những bước phát triển này tạo nên một hướng đi hấp dẫn: việc dịch thuật có thể trở nên liên tục hơn và sự tương tác với trợ lý có thể trở nên ít cứng nhắc hơn. Việc kết nối những khả năng đó thành trải nghiệm cuộc họp đa ngôn ngữ đáng tin cậy vẫn là công việc của ứng dụng. Ai đó vẫn phải quyết định âm thanh của ai đang được diễn giải, kết quả sẽ đi đến đâu, cách xử lý các chỉnh sửa và những gì người tham gia nhìn thấy.

Những con số được công bố: 0,05 USD mỗi phút và không có điểm độ chính xác

Mỗi phút thoại GPT-Live-1 trên API có giá 0,05 USD, tính phí theo giây và không làm tròn lên thành cả phút. Mức giá này chỉ bao gồm lớp giọng nói phía trước; mô hình phụ trợ và các công cụ mà phiên hội thoại ủy quyền được tính phí riêng theo giá thông thường. Tài liệu mô hình của OpenAI, được kiểm tra vào ngày 11 tháng 9 năm 2026.

Phép tính rất đơn giản nhưng cũng dễ hiểu sai. Một phiên 30 phút tốn 1,50 USD cho thời gian lớp giọng nói, một giờ tốn 3,00 USD, và 100 giờ mỗi tháng là 300 USD, chưa tính phần suy luận phụ trợ. Nếu ứng dụng tạo một phiên riêng cho từng người tham gia cuộc họp, các con số này sẽ nhân lên theo số phiên. Thông báo tháng 6 của Google không nêu giá cho Gemini 3.5 Live Translate, nên bài viết này không so sánh chi phí giữa hai bên.

Số liệuGiá trịNguồn và ngàyĐiều được đo
Giá API GPT-Live-10,05 USD mỗi phút, tính phí theo giâyOpenAI, ngày 10 tháng 9 năm 2026Chỉ lớp giọng nói; mô hình phụ trợ và công cụ tính phí riêng
Full Duplex Bench+30 điểm phần trăm so với GPT-Realtime-2.1OpenAI, ngày 10 tháng 9 năm 2026Khoảng dừng, luân phiên lượt nói và ngắt lời, không phải dịch thuật
Tau3Đứng đầu, khi kết hợp với GPT-6 Astra (mức trung bình)OpenAI, ngày 10 tháng 9 năm 2026Mức hoàn thành tác vụ bằng giọng nói (Pass@1), gồm 97 tác vụ ngân hàng
Đánh giá ban đầu của SpeakÍt hơn gần 80% lần ngắt lời trong khoảng dừng suy nghĩOpenAI (trích lời đối tác), ngày 10 tháng 9 năm 2026Hành vi ngắt lời so với các hệ thống theo lượt trước đây
Mức dùng giọng nói trong ChatGPTHơn 150 triệu người mỗi tuầnOpenAI, ngày 8 tháng 7 năm 2026Mức sử dụng Voice và Dictation, không phải chất lượng
Gemini 3.5 Live Translate70+ ngôn ngữ, tự động nhận diệnGoogle, ngày 9 tháng 6 năm 2026Độ phủ ngôn ngữ, không phải chất lượng từng cặp
Dịch giọng nói trong Google Meet5 → 70+ ngôn ngữ; 2.000+ tổ hợp mỗi cuộc họpGoogle, ngày 9 tháng 6 năm 2026Nâng cấp theo kế hoạch, bắt đầu bằng bản xem trước riêng tư
Độ trễ dịch“Chỉ chậm hơn người nói vài giây”Google, ngày 9 tháng 6 năm 2026Mô tả của nhà cung cấp, không phải số liệu đo được

Mọi số liệu đều do nhà cung cấp tự báo cáo và lấy từ các thông báo, tài liệu được liên kết trong bài viết này. Không số liệu nào là điểm độ chính xác dịch thuật dạng số, chẳng hạn điểm đánh giá của con người hay chỉ số tự động cho một cặp ngôn ngữ.

Khoảng trống đó quan trọng nhất với những ai đang chọn công cụ cho cuộc họp đa ngôn ngữ. Các benchmark về tương tác cho bạn biết hệ thống có biết chờ, biết lắng nghe và lấy lại nhịp tốt hay không; chúng không cho biết chữ “thứ Hai” có còn đúng sau khi được dịch sang tiếng Hàn hay không. Lưu ý của OpenAI hồi tháng 7 về giọng không bản xứ ở một số ngôn ngữ, cùng việc Google không công bố điểm cho từng cặp ngôn ngữ, đều dẫn đến cùng một nguyên tắc thực tế: hãy thử chính những cặp ngôn ngữ nhóm bạn thực sự dùng trước khi dựa vào bất kỳ công cụ nào để ra quyết định.

Giảm rào cản ngôn ngữ bắt đầu từ việc dễ lên tiếng hơn

Hãy xem xét một cuộc họp giả định về dự án kéo dài 30 phút với bốn người cảm thấy thoải mái nhất với ba ngôn ngữ khác nhau. Lợi ích của việc dịch nói tốt hơn không chỉ đơn thuần là mỗi người nghe được nhiều từ hơn. Đó là nhóm có thể đặt những câu hỏi tiếp theo trước khi sự không chắc chắn trở thành sự hiểu lầm. Một ý tưởng thăm dò có thể được diễn đạt mà không cần trau chuốt sang ngôn ngữ thứ hai.

Điều đó làm thay đổi tính kinh tế của việc tham gia theo một nghĩa rất thông thường: đóng góp tốn ít công sức hơn. Người trầm tính và có kinh nghiệm liên quan sẽ có cách khác để tham gia cuộc thảo luận. Người chủ trì cuộc họp có thể dành ít thời gian hơn để xây dựng lại một câu bị gián đoạn. Việc làm rõ có thể diễn ra khi nó hữu ích, trong khi mọi người vẫn nhớ được điểm đang được thảo luận.

Tôi cho rằng điều đó sẽ quan trọng trong các nhóm làm việc từ xa, các cuộc thảo luận trong lớp, cuộc trò chuyện với khách hàng và trao đổi thân mật khi đi du lịch. Đây là những kỳ vọng về việc công nghệ có thể trợ giúp ở đâu, chứ không phải tuyên bố rằng mọi người đều có thể trải nghiệm giống nhau. Cặp ngôn ngữ, giọng nói, từ vựng, chất lượng micrô và sản phẩm xung quanh đều vẫn là một phần của kết quả.

Giọng nói tự nhiên cần được đánh giá riêng với độ chính xác về nghĩa. Trong bài giới thiệu tháng 7, OpenAI nêu rõ một số ngôn ngữ có thể mang giọng không bản xứ hoặc chưa đủ lưu loát. Vì vậy, cần thử những ngôn ngữ thực sự được sử dụng, thay vì suy rộng từ một bản trình diễn tiếng Anh trôi chảy. Đây là lưu ý lúc ra mắt, không phải kết quả đánh giá mới nhất cho mọi triển khai trong tháng 9. Thông báo trước về ngôn ngữ và giới thiệu về GPT-Live của OpenAI, ngày 8 tháng 7 năm 2026

Tham vọng đúng đắn là tham gia rộng rãi hơn với cách làm rõ dễ dàng. Ngày tháng, số tiền, tên người hoặc lời hứa có điều kiện phải dễ dàng kiểm tra. Hệ thống có thể tỏ ra tự tin trong khi người tham gia vẫn cần nói: “Xin hãy cho tôi xem câu đó”. Hiển thị văn bản và giữ lại bản gốc, nơi người tham gia đã đồng ý ghi âm, đưa ra yêu cầu đó ở đâu đó.

Cuộc họp trôi chảy vẫn cần ghi lại quyết định

Trở lại cuộc họp giả định: một người đề xuất phát hành vào thứ Sáu nếu đã hoàn tất kiểm tra bảo mật. Người khác muốn chọn thứ Hai để nhóm hỗ trợ có thêm thời gian chuẩn bị. Nhóm thống nhất thứ Hai và chỉ định người phụ trách, nhưng một điều kiện tiên quyết vẫn chưa được giải quyết. Bản tóm tắt chỉ giữ ngày thứ Sáu được đề xuất ban đầu đã bỏ lỡ quyết định của cuộc họp.

Nhịp điệu trò chuyện không được cải thiện sẽ loại bỏ sự khác biệt giữa gợi ý, điều kiện và quyết định. Những người làm việc trong cùng một ngôn ngữ cần phải phân biệt chúng. Sự tương tác đa ngôn ngữ làm cho việc duy trì đường dẫn từ tuyên bố ban đầu đến từ ngữ được dịch và hành động thống nhất cuối cùng trở nên có giá trị hơn.

Để có một bản ghi cuộc họp thực tế, tôi muốn độc giả lỡ cuộc gọi nhanh chóng tìm thấy ba điều: nhóm đã quyết định gì, ai chịu trách nhiệm cho bước tiếp theo và những câu hỏi nào vẫn còn bỏ ngỏ. Thời hạn chỉ nên được mô tả là đã được thỏa thuận khi nó được đồng ý. Nếu nguồn không rõ ràng, hồ sơ nên nêu rõ sự không chắc chắn đó thay vì biến nó thành một kết luận sai lầm.

Điều này không yêu cầu biến mọi cuộc hội thoại thành một kho lưu trữ đầy đủ. Một ghi chú quyết định ngắn gọn có thể hữu ích hơn các trang ghi chép không phân biệt. Mối quan hệ quan trọng là giữa tài khoản ngắn gọn và tài liệu hỗ trợ: từ ngữ gốc có liên quan, bản ghi âm khi có sẵn và được ủy quyền, và tài liệu mà nhóm đang thảo luận.

Mối liên kết ấy cũng giúp sửa sai dễ hơn. Người tham dự có thể chỉ ra câu nói gốc, chỉnh bản tóm tắt rồi chia sẻ quyết định đã sửa. Nếu thiếu liên kết, người tiếp theo có thể tiếp tục tóm tắt bản tóm tắt, biến hiểu lầm ban đầu thành điều tưởng như đã được xác nhận. Giao tiếp bằng giọng nói tốt hơn giúp cuộc trao đổi thuận lợi; bản ghi tốt giúp kiểm tra kết quả về sau.

Chia sẻ ý tưởng cần giữ cả nguồn tham khảo

Một ý tưởng hữu ích hiếm khi bắt đầu và kết thúc trong một cuộc gọi. Ai đó tìm thấy một bài báo, lưu một đoạn văn, đặt câu hỏi về nó và đưa câu hỏi đó đến một cuộc họp. Một người khác thêm một phản ví dụ từ một video hoặc một bài nghiên cứu. Bước tiếp theo phụ thuộc vào khả năng kết nối lại những phần đó sau khi cuộc trò chuyện kết thúc.

Đó là lý do việc lưu tư liệu web vẫn hữu ích dù AI thoại rất tốt. URL giúp quay lại bản gốc, đoạn được chọn chỉ ra phần quan trọng, còn ghi chú cá nhân giải thích vì sao nó đáng lưu. Mỗi yếu tố có một vai trò. Giữ chúng cùng nhau giúp truyền đạt ý tưởng đầy đủ hơn việc chuyển tiếp một đoạn văn AI đứng riêng lẻ.

Chỉ nói “Chúng ta nên đổi trải nghiệm ban đầu cho người dùng mới” chưa đủ để người khác tiếp tục công việc. “Bài viết này khiến chúng ta xem lại năm phút đầu tiên; đây là đoạn liên quan, cuộc thảo luận và thử nghiệm đã thống nhất” cung cấp cơ sở để xem xét. Đây là ví dụ giả định, nhưng khác biệt rất cụ thể: chỉ đưa kết luận là yêu cầu người khác tin; đưa cả lý do và nguồn giúp tiếp tục trao đổi.

Kỷ luật tương tự bảo vệ nguồn không bị mờ đi trong phần bình luận. Một trích dẫn phải được xác định là một trích dẫn. Bản dịch là sự diễn giải nguồn đó và bản tóm tắt cuộc họp là một dạng xem bắt nguồn khác. Việc giữ những vai trò đó rõ ràng cho phép mọi người không đồng ý một cách hiệu quả mà không cần phải xây dựng lại những gì bất kỳ ai đã nói ban đầu.

Bản ghi nguồn hoặc đoạn văn được chọn vẫn được kết nối với bản dịch, ghi chú quyết định và ý tưởng có thể chia sẻ

Quy trình làm việc được đề xuất ban đầu. Bảo toàn tài liệu nguồn được ủy quyền, làm cho văn bản phái sinh có thể sửa được và giữ kết nối hiển thị khi chia sẻ. Sơ đồ không khẳng định rằng ngày nay mọi liên kết đều là một tính năng tự động.

Bối cảnh cần được giữ lại sau cuộc gọi

Hệ thống giọng nói cũng bắt đầu tách cuộc trò chuyện khỏi công việc diễn ra đằng sau nó. Tài liệu ủy quyền của OpenAI giải thích rằng bài phát biểu trực tiếp và công việc được ủy quyền có thể tiếp tục độc lập; phản hồi phụ trợ hoàn chỉnh không chứng minh rằng người dùng đã nghe thấy câu trả lời. Đây là một lời nhắc nhở kỹ thuật hữu ích về một vấn đề rộng hơn của sản phẩm: trải nghiệm được nói ra và kết quả lâu dài là những điều riêng biệt cần xác minh. Tài liệu ủy quyền của OpenAI, được kiểm tra ngày 11 tháng 9 năm 2026.

Đối với người dùng hàng ngày, câu hỏi đơn giản hơn. Khi cuộc gọi kết thúc, tôi có thể tìm thấy quyết định vào ngày mai không? Một đồng nghiệp có thể hiểu tại sao chúng tôi làm được điều đó không? Tôi có thể quay lại bài viết thách thức giả định của chúng tôi mà không cần tìm kiếm trong lịch sử trò chuyện, trình duyệt và bản ghi không? Những câu hỏi đó vẫn còn ngay cả khi mỗi câu được diễn giải hay.

Có lý do để lạc quan về việc rào cản ngôn ngữ ngày càng trở nên ít chi phối hơn. Chúng ta nên hoan nghênh các công cụ cho phép nhiều người đóng góp một cách thoải mái hơn. Kỳ vọng của tôi là cuộc trò chuyện dễ dàng hơn sẽ nâng cao giá trị của việc kết nối những gì chúng ta nói với những gì chúng ta lưu giữ, chia sẻ và cuối cùng là làm. Cuộc gặp gỡ không nhất thiết phải tồn tại mãi mãi; kết quả hữu ích của nó sẽ tồn tại trong cuộc gọi.


Hướng đi chúng tôi mong muốn cho Telli.sh

Với Telli.sh, hướng đi là giúp biến trò chuyện và khám phá thành kiến thức có thể tìm lại để sử dụng. Hiện sản phẩm tập hợp ghi chú, bản ghi âm, bản dịch và Clip trong một không gian. Chúng tôi muốn củng cố liên kết giữa các tư liệu, để biên bản họp, ý tưởng và nguồn của nó không lại bị phân tán.

Chúng tôi muốn một quy trình liền mạch: ghi lại cuộc trò chuyện khi được phép, kiểm tra điểm quan trọng, làm rõ quyết định và chia sẻ ý tưởng cùng tài liệu hỗ trợ. Nếu cuộc trao đổi bắt đầu từ một trang web, Clip cần giúp giữ URL và phần bối cảnh người dùng chọn lưu. Nếu bản dịch giúp hiểu nội dung, bản gốc vẫn phải sẵn có để đối chiếu và sửa.

Đây là định hướng sản phẩm, không phải thông báo Telli.sh đã tích hợp GPT-Live-1 hay Gemini 3.5 Live Translate. Những tính năng thoại tương lai cần chứng minh giá trị thực tế giữa các ngôn ngữ, tạo bản ghi đáng tin cậy và cho người dùng kiểm soát rõ nội dung được lưu. Tiến bộ của mô hình phải làm không gian làm việc hữu ích hơn mà không khiến kiến thức cá nhân phụ thuộc vào một mô hình duy nhất.

Khi trò chuyện giữa các ngôn ngữ dễ hơn, chúng tôi càng muốn giúp giá trị của những cuộc trao đổi ấy được giữ lâu hơn. Hãy bắt đầu từ một cuộc họp đáng nhớ, một ý tưởng muốn chia sẻ hoặc một nguồn tài liệu sẽ cần xem lại.

Tạo không gian Telli.sh và lưu lại điều quan trọng


Quay lai blog