speech-to-textDoc trong 20 phut

Nhận dạng giọng nói đã lặng lẽ mở trọng số — và chỉ nặng 1,56 GB

Các mô hình Qwen3-ASR của Alibaba dùng giấy phép Apache 2.0, hỗ trợ 52 ngôn ngữ và phương ngữ, tải về chưa tới hai gigabyte. Một hướng dẫn dễ hiểu về tầng phiên âm mở trọng số: hiện có những gì, chạy mô hình trên máy tính của chính bạn thực sự được gì, và các API đóng vẫn thắng ở đâu.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

Nhóm Qwen của Alibaba đang để trên Hugging Face ba mô hình nhận dạng giọng nói mà gần như không ai viết về chúng. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B, cùng một mô hình đi kèm tên là Qwen3-ForcedAligner-0.6B, tất cả đều theo giấy phép Apache 2.0. Cái nhỏ nhất tải về nặng 1,56 GB, xử lý được 52 ngôn ngữ và phương ngữ, và từ ngày 26 tháng 6 thì chạy được bằng ba dòng Python tiêu chuẩn. Bạn đặt nó lên một cỗ máy vốn đã có sẵn, và không ai gửi hóa đơn cho bạn được.

Khuôn mẫu này khó mà bỏ sót, vì chúng ta đã xem nó diễn ra một lần rồi. Suốt 2023 và 2024, các mô hình ngôn ngữ lớn là thứ người ta thuê qua API, rồi tầng mô hình mở trọng số xuất hiện và trở thành lựa chọn mặc định cho bất kỳ ai quan tâm tới chi phí, quyền riêng tư, hoặc khả năng chạy ngoại tuyến. Phiên âm giờ đang đi đúng con đường đó, chậm hơn khoảng hai năm.

Bài viết này là tấm bản đồ cho những ai không theo dõi các đợt ra mắt mô hình như một nghề: mô hình giọng nói mở trọng số là gì, hiện có những mô hình nào và theo giấy phép ra sao, "0.6B trên laptop" thực tế mang lại điều gì, và — phần mà hầu hết các bài báo bỏ qua — các API đóng được lưu trữ sẵn vẫn thắng rõ rệt ở đâu.

TL;DR:

  • Phiên âm mở trọng số đã dùng được ngay hôm nay: Qwen3-ASR theo Apache 2.0 với 52 ngôn ngữ và phương ngữ, Whisper theo MIT, Parakeet và Canary của NVIDIA theo CC BY 4.0, Voxtral của Mistral theo Apache 2.0.
  • Tự vận hành mang lại quyền riêng tư, hoạt động ngoại tuyến và kiểm soát chi phí. Trên bảng xếp hạng độc lập Artificial Analysis, lưu trữ một mô hình mở tốn 1,50 đô la cho mỗi 1.000 phút, so với 6,00 đô la của MAI-Transcribe-1.5 của Microsoft và 18,15 đô la của Gemini 3.1 Pro Preview.
  • Vị trí số một về độ chính xác vẫn là một điểm cuối bản xem trước đóng. Nhưng một mô hình mở theo Apache 2.0 là Voxtral Small đã đứng thứ năm, chỉ cách khoảng một điểm phần trăm tỷ lệ lỗi từ.

Dạng sóng và phổ đồ của một câu nói, mỗi từ được canh thẳng phía trên đoạn âm thanh tương ứng

Hình: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Dạng sóng và phổ đồ của câu "it rains a lot in Portland", các chữ cái được đặt ngay phía trên đoạn âm thanh tương ứng — đây chính là nguyên liệu thô mà mọi mô hình nhận dạng giọng nói phải xử lý.

Bạn thực sự tải về cái gì khi tải một mô hình phiên âm

Mô hình ASR — nhận dạng giọng nói tự động, dùng thay thế cho STT hay chuyển giọng nói thành văn bản — là một chương trình nhận âm thanh vào và cho ra văn bản. Công việc chỉ có vậy. Nó không xác định ai đã nói, không tóm tắt, không biết cuộc họp của bạn bàn về chuyện gì. Nó nghe từ ngữ và chép lại.

"Mở trọng số" nghĩa là phòng thí nghiệm đã công bố chính tệp mô hình hoàn chỉnh. Trọng số của một mô hình là lưới số khổng lồ mà nó học được trong quá trình huấn luyện, và công bố chúng nghĩa là bạn tải tệp đó về, chạy trên phần cứng của mình và xây dựng bên trên mà không phải xin phép ai hay trả tiền theo lượt gọi. Phía ngược lại là mô hình đóng: trọng số nằm trên máy chủ của nhà cung cấp, còn bạn thuê quyền truy cập qua API — âm thanh gửi lên, văn bản trả về, tính tiền theo phút.

Con số trong tên là số tham số, và với mô hình giọng nói thì con số này cụ thể một cách khác thường. "0.6B" nghĩa là khoảng 600 triệu tham số, trên thực tế khiến Qwen3-ASR-0.6B là một tệp 1,56 GB và Qwen3-ASR-1.7B là 4,08 GB — cả hai đều đủ nhỏ để nằm trên ổ SSD laptop mà chẳng ai để ý. Hãy so với các mô hình ngôn ngữ mở mà chúng tôi đã viết trong bài tổng hợp về Trung Quốc, nơi bản phát hành chủ lực nặng 1,56 terabyte chia thành 96 mảnh và cần cả một cụm máy chỉ để nạp. Mô hình giọng nói nhỏ hơn mô hình văn bản tiên tiến khoảng một nghìn lần, và riêng sự thật đó giải thích vì sao bước chuyển này ở đây có sức nặng hơn hồi đó.

Đây là thuật ngữ chúng tôi sẽ dùng suốt phần còn lại: hạng laptop. Đó là nhóm mô hình mà câu hỏi về phần cứng đơn giản là biến mất — nơi "tôi chạy nổi cái này không?" thôi là một cuộc bàn ngân sách và trở thành một lượt tải về. Mô hình văn bản phần lớn không nằm trong đó. Mô hình giọng nói thì gần như tất cả đều nằm trong.

Còn một dòng nữa nên đọc trước mọi điểm chuẩn: giấy phép. Apache 2.0 và MIT nằm ở đầu dễ dãi — dùng, sửa, đưa vào sản phẩm thương mại, không nợ ai gì cả. CC BY 4.0 mà NVIDIA dùng cũng cho phép dùng thương mại nhưng yêu cầu ghi công.

Qwen phát hành họ mô hình này từ tháng Giêng; tháng Sáu mới là lúc nó trở nên dễ dùng

Giờ đến đợt phát hành đã thôi thúc bài viết này, kèm một đính chính về cách nó được mô tả. Họ mô hình Qwen3-ASR không xuất hiện vào tháng Sáu. Các kho lưu trữ gốc lên mạng ngày 28 tháng 1 năm 2026, và báo cáo kỹ thuật lên arXiv ngay hôm sau. Điều xảy ra ngày 26 tháng 6 là Qwen công bố phiên bản -hf của cả ba mô hình — những điểm kiểm tra chạy nguyên bản trong Hugging Face Transformers từ phiên bản 5.13.0 trở đi.

Nghe như một chú thích nhưng không phải. Trước đó, muốn chạy mô hình thì phải cài gói riêng qwen-asr hoặc một backend vLLM và học cả bộ công cụ đi kèm. Sau đó, chỉ còn ba dòng Python tiêu chuẩn mà bất kỳ lập trình viên nào từng đụng tới Transformers đều đã biết. Rào cản khiến phần lớn mô hình mở nằm không hiếm khi là bản thân mô hình. Đó là bốn mươi phút vật lộn với môi trường trước khi có bản phiên âm đầu tiên, và đó chính là thứ ngày 26 tháng 6 đã xóa bỏ.

Thông số lấy thẳng từ thẻ mô hình. Cả hai kích cỡ đều nhận diện ngôn ngữ và nhận dạng giọng nói cho 30 ngôn ngữ — tiếng Anh, tiếng Trung, tiếng Hàn, tiếng Nhật, tiếng Tây Ban Nha, tiếng Ả Rập, tiếng Hindi, tiếng Thái, tiếng Việt, tiếng Ba Lan và hai mươi ngôn ngữ nữa — cộng thêm 22 phương ngữ tiếng Trung, và đó là cách ra con số "52 ngôn ngữ và phương ngữ". Cả hai đều chạy suy luận theo luồng và ngoại tuyến từ một mô hình duy nhất, điều này hiếm hơn ta tưởng: nhiều mô hình phiên âm chỉ làm được một trong hai. Cả hai đều nhận âm thanh dài, và thẻ mô hình liệt kê cả giọng hát lẫn bài hát có nhạc nền trong số các loại âm thanh được hỗ trợ.

Mô hình thứ ba đáng để dừng lại. Qwen3-ForcedAligner-0.6B làm việc canh chỉnh cưỡng bức: đưa cho nó âm thanh và một bản phiên âm, nó sẽ đánh dấu mỗi từ bắt đầu và kết thúc ở đâu, chính xác tới mili giây, cho 11 ngôn ngữ và tối đa năm phút lời nói mỗi lần. Đó là bộ máy đứng sau các bản phiên âm bấm được, việc canh giờ phụ đề, và khả năng nhảy thẳng tới khoảnh khắc ai đó nói một câu. Đúng là thứ mà tấm hình đầu bài này thể hiện. Công bố một bộ canh chỉnh cùng với bộ nhận dạng là tín hiệu về việc bản phát hành này nhắm tới ai: không phải người chạy thử demo, mà người xây sản phẩm.

Về chất lượng, cần tách bạch ai đang khẳng định điều gì. Thẻ mô hình của chính Qwen dẫn số liệu từ Hugging Face Open ASR Leaderboard đề ngày 26 tháng 6 năm 2026: tỷ lệ lỗi từ trung bình 5,59 % cho mô hình 1.7B và 6,31 % cho 0.6B, còn ở tập âm thanh cuộc họp AMI là 9,26 % và 10,57 %. Tỷ lệ lỗi từ là phần trăm số từ mô hình nghe sai, nên càng thấp càng tốt, và AMI là con số khó nhất trong đó vì các cuộc họp thật thì lộn xộn. Qwen cũng gọi bản 1.7B là "tân tiến nhất trong các mô hình ASR mã nguồn mở" và cạnh tranh được với các API thương mại — hãy coi đó là tuyên bố của nhà cung cấp cho tới khi có ai đó ngoài Alibaba đo đạc. Và lưu ý thêm: đây là điểm chuẩn khác với bảng xếp hạng độc lập ở phần dưới, trên tập âm thanh khác, nên hai bộ số không thể đem so với nhau.

Whisper đã khởi đầu chuyện này, và vẫn là mô hình ai cũng chạy

Không có Whisper của OpenAI thì mọi thứ đã không có hình dạng như bây giờ. Kho mã được mở công khai ngày 16 tháng 9 năm 2022 theo giấy phép MIT — cả mã lẫn trọng số — vào thời điểm mà nhận dạng giọng nói nghiêm túc đồng nghĩa với một hợp đồng với nhà cung cấp đám mây. Từ đó tới nay nó đã gom được 106.679 sao trên GitHub.

Điều làm Whisper trở nên quan trọng ít nằm ở bản thân mô hình hơn là ở những gì cộng đồng dựng lên trên nó chỉ trong vài tháng. whisper.cpp viết lại nó bằng C và C++ thuần, giấy phép MIT, 52.591 sao, và khiến nó chạy được trên laptop lẫn điện thoại mà không cần Python cũng chẳng cần GPU. faster-whisper dựng lại nó trên CTranslate2 với mức cải thiện lớn về tốc độ và bộ nhớ, cũng MIT, 24.750 sao. Mô hình là hạt giống; hệ sinh thái mới là cái cây.

Bốn năm sau, nó vẫn là mô hình giọng nói được dùng nhiều nhất thế giới. Trong 30 ngày qua, whisper-large-v3-turbo được tải 8,72 triệu lượt từ Hugging Face và whisper-large-v3 là 5,50 triệu — số liệu chúng tôi lấy ngày 5 tháng 8 năm 2026. Qwen3-ASR-0.6B với 4,29 triệu đang lên nhanh so với một mô hình mới sáu tháng tuổi, nhưng lựa chọn mặc định mà cả ngành với tay lấy không cần nghĩ vẫn là Whisper. Có điều độ chính xác của nó đã già đi: trên bảng của Artificial Analysis, Whisper Large v3 đạt AA-WER 4,07 % so với 1,73 % của quán quân hiện tại. Vậy mà rất nhiều sản phẩm đang bán vẫn chạy nó.

Dòng thời gian các mô hình nhận dạng giọng nói mở, từ Whisper tháng 9 năm 2022 đến Qwen3-ASR năm 2026

Tầng giọng nói mở đến theo hai đợt cách nhau ba năm, giữa hai đợt gần như trống. Ngày phát hành lấy từ GitHub và Hugging Face, truy xuất ngày 5 tháng 8 năm 2026.

Phía mở không chỉ có một phòng thí nghiệm

Qwen không đơn độc, và những cái tên còn lại giỏi ở những chỗ khác nhau rõ rệt.

Dòng Parakeet của NVIDIA đặt cược vào tốc độ. parakeet-tdt-0.6b-v3, ra mắt tháng 8 năm 2025 theo CC BY 4.0, là mô hình 600 triệu tham số phủ 25 ngôn ngữ châu Âu, có sẵn tự động nhận diện ngôn ngữ, dấu câu, viết hoa và dấu thời gian ở mức từ, và nuốt trọn tới 24 phút âm thanh trong một lượt. Dòng Canary của NVIDIA — canary-1b-v2canary-qwen-2.5b, cũng CC BY 4.0 — phủ địa hạt tương tự bằng những đặt cược kiến trúc khác. Các mô hình Voxtral của Mistral ra mắt tháng 7 năm 2025 theo Apache 2.0, và quan trọng vì một lý do mà ta sẽ nói ngay sau đây.

Đây là phía mở đặt cạnh nhau, hàng cuối là một API lưu trữ sẵn để đối chiếu.

Mô hìnhTải vềGiấy phépNgôn ngữChạy trênMạnh nhất ở
Whisper Large v33,09 GBMIT99Laptop hoặc một GPULà lựa chọn mặc định mà mọi công cụ đã hỗ trợ
Qwen3-ASR-0.6B1,56 GBApache 2.052 kể cả phương ngữLaptopĐa ngôn ngữ ở kích cỡ nhỏ nhất
Qwen3-ASR-1.7B4,08 GBApache 2.052 kể cả phương ngữLaptop hoặc một GPUĐộ chính xác cao nhất trong họ Qwen
Parakeet TDT 0.6B v32,51 GBCC BY 4.025 ngôn ngữ châu ÂuLaptop hoặc một GPUTốc độ và dấu thời gian theo từ
Voxtral SmallApache 2.0GPU máy chủ, 24 tỷ tham sốĐiểm cao nhất của mô hình mở trên bảng độc lập
API lưu trữ sẵnKhông tải về đượcĐóngTùy nhà cung cấpĐám mây của nhà cung cấpPhân tách người nói, truyền luồng, thời gian hoạt động

Dung lượng tải về là checkpoint mặc định trong mỗi kho Hugging Face; "—" đánh dấu giá trị chúng tôi không xác nhận được từ nguồn gốc. Truy xuất ngày 5 tháng 8 năm 2026.

Rồi còn lớp công việc đóng gói đưa các mô hình này lên thiết bị thật, đúng chỗ mà hạng laptop thôi là lý thuyết. whisperkit-coreml — Whisper biên dịch cho phần cứng Apple — được tải 8,31 triệu lượt trong 30 ngày qua. Một bản dựng MLX của Parakeet cho Apple Silicon đạt 1,87 triệu, và hai bản chuyển đổi GGUF — định dạng lượng tử hóa giúp mô hình chạy trên CPU thường — đạt 2,04 triệu và 1,87 triệu. Mỗi tháng có hàng triệu người tải về phần mềm nhận dạng giọng nói được đóng gói riêng để chạy trên máy của chính họ. Đó không phải chuyện lạ trong nghiên cứu. Đó là một kênh phân phối.

Vị trí số một vẫn là điểm cuối bản xem trước mà bạn không tải về được

Đây là chỗ bắt đầu phần tính toán trung thực, và nó cắt vào cả hai phía.

Chúng tôi lấy bảng xếp hạng chuyển giọng nói thành văn bản của Artificial Analysis ngày 5 tháng 8 năm 2026 — một điểm chuẩn độc lập đo cả mô hình mở lẫn mô hình đóng trên cùng tập âm thanh, khác với bảng của Hugging Face vốn chỉ dành cho mô hình mở. Đỉnh của chỉ số AA-WER như sau:

HạngMô hìnhAA-WERTải về được?
1Fun-Realtime-ASR-preview1,73 %Không — điểm cuối bản xem trước
2Scribe v2, ElevenLabs2,18 %Không — API lưu trữ sẵn
3MAI-Transcribe-1.5, Microsoft2,38 %Không — API lưu trữ sẵn
4Smallest AI Pulse Pro2,43 %Không — API lưu trữ sẵn
5Voxtral Small, Mistral2,77 %Có — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %Không — API lưu trữ sẵn
11Whisper Large v34,07 %Có — MIT

Nguồn: bảng xếp hạng chuyển giọng nói thành văn bản của Artificial Analysis, AA-WER v2, lấy ngày 5 tháng 8 năm 2026. Khả năng tải về được đánh giá theo giấy phép công bố của từng mô hình.

Hãy đọc bốn dòng đầu trước, vì chúng đính chính mọi câu chuyện cho rằng phía mở đã thắng. Những mô hình giọng nói điểm cao nhất thế giới đều là thứ đi thuê, và quán quân thậm chí còn chưa mở rộng rãi — nó là một điểm cuối bản xem trước.

Giờ hãy đọc dòng thứ năm, vì nó đính chính chính lời đính chính trên. Voxtral Small theo Apache 2.0. Bạn có thể tải về, chạy trên phần cứng của mình, và đưa vào sản phẩm thương mại — vậy mà nó đứng thứ năm trên một bảng độc lập với 2,77 %, cách một mô hình đóng dạng xem trước chừng một điểm phần trăm tỷ lệ lỗi từ. Quy ra một cuộc họp một tiếng dài 6.300 từ, khoảng cách đó là chừng 66 từ. Có thật, nhưng không phải vực sâu như cách người ta hay dựng lên.

Nhận định của chúng tôi: tóm tắt chính xác không phải là "STT mở còn kém xa". Các mô hình giọng nói mở đã vượt ngưỡng đủ dùng cho phần lớn công việc từ lâu, và lợi thế còn lại của phía đóng là một điểm phần trăm tỷ lệ lỗi cộng với sản phẩm bọc quanh nó. Điều đó dẫn ta tới sự đánh đổi thực sự quyết định.

Tự chạy thì được gì và mất gì

Có ba thứ đẩy các đội nhóm về phía tự vận hành, và không thứ nào là độ chính xác.

Quyền riêng tư là thứ nhất và thường mang tính quyết định. Nếu bạn phiên âm buổi khám bệnh, phỏng vấn pháp lý hay các cuộc trao đổi nhân sự, "âm thanh không rời khỏi phần cứng của chúng tôi" không phải sở thích mà là yêu cầu mua sắm, và mô hình do bạn tự vận hành là kiến trúc duy nhất đáp ứng gọn ghẽ điều đó. Hoạt động ngoại tuyến là thứ hai: mô hình nằm trên thiết bị vẫn chạy trên máy bay, dưới tầng hầm, giữa xưởng sản xuất, ở hiện trường không sóng. Chính vì thế mà whisper.cpp và các bản dựng GGUF có lượt tải như hiện nay.

Chi phí là thứ ba, và các con số ở đây khá phũ. Vẫn từ ảnh chụp của Artificial Analysis, giá cho mỗi 1.000 phút âm thanh: Whisper Large v3 chạy trên fal.ai là 0,50 đô la, Canary Qwen 2.5B của NVIDIA trên Replicate là 0,74, Parakeet TDT 0.6B V3 trên Together AI là 1,50. Phía đóng thì Nova-3 của Deepgram là 4,30, MAI-Transcribe-1.5 là 6,00, còn Gemini 3.1 Pro Preview là 18,15. Đó là chênh 4 lần so với Microsoft và 12 lần so với Google, chỉ tính riêng việc chạy một mô hình mở trên máy chủ của người khác — chưa xét tới chuyện chạy trên máy của chính bạn, nơi chi phí biên của giờ thứ một nghìn là tiền điện.

Tốc độ cũng chia theo hướng đó, và đây là chi tiết khiến chúng tôi bất ngờ nhất. Mô hình nhanh nhất trên toàn bảng là Parakeet TDT 0.6B V3 chạy trên Together AI, đạt 885 lần thời gian thực — một giờ âm thanh trả về sau khoảng bốn giây. Nova-3 của Deepgram đạt 512x, Whisper Large v3 trên Together 478x, MAI-Transcribe-1.5 189x. Lựa chọn phiên âm nhanh nhất hiện có là một mô hình mở trọng số 600 triệu tham số mà ai cũng tải về được.

So sánh hai cột giữa tự vận hành mô hình mở và dùng API phiên âm lưu trữ sẵn

Cuộc đánh đổi chưa bao giờ là độ chính xác đấu với độ chính xác. Đó là quyền kiểm soát và chi phí đấu với những tính năng bọc quanh phần nhận dạng.

Vậy các API lưu trữ sẵn còn bán gì? Bán tất cả những gì không phải nhận dạng. Tài liệu của Deepgram là một bản kiểm kê sòng phẳng: phân tách người nói, truyền theo luồng thời gian thực, định dạng, từ vựng tùy chỉnh, che thông tin định danh, phát hiện ngôn ngữ, và bảo đảm vận hành rằng dịch vụ vẫn sống trong lúc bạn ngủ. Tải Qwen3-ASR về, bạn có từ ngữ và dấu thời gian. Không nhãn người nói, không SLA, và hóa đơn GPU, việc mở rộng quy mô cùng cú gọi lúc ba giờ sáng đều là của bạn.

Mô hình được tải nhiều nhất trong hạng mục này lại không phải mô hình phiên âm

Có một con số buộc mọi thứ lại với nhau, và chúng tôi đã không lường trước.

Khi sắp xếp toàn bộ hạng mục nhận dạng giọng nói tự động trên Hugging Face theo lượt tải, mô hình đứng đầu không phải Whisper, không phải Qwen, cũng chẳng phải Parakeet. Đó là pyannote/speaker-diarization-3.1 với 8,91 triệu lượt tải trong 30 ngày qua, và một mô hình phân tách người nói khác của pyannote đứng thứ năm với 5,26 triệu. Phân tách người nói là bộ máy xác định ai đã nói vào lúc nào — chính là tầng ngay phía trên phiên âm.

Sơ đồ các tầng phiên âm từ âm thanh đến ghi chú cuộc họp, đánh dấu tầng nào đã có mô hình mở

Mô hình mở nay đã phủ hai tầng dưới cùng. Những tầng quyết định bản ghi chú có dùng được hay không nằm ở phía trên.

Mô hình được săn đón nhất trong hạng mục nhận dạng giọng nói lại không nhận dạng giọng nói. Nó trả lời một câu hỏi mà các bộ nhận dạng bỏ ngỏ, cũng chính là kết luận chúng tôi rút ra khi nhìn từ phía đóng của thị trường, lúc mô hình điểm cao nhất thế giới ra mắt mà không có nhãn người nói. Hai điểm nhìn hoàn toàn khác nhau, cùng một phát hiện: nghe ra từ ngữ là phần đã được giải quyết.

Chốt lại

Câu hỏi thú vị về nhận dạng giọng nói mở trọng số chưa bao giờ là "nó có tốt bằng các mô hình đóng không". Nó chỉ kém chừng một điểm phần trăm tỷ lệ lỗi từ, nó nhanh hơn, rẻ hơn từ bốn tới mười hai lần, và nằm gọn trên một chiếc laptop. Câu hỏi thú vị là bạn sẽ xây gì trong khoảng trống mở ra khi phiên âm thôi là một khoản chi đi thuê — bởi một tệp 1,56 GB nghe được 52 ngôn ngữ không phải là sản phẩm. Nó là một linh kiện vừa trở nên miễn phí.

Với một đội đang chọn công cụ ghi chú cuộc họp chứ không phải chọn mô hình, phần cần đọc rất ngắn. Việc một sản phẩm chạy mô hình mở hay API đóng giờ phần lớn chỉ là chi tiết triển khai, và ngày càng sẽ là cả hai: trọng số mở cho phần việc khối lượng lớn, API lưu trữ sẵn ở những chỗ mà phân tách người nói, truyền luồng và quy mô xứng với giá tiền. Telli.sh vốn đã chạy một mô hình mở ở tầng tóm tắt, nên mọi tiến bộ ở phía mở chảy thẳng vào phiên âm, dịch thuật và ghi chú cuộc họp mà không đổi giá. Hãy đánh giá công cụ bằng thứ đi ra ở cuối: bản ghi chú có cho bạn biết ai đã nhận làm việc gì hay không.

Bắt đầu ghi chú AI trực tiếp

Nguồn


Quay lai blog