120 phút miễn phí không chứa nổi một cuộc phỏng vấn: phiên âm AI miễn phí thực sự cho bạn gì với tiếng Indonesia
Gói miễn phí của Notta cho 120 phút phiên âm mỗi tháng và giới hạn mỗi bản ghi chỉ 3 phút. TurboScribe cho 3 tệp mỗi ngày với trần 30 phút. API của Google đưa bạn 60 phút miễn phí và không có giao diện nào. Ngày 7 tháng 8 năm 2026, Deepgram phát hành mô hình tiếng Indonesia cải tiến — chỉ trên đường batch. Một bảng so sánh đã kiểm chứng về các gói miễn phí mà nhà báo, nhà nghiên cứu hay người phỏng vấn nhân sự ở Indonesia thực sự gặp phải, cùng những giới hạn không nơi nào quảng cáo.
Bạn có một cuộc phỏng vấn dài 47 phút nằm trong điện thoại. Một nguồn tin ở Surabaya, ghi âm sáng nay, chủ yếu bằng tiếng Indonesia với vài từ tiếng Anh rải rác như thường lệ — deadline, stakeholder, follow up. Bạn cần bản gỡ băng ngay hôm nay, và rất muốn không phải trả tiền cho nó.
Thế là bạn tìm kiếm, gặp một công cụ quảng cáo 120 phút phiên âm miễn phí mỗi tháng, rồi đăng ký. Tệp 47 phút của bạn nằm gọn trong 120. Rồi phần tải lên báo lỗi, và chôn sâu trong bảng so sánh gói là một con số thứ hai chẳng ai đưa lên tiêu đề: phiên âm tối đa mỗi bản ghi, 3 phút.
Cả nhóm sản phẩm này đều mang đúng hình dạng đó. Gói miễn phí được quảng cáo bằng con số nghe hào phóng nhất, rồi bị chặn bởi một con số khác nằm dưới ba dòng. Bài này là bảng so sánh mà chúng tôi ước gì đã có sẵn: mỗi gói miễn phí thực sự cho một cuộc phỏng vấn tiếng Indonesia được gì, âm thầm từ chối điều gì, và làm sao kiểm tra bất kỳ gói nào trong năm phút trước khi bạn cam kết.
Tóm tắt nhanh
- Gói miễn phí có ba trần độc lập với nhau — phút mỗi tháng, phút mỗi tệp, và số tệp mỗi ngày — và cái làm hỏng các cuộc phỏng vấn gần như luôn là trần theo tệp, chứ không phải tổng phút hằng tháng.
- Nhận dạng giọng nói tiếng Indonesia đã thực sự tốt lên trong tháng này: Deepgram phát hành mô hình Nova-3 tiếng Indonesia nâng cấp vào ngày 7 tháng 8 năm 2026, nhưng chỉ trên đường batch, không phải streaming. Tải bản ghi lên thì được lợi; phụ đề trực tiếp thì không.
- Không bảng xếp hạng công khai nào đo độ chính xác tiếng Indonesia. Open ASR Leaderboard mới thêm ngôn ngữ Nam bán cầu đầu tiên vào ngày 28 tháng 8 năm 2026, và đó là tiếng Hindi. Chừng nào điều đó chưa đổi, đoạn thử 5 phút của chính bạn là phép đo duy nhất mô tả đúng âm thanh của bạn.
Các gói miễn phí, đặt cạnh nhau
Mọi con số dưới đây đều lấy từ trang giá hoặc tài liệu do chính nhà cung cấp công bố, truy cập ngày 31 tháng 8 năm 2026. Công việc tham chiếu là một cuộc phỏng vấn hai người dài 47 phút, vì đó là tệp mà người ta thực sự có.
| Công cụ | Gói miễn phí | Tệp đơn dài nhất, miễn phí | Tiếng Indonesia | Mức trả phí thấp nhất |
|---|---|---|---|---|
| Notta | 120 phút/tháng, 50 lượt tải lên/tháng, 10 bản tóm tắt AI/tháng, 1 chỗ ngồi | 3 phút | Chưa xác nhận | Pro 8,17 $/tháng trả theo năm — 1.800 phút/tháng, tệp tới 5 giờ |
| TurboScribe | 3 bản phiên âm mỗi ngày, ưu tiên hàng đợi thấp hơn | 30 phút | Có | Unlimited 10 $/tháng, 120 $ trả theo năm — tệp tới 10 giờ |
| Transkriptor | Không công bố phút miễn phí hằng tháng | — | Có | Lite 9,99 $/tháng — 300 phút/tháng |
| Maestra | Không công bố phút miễn phí hằng tháng | — | Có | Trả theo mức dùng 12 $ cho 60 phút; Lite 23 $/tháng — 180 phút/tháng |
| Google Cloud Speech-to-Text | 60 phút/tháng, sau đó 0,016 $/phút | Gần như không giới hạn | Có, id-ID | 0,016 $/phút khi bật ghi nhật ký dữ liệu, 0,024 $/phút khi tắt |
| API phiên âm của OpenAI | Không có | Gần như không giới hạn | Có | 0,006 $/phút (gpt-4o-transcribe), 0,003 $/phút (mini) |
| Whisper, tự dựng máy chủ | Không giới hạn, giấy phép MIT | Tùy phần cứng của bạn | Có | Phần mềm miễn phí, chi phí GPU của chính bạn |
| Telli.sh | 60 phút/tháng | Trong phạm vi hạn mức | Có | Gói trả phí bắt đầu từ 300 phút/tháng |
Nguồn: trang giá của từng nhà cung cấp, truy cập ngày 31 tháng 8 năm 2026; tài liệu ngôn ngữ được hỗ trợ của Google cho id-ID; bảng giá API do OpenAI công bố. Trang giá đang chạy của TurboScribe chặn truy xuất tự động, nên các con số của nó lấy từ bản lưu của Internet Archive cho đúng trang đó và khớp với cách gói này đang được mô tả ở nơi khác — hãy xác minh trước khi dựa vào chúng. Chúng tôi không lấy được danh sách từng ngôn ngữ từ Notta vào ngày 31 tháng 8 năm 2026, nên phần hỗ trợ tiếng Indonesia của họ được đánh dấu là chưa xác nhận thay vì mặc định là có.
Cùng một đơn vị trên một trục: số phút của một cuộc phỏng vấn 47 phút được chấp nhận trong một tệp duy nhất. Hạn mức hằng tháng khác nhau và được ghi chú bên dưới biểu đồ.
120 phút của Notta là thật. Trần ba phút mới là thứ làm hỏng cuộc phỏng vấn.
Đọc kỹ gói miễn phí của Notta thì thấy nó không hề keo kiệt — 120 phút phiên âm mỗi tháng, 50 lượt tải tệp, 10 bản tóm tắt AI, 1.000 tín dụng AI, không cần thẻ tín dụng. Với ghi âm ngắn và cuộc gọi ngắn, đó là hạn mức thực sự hữu ích, và nhiều phút hằng tháng hơn phần lớn đối thủ chịu cho không.
Rồi đọc thêm đúng một dòng nữa trong chính bảng so sánh ấy: phiên âm tối đa mỗi bản ghi, 3 phút ở gói Free, so với 5 giờ ở gói Pro. 120 phút của bạn thực chất là 40 mảnh ba phút rời rạc. Một cuộc phỏng vấn 47 phút không thể vào hệ thống được.
Đây là điểm mấu chốt, và nó đúng vượt ra ngoài bất kỳ nhà cung cấp nào: một gói miễn phí không phải một con số, mà là ba cái trần, và quảng cáo luôn trích cái cao nhất. Phút mỗi tháng là dòng tiêu đề. Phút mỗi tệp mới quyết định cuộc phỏng vấn của bạn có phiên âm được hay không. Số tệp mỗi ngày quyết định bạn có xử lý xong một tuần đi hiện trường trong một ngày Chủ nhật hay không.
TurboScribe đảo ngược đúng phép đánh đổi đó. Gói miễn phí của họ không quảng cáo kho phút hằng tháng nào cả — ba bản phiên âm mỗi ngày, mỗi bản tối đa 30 phút, mỗi lần một tệp, với ưu tiên hàng đợi thấp hơn. Ba tệp 30 phút mỗi ngày là 90 phút âm thanh, vượt xa mốc 120 phút hằng tháng của Notta chỉ trong hai ngày. Nhưng cuộc phỏng vấn 47 phút vẫn không lọt, vì ràng buộc quyết định lại là trần theo tệp. Bạn sẽ phải cắt bản ghi làm đôi, và mỗi lát cắt lấy đi tính liên tục của người nói ngay tại chỗ cắt.
Transkriptor và Maestra hóa giải căng thẳng này theo cách khác: về cơ bản họ không có gói miễn phí. Các gói Transkriptor công bố bắt đầu từ Lite, 9,99 $ mỗi tháng cho 300 phút phiên âm, lên tới Pro 19,99 $ cho 2.400 phút (8,33 $ mỗi tháng nếu bạn trả 99,99 $ cho cả năm). Maestra bán tín dụng trả theo mức dùng với giá 12 $ cho 60 phút, còn Lite là 23 $ mỗi tháng cho 180 phút. Cả hai đều liệt kê tiếng Indonesia; bảng ngôn ngữ của Maestra đánh dấu tiếng Indonesia là được hỗ trợ cho phiên âm, dịch, lồng tiếng và cả thời gian thực. Không bên nào công bố hạn mức miễn phí định kỳ, và đó cũng là một dạng trung thực riêng.
Tiếng Indonesia tốt lên đo được vào ngày 7 tháng 8 — đúng trên một đường duy nhất
Có một điều thật sự đã xảy ra với nhận dạng giọng nói tiếng Indonesia trong tháng này, và gần như không bài viết nào về «công cụ phiên âm AI» nhắc tới.
Ngày 7 tháng 8 năm 2026, Deepgram phát hành các mô hình đơn ngữ Nova-3 cải tiến và bổ sung tiếng Armenia. Bản ghi thay đổi cụ thể theo cách mà thông báo của nhà cung cấp hiếm khi đạt được. Dưới mục Batch models: tiếng Tamil và tiếng Indonesia. Dưới mục Streaming models: tiếng Tamil và tiếng Belarus.
Tiếng Indonesia xuất hiện ở danh sách này mà không có ở danh sách kia.
Cùng một bản phát hành nâng tiếng Indonesia ở batch và tiếng Belarus ở streaming. «Hỗ trợ tiếng Indonesia đã tốt hơn» không phải một sự thật duy nhất. Nguồn: bản ghi thay đổi của Deepgram, ngày 7 tháng 8 năm 2026.
Khác biệt đó rơi thẳng vào công việc phỏng vấn. Batch là đường mà một tệp tải lên đi qua — bộ máy nhìn thấy toàn bộ bản ghi, dùng được ngữ cảnh từ cả hai phía, và không phải chạy đua với bộ đệm âm thanh trực tiếp. Streaming là đường của phụ đề trực tiếp. Nếu bạn ghi âm cuộc phỏng vấn rồi tải lên sau, bạn đang ở đường batch, tức đúng đường mà tiếng Indonesia vừa được cải thiện trong tháng này. Còn nếu bạn hy vọng có phụ đề tiếng Indonesia chính xác ngay trong lúc phỏng vấn, mô hình cụ thể đó không hề thay đổi vào ngày 7 tháng 8.
Bản dài của lập luận này chúng tôi đã viết trong bài chữ «hỗ trợ» thực sự che giấu điều gì trong độ phủ ngôn ngữ của nhận dạng giọng nói, vì khuôn mẫu này lặp lại khắp ngành: một ngôn ngữ không đơn giản là được hỗ trợ hay không được hỗ trợ, mà là được hỗ trợ trên một đường, trong một chế độ, ở một mức chất lượng, tính đến một ngày cụ thể. Riêng với phiên âm phỏng vấn, tin tốt là đường bạn cần chính là đường vừa tốt lên.
Không ai công bố phép đo độ chính xác tiếng Indonesia, nên bạn phải tự làm phép đo
Đây là phần khó chịu khi viết một bảng so sánh trung thực: chúng tôi không thể đưa bạn bảng WER cho tiếng Indonesia, vì không tồn tại bảng công khai đáng tin nào cả.
Open ASR Leaderboard — thứ gần nhất mà lĩnh vực này có với một bảng điểm trung lập — chỉ chạy tab đa ngôn ngữ gồm các ngôn ngữ châu Âu cho tới ngày 28 tháng 8 năm 2026, khi Hugging Face và Voice Arena thêm tiếng Hindi làm ngôn ngữ Nam bán cầu đầu tiên. Tiếng Indonesia, với khoảng 280 triệu người ở thị trường bản địa, vẫn chưa có mặt. Các nhà cung cấp công bố tuyên bố độ chính xác cho tiếng Anh rồi im lặng ở chỗ khác.
Chính cấu trúc của Whisper cũng gợi ra sự bất đối xứng ấy. Bộ tách token của OpenAI khai báo 100 token ngôn ngữ, và tiếng Indonesia đứng ở vị trí 17 trong bảng đó — đáng nể, thoải mái vượt phần lớn danh sách, và còn xa mới bằng khối lượng dữ liệu đứng sau tiếng Anh, tiếng Trung hay tiếng Tây Ban Nha. Một token được khai báo không phải lời bảo đảm chất lượng; nó chỉ là tuyên bố rằng mô hình sẽ thử ngôn ngữ đó.
Nên kết luận vận hành trung thực là thế này: với tiếng Indonesia, phép đo chính là âm thanh của bạn. Không phải tệp demo của nhà cung cấp, không phải bảng xếp hạng, không phải số sao trên trang đánh giá. Máy ghi âm của bạn, căn phòng của bạn, giọng vùng miền của người bạn phỏng vấn, từ vựng ngành của bạn. Nghe như một cách né tránh, cho tới khi bạn nhận ra làm cho tử tế chỉ mất khoảng hai mươi phút.
Bài kiểm tra 5 phút: hãy chạy nó trước khi trả tiền cho bất kỳ ai
Lấy một lát năm phút từ cuộc phỏng vấn thật — lý tưởng là đoạn có hai người nói, có tiếng ồn nền, và ít nhất ba danh từ riêng. Cho chạy qua từng ứng viên. Rồi kiểm tra năm điều, theo đúng thứ tự này.
- Đếm lỗi ở danh từ riêng. Tên người, tên công ty, địa danh và thuật ngữ sản phẩm. Đây là chỗ nhận dạng giọng nói tiếng Indonesia hỏng đều đặn nhất, và cũng là chỗ một lỗi gây thiệt hại về sau nhiều nhất, vì một cái tên sai lan âm thầm vào mọi bản tóm tắt và mọi trích dẫn bạn tạo ra sau đó. Năm lỗi trong năm phút tương đương khoảng 47 lỗi trong cả cuộc phỏng vấn.
- Soi riêng những dòng trộn ngôn ngữ. Tìm một câu có từ tiếng Anh nằm giữa mệnh đề tiếng Indonesia và đọc xem công cụ cho ra cái gì. Đây là phép thử dự báo tốt nhất cho âm thanh chuyên môn tiếng Indonesia, và cũng là phép thử không trang sản phẩm nào đề cập.
- Kiểm tra nhãn người nói ở phút thứ năm, không phải phút đầu. Việc tách người nói thường trông hoàn hảo trong vài giây mở đầu. Điều đáng quan tâm là Người nói A có còn là Người nói A sau lần cắt lời đầu tiên, sau đoạn nói chồng, hay sau một quãng lặng dài hay không.
- Tìm dấu thời gian mà bạn dùng được. Nếu có lúc nào bạn cần đối chiếu một trích dẫn với âm thanh gốc, bạn cần dấu thời gian theo từng dòng trong bản xuất ra, chứ không chỉ trong trình phát trên web. Nhà báo và nhà nghiên cứu định tính nên coi đây là bắt buộc.
- Xuất tệp ra và mở nó ở nơi khác. TXT, DOCX, SRT, VTT — tùy quy trình của bạn cần gì. Đây là chỗ các gói miễn phí hay dừng lại nhất, và một bản phiên âm bạn không lấy ra khỏi công cụ được thì là bản demo, không phải hồ sơ.
Năm phép kiểm tra, theo đúng thứ tự mà một lần đánh giá thật sẽ gặp.
Nếu bạn muốn quy trình đến sau khi đã chọn xong công cụ — rà bản phiên âm trước khi tin bản tóm tắt, giữ trích dẫn buộc chặt vào âm thanh gốc — chúng tôi đã viết riêng trong bài biến âm thanh phỏng vấn thành bản phiên âm và bản tóm tắt xem lại được.
Phỏng vấn tiếng Indonesia vỡ ở đâu: từ tiếng Anh nằm giữa câu
Tiếng Indonesia chuyên nghiệp không đơn ngữ. «Nanti kita follow up setelah meeting dengan tim product» không phải tiếng Indonesia hỏng; đó là cách một quản lý sản phẩm ở Jakarta nói chuyện, và cũng gần đúng cách nói của người tuyển dụng, chuyên gia tư vấn hay nhà sáng lập startup. Bản phiên âm nào làm nát các mảnh tiếng Anh là làm nát đúng những thuật ngữ mà ghi chú của bạn dựa vào.
Đây là phần khó nhất trong nhóm sản phẩm này, và đáng để hiểu vì sao. Phần lớn bộ máy nhận dạng chạy một mô hình đơn ngữ cho mỗi yêu cầu. Bạn đặt ngôn ngữ là tiếng Indonesia, và mô hình mạnh nhất ở ngữ âm tiếng Indonesia cùng từ vựng tiếng Indonesia — nghĩa là một từ tiếng Anh xuất hiện giữa câu sẽ hoặc bị phiên chuyển thành thứ mang hình dạng Indonesia, hoặc bị bỏ rơi. Đặt ngôn ngữ là tiếng Anh chỉ làm thiệt hại đảo chiều. Chế độ đa ngôn ngữ hay chuyển mã đúng là có tồn tại, nhưng hẹp hơn danh sách đơn ngữ nhiều: tính đến tháng 8 năm 2026, Nova-3 của Deepgram ghi tài liệu 58 ngôn ngữ theo từng ngôn ngữ một, và chuyển mã ở đúng 10 ngôn ngữ.
Hai cách giảm nhẹ thực dụng, đều rẻ. Thứ nhất, đặt ngôn ngữ nguồn rõ ràng là tiếng Indonesia thay vì để tự động nhận diện — bộ tự động nhận diện phải chốt một phỏng đoán từ chính những giây ít ngữ cảnh nhất của cả tệp, và một phỏng đoán sai làm hỏng mọi khâu phía sau cùng một lúc. Thứ hai, nếu công cụ có từ điển tùy chỉnh hay danh sách từ khóa, hãy bỏ các thuật ngữ tiếng Anh và danh từ riêng hay lặp lại vào đó trước khi chạy, chứ không phải sau.
Cứ gọi đây là bài toán gado-gado, theo tên món salad trộn của Indonesia: âm thanh vốn đã trộn từ đầu, mà bộ máy nào cũng muốn dọn nó ra như một món duy nhất.
Nếu bạn viết được code, phiên âm rẻ hơn một ly cà phê
Bảng so sánh gói miễn phí đổi hẳn hình dạng nếu bạn sẵn sàng đụng vào API, và các con số này đáng biết ngay cả khi cuối cùng bạn quyết định không dùng.
OpenAI tính 0,006 $ mỗi phút cho gpt-4o-transcribe và 0,003 $ mỗi phút cho bản mini. Cuộc phỏng vấn 47 phút của bạn tốn 28 xu, hoặc 14 xu trên bản mini. Google Cloud Speech-to-Text cho 60 phút đầu tiên mỗi tháng miễn phí, sau đó 0,016 $ mỗi phút khi bật ghi nhật ký dữ liệu và 0,024 $ khi tắt, và nó liệt kê id-ID trên cả mô hình chirp lẫn chirp_2 ở vùng asia-southeast1. Whisper dùng giấy phép MIT và không tốn gì ngoài phần cứng của chính bạn.
Ở mức giá đó, bản thân việc nhận dạng gần như miễn phí. Thứ bạn thực sự mua từ bất kỳ sản phẩm tiêu dùng nào là toàn bộ những gì bao quanh nó: giao diện tải lên, nhãn người nói, dấu thời gian, trình soạn thảo, tìm kiếm xuyên các cuộc phỏng vấn cũ, bản tóm tắt, bản xuất, và một nơi mà hồ sơ vẫn còn sống sau sáu tháng.
Đó là cách đặt vấn đề trung thực cho lựa chọn tự làm hay đi mua. Nếu mỗi năm bạn có ba cuộc phỏng vấn và chạy được một script Python, hãy chạy script. Nếu mỗi tuần bạn có ba cuộc và cần tìm lại một câu trích từ tháng Ba, thứ bạn đi mua không phải bộ nhận dạng — mà là một hệ thống lưu trữ có gắn thêm bộ nhận dạng.
Điều không gói miễn phí nào làm cho bạn
Công bằng là công bằng, nên đây là những giới hạn áp dụng cho mọi lựa chọn trên bàn, kể cả của chúng tôi.
Gói miễn phí không cho bạn khả năng tách người nói đáng tin cậy. Đó là một trong những phần tốn kém nhất của chuỗi xử lý, và cả nhóm sản phẩm này đều quen giữ nó cho các gói trả phí. Nếu tách hai người nói là thiết yếu với công việc của bạn, hãy dự trù ngân sách thay vì trông chờ may rủi.
Gói miễn phí không hứa hẹn lưu trữ lâu dài. Lưu trữ tốn tiền; lưu trữ miễn phí là một sự tử tế có thể bị rút lại bằng một thay đổi chính sách. Hãy xuất ra mọi thứ quan trọng và giữ bản sao của riêng bạn — đó cũng là câu trả lời cho câu hỏi phụ thuộc nhà cung cấp mà không ai hỏi cho tới lúc cần rời đi.
Gói miễn phí không nâng được sàn độ chính xác cho những người nói cụ thể của bạn. Giọng vùng miền, người được phỏng vấn lớn tuổi, âm thanh chất lượng điện thoại và chuyển mã dày đặc đều làm kết quả tệ đi, và không cấp gói nào thay đổi được mức độ mô hình từng tiếp xúc với loại âm thanh của bạn. Trả nhiều tiền hơn mua được phút và tính năng, không mua được một bộ nhận dạng khác.
Và không công cụ nào, miễn phí hay trả phí, xóa được khâu rà soát. Một bản tóm tắt AI dựng trên bản phiên âm chưa rà thừa hưởng đủ mọi lỗi trong đó, một cách đầy tự tin và hoàn toàn vô hình.
Chốt lại: thứ cần so sánh không phải số phút, mà là số cuộc phỏng vấn
Mọi gói miễn phí trong nhóm này đều quảng cáo một lượng thời gian. Đó là đơn vị sai cho công việc phỏng vấn, vì thời gian chỉ có ý nghĩa khi nó đến trong một khối liền mạch. Một trăm hai mươi phút bị băm thành từng lát ba phút đáng giá ít hơn ba mươi phút không đứt đoạn đối với một nhà báo, và cả hai đều đáng giá ít hơn sáu mươi phút chứa trọn một cuộc trò chuyện với nhãn người nói còn nguyên vẹn.
Vậy nên khi so sánh công cụ, hãy quy mọi gói miễn phí về đơn vị tiền tệ duy nhất có ý nghĩa với bạn: công cụ này phiên âm được bao nhiêu cuộc phỏng vấn thật của tôi, trọn vẹn từ đầu tới cuối, mà không phải cắt tệp? Với vài gói miễn phí khá nổi tiếng, câu trả lời trung thực là con số không, và họ sẽ không viết điều đó trên trang giá.
Lớp nhận dạng đang thành hàng phổ thông, đi dần về mức một phần ba xu mỗi phút. Thứ còn khan hiếm cho tiếng Indonesia là một hồ sơ bạn có thể tìm kiếm, sửa lại, trích dẫn, và quý sau vẫn còn tìm thấy.
Telli.sh đứng ở đâu: chúng tôi là một lựa chọn giữa các lựa chọn phía trên, và chúng tôi sẽ nói cụ thể về điều đó. Gói Free của Telli.sh là 60 phút mỗi tháng — ít phút hơn con số 120 trên tiêu đề của Notta, và cố ý không bị băm bởi trần ba phút mỗi bản ghi, nên một cuộc phỏng vấn trọn vẹn vào được như một tệp duy nhất. Bạn nhận bản phiên âm tiếng Indonesia, bản dịch sang bất kỳ ngôn ngữ nào trong 44 ngôn ngữ đích, một bản tóm tắt AI sinh ra từ chính bản phiên âm, và giao diện có sẵn ở 15 ngôn ngữ, gồm cả tiếng Indonesia. Vượt quá 60 phút mỗi tháng thì đây là sản phẩm trả phí, và nếu khối lượng của bạn thấp mà bạn chạy được script, đường API thật sự rẻ hơn. Hãy chạy bài kiểm tra 5 phút với chúng tôi đúng như cách bạn chạy nó với bất kỳ ai khác.
Nguồn
- Deepgram, "Nova-3 Adds Armenian, Plus Improved Models for Tamil, Indonesian, and Belarusian", bản ghi thay đổi đề ngày 7 tháng 8 năm 2026 — mô hình batch cải tiến cho tiếng Tamil và tiếng Indonesia, mô hình streaming cải tiến cho tiếng Tamil và tiếng Belarus, tiếng Armenia (
hy) bổ sung cho cả hai. - Hugging Face và Voice Arena, "The Open ASR Leaderboard Adds Its First Global South Language", ngày 28 tháng 8 năm 2026 — tiếng Hindi là ngôn ngữ Nam bán cầu đầu tiên của bảng xếp hạng.
- Bảng giá Notta, truy cập ngày 31 tháng 8 năm 2026 — gói Free 120 phút/tháng, tối đa 3 phút mỗi bản ghi, 50 lượt tải tệp/tháng, 10 bản tóm tắt AI/tháng; Pro 8,17 $/tháng trả theo năm với 1.800 phút/tháng.
- Bảng giá Transkriptor, truy cập ngày 31 tháng 8 năm 2026 — Lite 9,99 $/tháng (300 phút), Pro 19,99 $/tháng (2.400 phút, 99,99 $/năm khi trả theo năm), Team 30 $/chỗ ngồi/tháng (3.000 phút mỗi chỗ ngồi).
- Bảng giá Maestra và danh sách ngôn ngữ Maestra, truy cập ngày 31 tháng 8 năm 2026 — trả theo mức dùng 12 $ cho 60 tín dụng, Lite 23 $/tháng cho 180 phút; tiếng Indonesia được liệt kê cho phiên âm, dịch, lồng tiếng và thời gian thực.
- Bảng giá TurboScribe theo bản lưu của Internet Archive — gói Free 3 bản phiên âm mỗi ngày với trần 30 phút mỗi tệp và chỉ tải lên từng tệp một; Unlimited 10 $/tháng, 120 $ trả theo năm, tệp tới 10 giờ. Trang đang chạy trả về HTTP 403 cho truy xuất tự động; hãy coi các con số này là mang tính định hướng và xác nhận lại trên trang web.
- Bảng giá Google Cloud Speech-to-Text và danh sách ngôn ngữ được hỗ trợ, truy cập ngày 31 tháng 8 năm 2026 — 60 phút đầu tiên mỗi tháng miễn phí, 0,016 $/phút khi bật ghi nhật ký dữ liệu và 0,024 $/phút khi tắt;
id-IDtrênchirpvàchirp_2ởasia-southeast1. - Bảng giá API OpenAI, truy cập ngày 31 tháng 8 năm 2026 —
gpt-4o-transcribeở mức 0,006 $/phút,gpt-4o-mini-transcribeở mức 0,003 $/phút. - OpenAI Whisper, giấy phép MIT; bảng
LANGUAGEStrong bộ tách token khai báo 100 ngôn ngữ với tiếng Indonesia (id) ở vị trí 17, truy cập ngày 31 tháng 8 năm 2026.