Tin đồn RSI của Google: hiểu AGI và tranh luận về tốc độ phát triển AI
Giải thích AGI và tự cải tiến đệ quy, lần theo bài đăng gốc trên X, đối chiếu đề xuất của các lãnh đạo AI với quan điểm cạnh tranh Trung Quốc của Trump.
Tin tuc, cap nhat san pham va goc nhin tu doi ngu Telli.sh.
Giải thích AGI và tự cải tiến đệ quy, lần theo bài đăng gốc trên X, đối chiếu đề xuất của các lãnh đạo AI với quan điểm cạnh tranh Trung Quốc của Trump.
Bộ nhớ, quy tắc dự án và câu lệnh bạn nhập hôm nay đều ảnh hưởng đến trợ lý AI. Khi mô hình tuân thủ chỉ dẫn sát hơn, những cách xử lý tạm thời cũ và quyền hạn mơ hồ có thể trở thành vấn đề dai dẳng. Hướng dẫn thực tế để rà soát những gì trợ lý ghi nhớ, xác định mức tự chủ hữu ích và viết chỉ dẫn có thể kiểm chứng, kèm hai mẫu để bạn điều chỉnh.
Một đợt huấn luyện không còn kể hết câu chuyện về năng lực của mô hình. Nghiên cứu từ Reflexion và Voyager đến AlphaEvolve, huấn luyện lúc sử dụng và các thí nghiệm học liên tục năm 2026 cho thấy hệ thống AI có thể giữ lại kinh nghiệm hữu ích như thế nào. Điều gì thực sự thay đổi, bằng chứng vững đến đâu và vì sao cải thiện đáng tin cậy quan trọng hơn một vòng lặp vô tận.
GPT-Live-1 có mặt trên API với giá 0,05 USD mỗi phút thoại, ba tháng sau tính năng dịch giọng nói trực tiếp 70 ngôn ngữ của Google. Giá và điểm benchmark được công bố đo được gì, không đo được gì, và vì sao biên bản họp, ý tưởng được chia sẻ cùng nguồn tài liệu đã lưu càng quan trọng khi trò chuyện ngày càng dễ dàng.
Từ ngày 1 đến ngày 3 tháng 9 năm 2026, Anthropic, Meta, Google và OpenAI đều tung ra mô hình tiên phong, và CNBC đặt tên cho sự kiệt sức phát sinh từ đó: mệt mỏi vì mô hình. Số lượng bản phát hành là phần nhàm chán. Phần thú vị là mỗi bản phát hành đều tạo ra một cuộc đánh giá mà ai đó ở phía dưới phải chạy, còn các công ty tung ra chúng thì chẳng có lý do gì để giúp bạn bỏ qua nó. Bài viết mổ xẻ chi phí thật của việc đổi mô hình, vì sao rẻ hơn trên mỗi token không có nghĩa là rẻ hơn trên mỗi tác vụ, và vì sao phần mềm được quản lý trọn gói, xây riêng cho một công việc hẹp, là dàn xếp duy nhất mà người khác có thể quyết định thay bạn.
Ngày 3 tháng 9 năm 2026, NVIDIA đồng ý mua lại Hugging Face với giá 12.930.300.000 USD, thương vụ lớn thứ hai trong lịch sử công ty, chỉ sau 20 tỷ USD chi cho tài sản của Groq. Hugging Face khởi đầu năm 2016 như một ứng dụng chatbot cho thiếu niên và kết thúc bằng việc lưu trữ 3 triệu mô hình cho 18 triệu lập trình viên. Bài này đọc kỹ chặng đường đó, lý do hai canh bạc nền tảng trước đây của NVIDIA kết thúc trái ngược nhau, và nơi lời hứa trung lập thực sự được định đoạt: không phải trong một bài blog, mà trong các kernel, các định dạng lượng tử hóa và đích triển khai mặc định.
Clip không chỉ lưu một trang web: nó biến trang đó thành một ghi chú Telli.sh có tiêu đề và bản tóm tắt một dòng do AI viết. Nó đã phát hành nhưng nằm sau một cờ dành cho quản trị viên, nên hai bộ đếm phân tích chưa từng chạy lấy một lần. Cánh cổng đó nay đã bị dỡ bỏ: tài khoản miễn phí có 30 lượt lưu và 10 bản tóm tắt AI mỗi ngày, còn tiện ích trình duyệt bản 1.18 bổ sung mục chuột phải Save to Telli.sh, xác thực bằng một mã thông báo không làm được gì ngoài việc lưu clip.
OpenAI phát hành GPT-6 Astra ngày 3/9/2026 và gọi đây là mô hình thông minh nhất thế giới. Nhưng chính bảng benchmark của họ kể một câu chuyện sắc hơn: những bước nhảy khổng lồ ở các tác vụ hẹp — Terminal-Bench Science từ 22,4% lên 64,6%, SRE-Bench từ 55,9% lên 88,0%, OSWorld giảm 47% thời gian mỗi tác vụ — đặt trên một chỉ số tổng hợp trung lập chỉ nhích ba phần mười điểm. Đâu là tiến bộ thật, đâu là dấu sao, và một mô hình văn bản một triệu token vẫn chưa làm được gì.
Universal Commerce Protocol ra mắt ngày 11/1/2026, do Google và Shopify cùng phát triển, được Etsy, Wayfair, Target, Walmart và hơn 20 đối tác ủng hộ. Nhưng đọc đặc tả thì mua sắm lại là phần nhạt nhẽo nhất: khám phá qua /.well-known/ucp, chữ ký thông điệp RFC 9421, webhook bắt buộc ký, và một phần mở rộng mandate AP2 mà nhiệm vụ duy nhất là khiến giao dịch của tác nhân không thể chối bỏ. Đọc kỹ những gì UCP thực sự chuẩn hóa — và một thứ trong đó chẳng liên quan gì đến việc mua hàng.
Telli.sh: Every Translator 1.16 dựng lại cửa sổ bật lên trên thanh công cụ thành một khung trạng thái: bản thu nhỏ của trang bạn đang mở, năm thẻ có nhãn, và các chấm chỉ chuyển xanh khi tiện ích xác nhận được rằng nó thật sự đang chạy. Toàn bộ phần cấu hình đã dời sang trang cài đặt riêng với bản xem trước dạng khung xương cập nhật theo thời gian thực; dịch tức thì có tab riêng cùng lịch sử tự dọn sau 30 ngày; và chuông thông báo mang blog Telli.sh đến bằng ngôn ngữ trình duyệt của bạn, qua 15 phiên bản ngôn ngữ.
Hướng dẫn cài đặt OpenClaw 2.0 cho người mới, đối chiếu từng bước với tài liệu chính thức: phiên bản Node cần có, ba cách cấp mô hình cho agent và chi phí từng cách, quy trình onboarding có hướng dẫn sáu bước mới trong v2026.8.1, bốn bước ghép nối Telegram, ba nhiệm vụ đầu tiên đúng cỡ, các quyền ngày đầu giúp giữ bán kính ảnh hưởng nhỏ, và năm lỗi mà các bản cài mới thực sự vấp phải.
Ngày 31/8/2026, một AI agent mã nguồn mở công bố v2026.8.1: hơn 16.000 pull request từ 933 người đóng góp, khoảng một nửa tổng số PR dự án từng merge, sau 49 ngày im lặng có chủ đích tiếp nối 106 bản phát hành trong 230 ngày. Trình cài đặt giờ nhận luôn gói ChatGPT hay Claude bạn đang trả tiền, hoặc tìm ra các mô hình Ollama chạy cục bộ của bạn. Phiên làm việc đã chuyển sang SQLite và việc hạ cấp không còn miễn phí. Một bài đọc kỹ về hình hài thật của «AI thuộc về bạn» — gồm cả các thay đổi phá vỡ tương thích và những thiết lập mặc định vẫn đang tắt.
Các công ty ở Bangkok công bố giá thông dịch nối tiếp từ 3.000 THB một giờ và dịch song song từ 5.000 THB, trong khi chế độ nối tiếp làm cuộc họp dài ra khoảng gấp đôi. Live translate của Google Dịch hỗ trợ 74 ngôn ngữ, có tiếng Thái; phụ đề dịch của Google Meet hỗ trợ 69, cũng có tiếng Thái — nhưng Transcripts và trình ghi chú Gemini của Meet mỗi bên chỉ có 8 ngôn ngữ, và không bên nào có tiếng Thái. Nova-3 của Deepgram nhận dạng tiếng Thái ở mã `th` và `th-TH` nhưng loại nó khỏi chế độ chuyển mã 10 ngôn ngữ — tức là loại đúng cái câu Thái–Anh mà cuộc họp của bạn được tạo thành. Một bản quyết toán đầy đủ về các lựa chọn dịch cuộc họp cho đội nhóm Thái Lan.
Gói miễn phí của Notta cho 120 phút phiên âm mỗi tháng và giới hạn mỗi bản ghi chỉ 3 phút. TurboScribe cho 3 tệp mỗi ngày với trần 30 phút. API của Google đưa bạn 60 phút miễn phí và không có giao diện nào. Ngày 7 tháng 8 năm 2026, Deepgram phát hành mô hình tiếng Indonesia cải tiến — chỉ trên đường batch. Một bảng so sánh đã kiểm chứng về các gói miễn phí mà nhà báo, nhà nghiên cứu hay người phỏng vấn nhân sự ở Indonesia thực sự gặp phải, cùng những giới hạn không nơi nào quảng cáo.
Tỷ lệ lỗi từ chấm điểm chữ “không” và chữ “cái” y hệt nhau, và đó là lý do hai bản ghi cùng đạt 10,0% nhưng chỉ một bản dùng được. Đây là toàn bộ quy trình đo: một đoạn thử 12 phút dựng theo đúng đặc tả cuộc họp, một bản ghi tham chiếu với quy tắc chuẩn hóa được đóng băng trước, các lệnh cpWER và DER chính xác, cùng một bảng điểm năm chiều chỉ dành cho WER thô 10 điểm trên 100.
DeepL ra mắt Voice-to-Voice ngày 16/4/2026 với hơn 40 ngôn ngữ, và mục Hỏi đáp của chính sản phẩm đó ghi rằng dữ liệu cuộc họp được «xử lý tạm thời trong bộ nhớ và bị xóa khi cuộc gọi kết thúc». Ngày 28/8, Open ASR Leaderboard bổ sung ngôn ngữ Nam bán cầu đầu tiên và cho thấy hai mô hình ngang nhau ở mức 4,9 WER lại chênh nhau gần bốn lần về mức độ phụ thuộc của độ chính xác vào việc người nói đến từ đâu. Dịch họp thời gian thực đang thành hàng phổ thông. Bản ghi thì chưa.
Ngày 20/8/2026, một mô hình không phòng thí nghiệm, không thẻ mô tả, không giá xuất hiện trên OpenRouter với tên stealth/ox-alpha. Bốn ngày sau, người dùng OpenCode đã đẩy qua nó 26 nghìn tỷ token. Sáu ngày sau, Z.AI nhận đó là của mình: GLM-5.3-Flash, 320 tỷ tham số, giấy phép MIT, 0,15 đô la mỗi triệu token đầu vào. Vì sao các phòng thí nghiệm nay phát hành mô hình mà không gắn tên mình, những con số lưu lượng đó thực sự đo cái gì, và mức giá pha trộn 24 xu làm gì với kinh tế của các pipeline giọng nói.
Ngày 4 tháng 8 năm 2026, Deepgram thêm tiếng Punjab và tiếng Nepal vào Nova-3; ngày 7 tháng 8 hãng thêm tiếng Armenia và cải thiện tiếng Tamil, tiếng Indonesia, tiếng Belarus. Chín tháng trước mô hình phủ 31 ngôn ngữ — hôm nay tài liệu liệt kê 58. Nhưng chuyển mã ngôn ngữ vẫn chỉ chạy được đúng 10, và chính changelog tháng 8 cho thấy tiếng Indonesia chỉ cải thiện ở chế độ batch còn tiếng Belarus chỉ cải thiện ở chế độ streaming. Một cái nhìn về tốc độ mở rộng ngôn ngữ trong nhận dạng giọng nói, và về những gì chữ “được hỗ trợ” đang thực sự che giấu.
Phụ đề dịch của Google Meet hỗ trợ 69 ngôn ngữ, có tiếng Việt; tính năng Live translate của Google Dịch hỗ trợ 74 ngôn ngữ, cũng có tiếng Việt. Nhưng Transcripts của Meet và trình ghi chú Gemini mỗi bên chỉ hỗ trợ đúng 8 ngôn ngữ, và tiếng Việt không nằm trong danh sách nào. DeepL Voice chỉ nhận dạng được tiếng Việt nói qua một nhà cung cấp bên thứ ba mà quản trị viên phải bật thủ công và không dùng được tính năng tự động nhận diện ngôn ngữ. Đây là bức tranh thật của dịch nói trực tiếp cho người Việt năm 2026 — và thứ nó không bao giờ để lại.
Ba năm trước, mô hình tải về tốt nhất thua GPT-4 tới 37 điểm trên HumanEval và cần hai card đồ họa mới chạy nổi. Tuần trước, một mô hình trọng số mở 27B đạt 52,0 trên chỉ số trí tuệ của Artificial Analysis, còn Claude Opus 4.6 Max là 44,9 — với một phần chín giá tiền, từ một tệp 16,5 GB. Bài so sánh trước và sau, kèm bảng benchmark, đường cong giá và ý nghĩa của độ trễ đuổi kịp đã rút xuống 162 ngày.
Đi qua toàn bộ quy trình của Telli.sh: ghi âm trực tiếp hoặc tải tệp âm thanh, phiên âm cuộc họp bằng AI kèm nhận diện người nói, dịch cuộc họp thời gian thực sang 44 ngôn ngữ đích, tóm tắt AI theo 10 định dạng và ghi chú có thể chia sẻ. Kèm những giới hạn thành thật, giá chính xác và điều mà độ chính xác phiên âm thực sự đòi hỏi.
Nghiên cứu về tóm tắt bản ghi cuộc họp cho thấy 30,4% bản tóm tắt do mô hình tạo ra từ biên bản họp hội đồng thành phố chứa ít nhất một lỗi sự kiện, và phía sau là bảy loại lỗi có tên gọi rõ ràng. Hướng dẫn thực tế để rà soát ghi chú AI đối chiếu với chính bản ghi của nó: kiểm tra gì, theo thứ tự nào, và nên nói gì trong phòng họp để việc rà soát chỉ mất chín phút thay vì ba mươi.
Dịch Trực Tiếp của Apple chạy 10 ngôn ngữ hoàn toàn trên iPhone. Timekettle W4 Pro giá 449 đô la công bố 52. Pixel Buds đạt 40 nhưng cần kết nối mạng. Ngày 18/8/2026 chúng tôi đọc trang hỗ trợ của cả bốn hãng để trả lời câu hỏi mà quảng cáo bỏ qua: khi cuộc trò chuyện kết thúc, chiếc nào vẫn còn giữ nó? Một hướng dẫn về thị trường và về công việc thứ hai không ai bán cho bạn.
Ngày 11/8/2026, Anthropic bắt đầu đánh dấu những gì Claude viết để sau này có thể truy ngược nguồn gốc. Dấu này sống sót qua sao chép dán và cả qua bản dịch, nhưng biến mất nếu bạn viết lại. Hướng dẫn dễ hiểu: dấu chìm văn bản hoạt động ra sao, một kết quả phát hiện chứng minh và không chứng minh được điều gì, vì sao lịch sử buộc tội oan lại quan trọng, và vì sao cả 1.922 vụ ảo giác đã ghi nhận đều sẽ qua được bài kiểm tra này.
Qwen3.8-27B phát hành theo giấy phép Apache 2.0. Bản GGUF Q4_K_M nặng 17,1 GB, vừa laptop 32 GB; bản FP8 là 30,9 GB. Đo thực tế: 48 token/giây trên RTX 4090 và 12,75 trên Mac mini M4 Pro.
Các mô hình Qwen3-ASR của Alibaba dùng giấy phép Apache 2.0, hỗ trợ 52 ngôn ngữ và phương ngữ, tải về chưa tới hai gigabyte. Một hướng dẫn dễ hiểu về tầng phiên âm mở trọng số: hiện có những gì, chạy mô hình trên máy tính của chính bạn thực sự được gì, và các API đóng vẫn thắng ở đâu.
Ngày 20/7, giá các gói trả phí của Telli.sh lại giảm: Pro 8 $/tháng, Pro+ 10 $/tháng, gói năm vẫn giữ mức chiết khấu 15 %. Bảng so sánh trước/sau và lý do chúng tôi làm tròn các con số xuống.
Trong ba tuần, các phòng lab AI lớn nhất Trung Quốc đã phát hành hoặc hé lộ những mô hình trọng số mở cấp tiên phong — Kimi K3, Qwen3.8-Max và DeepSeek V4 ở trạng thái phát hành chính thức. Một hướng dẫn bằng ngôn ngữ dễ hiểu: mỗi mô hình là gì, điều gì thực sự ra mắt và điều gì vẫn là lời hứa, và vì sao Bắc Kinh giờ có thể siết lại chính làn sóng mà họ tạo ra.
Nghiên cứu tháng 7/2026 của OpenAI cho thấy 43,5% tin nhắn ChatGPT mang tính đặc thù nghề nghiệp là về công việc nằm ngoài vị trí của chính người dùng. Loại công việc đó sống nhờ bối cảnh — mà phần lớn bối cảnh của một tổ chức lại bốc hơi trong các cuộc họp. Hướng dẫn thực tế để biến cuộc họp thành tri thức công việc tìm kiếm được: giữ lại gì, đặt tên thế nào, cuộc họp nào xứng đáng có bản ghi lâu dài, và tìm kiếm thay đổi gì cho onboarding và bàn giao.
Nút thắt hiếm khi là cuộc họp, mà là ngày hôm sau: quyết định mờ dần, người phụ trách nhoè đi, việc theo sau chết trong tin nhắn riêng. Bài viết đi qua từng bước vòng lặp ghi chú mà những đội thực sự triển khai đang dùng — ghi quyết định, người phụ trách và hạn chót ngay trong cuộc họp, gửi đi trong vài phút, và mở lại ghi chú ở đầu cuộc họp kế tiếp.
MAI-Transcribe-1.5 của Microsoft đạt tỷ lệ lỗi từ 2,4%, trong khi tài liệu chính thức của chính mô hình đó ghi rằng không hỗ trợ phân tách người nói. Giải thích dễ hiểu về việc WER đo cái gì, vì sao bảng xếp hạng đã dồn cục sát đáy, và những lớp nào nằm trên nhận dạng giọng nói mới thực sự quyết định một bản gỡ băng có trở thành biên bản họp dùng được hay không.
Granola đưa sổ ghi chú AI lên cổ tay, VOMO vượt 400.000 người dùng, các bản mã nguồn mở xuất hiện chỉ sau vài tuần. Không điều nào thay đổi thứ làm nên một biên bản hữu ích. Đây là sáu thứ vẫn phải có, kèm bài kiểm tra 60 giây.
Kimi K3 là tâm điểm của làn sóng open-weight năm 2026, nhưng mô hình bạn thực sự có thể tải về dùng ngay hôm nay là GLM-5.2. Một góc nhìn trung thực về cả hai và lý do các mô hình mở với giấy phép thoáng lại quan trọng với ghi chú cuộc họp.
OpenAI trỏ alias gpt-5.6 sang Sol; Terra cân bằng chi phí, Luna cho khối lượng lớn. Reasoning effort nay chạy từ none đến max, mặc định là medium — điều đó đổi gì khi bạn rời GPT-5.5.
Việc tạm dừng truy cập Anthropic Fable 5 cho thấy vì sao ngay cả các mô hình AI an toàn hơn vẫn cần lớp bảo vệ rõ ràng, hồ sơ nguồn và cơ chế kiểm soát dễ giải thích cho người dùng.
Bản phân tách người nói v2 của Deepgram được ưa chuộng gấp 3,3 lần bản cũ, nhưng diarize_model chỉ chạy batch, không hỗ trợ streaming. Kèm theo là cách giãn cách tiếng Hàn và chữ số đa ngôn ngữ.
Một lát cắt có ngày tháng: ngày 28/6/2026, hướng dẫn mô hình mới nhất của OpenAI vẫn trỏ tới GPT-5.5 chứ không phải GPT-5.6. Tài liệu nói gì về suy luận, dùng công cụ và ngữ cảnh dài.
Chúng tôi đã giảm giá các gói trả phí của Telli.sh để nhiều người hơn có thể dùng ghi chú AI trực tiếp, bản chép lời, tóm tắt và quy trình họp đa ngôn ngữ.
Google đang đưa dịch giọng nói trực tiếp vào Meet và Translate. Telli.sh tập trung vào bản ghi có thể xem lại sau cuộc trò chuyện.
South Australia Police đang chuẩn bị thử nghiệm AI speech-to-text cho phỏng vấn. Với các cuộc trao đổi nghiêm túc, tốc độ chỉ hữu ích khi bản ghi vẫn kiểm tra được.
Telli.sh: Every Translator đã ra mắt trên Chrome Web Store với chế độ Google Translate miễn phí, Chrome Built-in AI và bản dịch hiển thị cạnh văn bản gốc.
Hướng dẫn cho đội nhóm Việt Nam: tải audio lên hoặc ghi âm trực tiếp, rồi kiểm tra transcript, người nói, bản dịch, tóm tắt và việc cần làm trong Telli.sh.