ブログ

Telli.shチームからのニュース、製品アップデート、AIノートの知見をお届けします。

ai workflows

AIが賢くなるほど指示を見直そう:メモリ・ルール・プロンプトの整え方

メモリ、プロジェクトのルール、今日入力するプロンプトは、いずれもAIの行動を左右します。指示への忠実さが増すほど、古い応急処置や曖昧な権限が繰り返し問題を起こすこともあります。AIが覚えている内容を点検し、自律的に進めてよい範囲を定め、実際に検証できる指示を書く方法を、2つのテンプレートとともに紹介します。

Ken Jo·続きを読む
ai research

公開後もAIは進歩できる:5つの改善方法とAGIにつながる可能性

モデルの訓練だけでは、その能力のすべてを説明できなくなっています。ReflexionやVoyagerからAlphaEvolve、推論時学習、2026年の継続学習実験まで、AIが有用な経験を残す方法の研究が進んでいます。実際に何が変わるのか、どこまで証拠があるのか、そして終わりのないループより信頼できる改善がなぜ重要なのかを考えます。

Ken Jo·続きを読む
ai insights

Google のリアルタイム翻訳、OpenAI の全二重音声。その先に残る仕事とは

Google が 70 言語のリアルタイム音声翻訳を発表してから 3 か月、GPT-Live-1 が音声 1 分あたり $0.05 で API に登場しました。公開された価格とベンチマークが何を測り、何を測っていないのか。そして会話が容易になるほど議事録・アイデア共有・保存した出典が重要になる理由を考えます。

Ken Jo·続きを読む
ai industry

3日間でフロンティアモデルが4本、しかしどれが必要だったかは誰も教えてくれない

2026年9月1日から3日にかけて、Anthropic、Meta、Google、OpenAIがそろってフロンティアモデルを出荷し、CNBCはそこで生じた疲弊に名前を与えた。モデル疲れである。リリース本数は退屈な部分にすぎない。興味深いのは、リリースのひとつひとつが下流の誰かに必ず走らせる評価を生むこと、そしてモデルを出す企業にはその評価を省かせる理由が一切ないことだ。モデル差し替えが実際にいくらかかるのか、なぜトークン単価の安さがタスク単価の安さにならないのか、そしてなぜ狭い仕事ひとつのために作られたフルマネージドのソフトウェアだけが、他人に判断を代わってもらえる形式なのかを検討する。

Ken Jo·続きを読む
ai industry

NVIDIAは129億3,000万ドルでモデルハブを買ったのではない。デフォルトを買った

2026年9月3日、NVIDIAがHugging Faceを12,930,300,000ドルで買収することに合意しました。Groqの資産に投じた200億ドルに次ぐ、同社史上2番目の規模です。Hugging Faceは2016年にティーンエイジャー向けチャットボットアプリとして始まり、最終的に1,800万人の開発者に300万のモデルを届ける場所になりました。そこに至る道のり、NVIDIAの過去2度のプラットフォーム買収が正反対の結末を迎えた理由、そして中立性の約束が実際に決まる場所を読み解きます。ブログ記事ではなく、カーネル、量子化フォーマット、デプロイ先のデフォルトで決まります。

Ken Jo·続きを読む
product update

Clip は、ウェブページを要約まで書き終えたノートにする。今日から、すべての Telli.sh アカウントに開きます

Clip は、ウェブページを保存するだけでなく、AI が書いたタイトルと一行要約が付いた Telli.sh のノートに変えます。この機能は管理者フラグの裏で出荷されたため、2 つの分析カウンターは一度も動きませんでした。そのゲートを取り払いました。無料アカウントでも 1 日あたり 30 件の保存と 10 件の AI 要約が使えます。ブラウザー拡張機能のバージョン 1.18 は、クリップの保存以外は何もできないトークンで認証する右クリックの Save to Telli.sh を追加します。

Ken Jo·続きを読む
ai models

75分が40分に:GPT-6 Astra が本当に得意なこと

OpenAI は2026年9月3日に GPT-6 Astra を公開し、世界で最も知的なモデルと呼びました。しかし自社のベンチマーク表はもっと鋭い話をしています。狭い課題での飛躍は巨大(Terminal-Bench Science 22.4%→64.6%、SRE-Bench 55.9%→88.0%、OSWorld は課題あたり47%の時短)である一方、中立的な総合指標は0.3ポイントしか動きませんでした。どこが本物でどこに脚注が付くのか、そして100万トークンのテキストモデルが依然としてできないことを整理します。

Ken Jo·続きを読む
ai agents

GoogleのUCPは決済リクエストごとに4つのヘッダーを載せる。うち3つは後日の争いのためにある

Universal Commerce Protocolが2026年1月11日、Google、Shopify、Etsy、Wayfair、Target、Walmartと20社超のパートナーの支持とともに公開されました。しかし仕様を読むと、買い物は最も退屈な部分です。/.well-known/ucp によるディスカバリー、RFC 9421のメッセージ署名、必須のWebhook署名、そしてエージェントの購入を否認できなくすることだけを目的とするAP2マンデート拡張。UCPが実際に標準化したもの、そしてそのうち購入とは何の関係もない一つを精読します。

Ken Jo·続きを読む
product update

拡張機能のポップアップは間違った問いに答えていた。1.16は代わりに、いま開いているページを描く

Telli.sh: Every Translator 1.16 は、ツールバーのポップアップを状態表示画面として作り直しました。いま開いているページのミニチュア、5つのラベル付きチップ、そして拡張機能が「実際に動いている」と確認できたときだけ緑になるドット。設定はすべて、動くスケルトンのプレビューを備えた専用の設定ページへ移りました。インスタント翻訳は独立したタブと、30日で自動的に片づく履歴を得ました。通知ベルは、ブラウザーの言語に合わせて15ロケールの Telli.sh ブログを運びます。

Ken Jo·続きを読む
guide

インストールコマンド1行とボットトークン1個 — エージェント未経験者のための OpenClaw 2.0 セットアップ

初心者向けに検証済みの OpenClaw 2.0 セットアップ手順をまとめました。必要な Node のバージョン、エージェントにモデルを与える3つの方法とそれぞれのコスト、v2026.8.1 で入った6ステップのガイド付きオンボーディングが尋ねる順序、Telegram の4ステップのペアリング、最初の1週間に回すべき3つのタスク、影響範囲を小さく保つ初日の権限設定、そして新規インストールが実際にぶつかる5つの失敗まで。

Ken Jo·続きを読む
ai agents

OpenClaw 2.0 は、プロジェクトがこれまでにマージした PR の約半分を一度に出しました。7週間まったく出さなかったあとに

2026年8月31日、オープンソースの AI エージェントが v2026.8.1 を公開しました。933人による16,000件超の PR、プロジェクト史上マージされた全 PR のおよそ半分。230日で106回リリースしてきたチームが、49日間あえて沈黙した結果です。セットアップウィザードは既に支払っている ChatGPT や Claude のサブスクリプションをそのまま取り込み、ローカルの Ollama モデルも見つけます。セッションは SQLite へ移り、ダウングレードはもう無料ではありません。「自分が所有する AI」が実際にどんな形をしているのか、破壊的変更とオフのままの既定値まで含めて読み解きます。

Ken Jo·続きを読む
ai translation

逐次通訳は会議を倍に引き伸ばす。リアルタイム翻訳は会議を忘れる。2026年、タイのチームが実際に選んでいるもの。

バンコクの通訳会社は逐次通訳を1時間3,000バーツから、同時通訳を5,000バーツから公開しており、逐次通訳は会議の所要時間をおよそ倍にします。Google TranslateのLive translateはタイ語を含む74言語、Google Meetの翻訳字幕はタイ語を含む69言語に対応する一方、MeetのTranscriptsとGeminiのメモ作成機能はいずれも8言語のみで、タイ語はどちらにもありません。DeepgramのNova-3はタイ語をthおよびth-THとして文字起こししますが、10言語のコードスイッチングモードからは除外しています。そしてそれこそ、あなたの会議を構成しているタイ語と英語の混ざった文です。タイのチームに向けた会議翻訳の選択肢を、余さず会計します。

Ken Jo·続きを読む
transcription

インタビュー1本すら入らない無料120分: インドネシア語の無料AI文字起こしが実際にくれるもの

Nottaの無料プランは月120分の文字起こしを与え、録音1件あたりを3分で打ち切ります。TurboScribeは1日3ファイル、上限30分。GoogleのAPIは無料60分をくれますが、インターフェイスはくれません。2026年8月7日、Deepgramは改善されたインドネシア語モデルを出荷しましたが、バッチ経路だけです。インドネシアの記者、研究者、採用面接官が実際にぶつかる無料枠を検証して比較し、どこも広告しない限界まで書きました。

Ken Jo·続きを読む
guide

同じ10.0%のエラー率、正反対の判断 — 会議文字起こしの精度を測る手順

単語誤り率は「not」という語と「the」という冠詞をまったく同じ重みで採点します。だからこそ、2本の文字起こしがそろって10.0%になり、そのうち片方しか使い物にならないという事態が起きます。会議の仕様に合わせた12分のテスト音声、正規化ルールを固定した参照文字起こし、cpWERとDERの具体的なコマンド、そして生のWERに100点中10点しか与えない5項目のスコアカード。測定手順のすべてをまとめました。

Ken Jo·続きを読む
ai translation

40言語以上をリアルタイム翻訳し、通話終了とともに削除する。会議を残すのは多言語文字起こしという層です

DeepLは2026年4月16日、40言語以上に対応するVoice-to-Voiceを発表しました。同じ製品のFAQには、会議データは「メモリ上で一時的に処理され、通話が終わると削除される」と書かれています。8月28日にはOpen ASRリーダーボードが初めてグローバルサウスの言語を追加し、WER 4.9で並ぶ2つのモデルが、話者の出身地域によって精度が揺れる幅では4倍近く違うことを示しました。リアルタイム会議翻訳はコモディティになりつつあります。記録はまだです。

Ken Jo·続きを読む
ai models

無名のモデルが4日間で26兆トークンを消費した。価格表が出たのはその後、100万トークン24セント

2026年8月20日、開発元もモデルカードも価格もないモデルが stealth/ox-alpha として OpenRouter に現れました。4日後、OpenCode のユーザーはそこに26兆トークンを流し込んでいました。6日後、Z.AI が名前を明かします。GLM-5.3-Flash、総パラメータ320B、MITライセンス、入力100万トークンあたり0.15ドル。なぜ研究所は自社名を伏せてモデルを出すのか、あのトラフィック数値が実際に測っているものは何か、そしてブレンド24セントが音声パイプラインの経済性に何をもたらすのかを整理します。

Ken Jo·続きを読む
speech recognition

Nova-3が今月58番目の言語を追加しました。同じ文の中で使えるのは、そのうち10言語だけです。

2026年8月4日、DeepgramはNova-3にパンジャブ語とネパール語を追加し、8月7日にはアルメニア語を追加してタミル語、インドネシア語、ベラルーシ語のモデルを改善しました。9か月前は31言語だったものが、今日のドキュメントでは58言語になっています。しかしコードスイッチングが機能するのは正確に10言語だけで、8月のチェンジログ自体が、インドネシア語はバッチのみ、ベラルーシ語はストリーミングのみの改善だったと記しています。音声認識の言語カバレッジが広がる速度と、「対応」という言葉が実際に隠しているものを見ていきます。

Ken Jo·続きを読む
ai translation

Googleはあなたのベトナム語会議をリアルタイムで翻訳する。だが、一言も書き残さない。

Google Meetの翻訳字幕はベトナム語を含む69言語、Google TranslateのLive translateは74言語に対応しています。一方、MeetのTranscripts機能とGeminiによるメモ作成機能はいずれもちょうど8言語のみで、ベトナム語はどちらにも入っていません。DeepL Voiceがベトナム語の発話を文字起こしできるのは、管理者による有効化が必要で自動検出も使えないサードパーティ経由の経路だけです。2026年のリアルタイム音声翻訳がベトナム語チームに実際にもたらすもの、そして最後までもたらさないものを整理します。

Ken Jo·続きを読む
ai models

16.5GB のファイルが、2月時点で最強だった非公開モデルを上回った

3年前、ダウンロードできる最良のモデルは HumanEval で GPT-4 に37ポイント差で敗れ、動かすにはグラフィックカードが2枚必要でした。先週、27B のオープンウェイトモデルが Artificial Analysis の Intelligence Index で 52.0 を記録。Claude Opus 4.6 Max は 44.9 です。価格は9分の1、ファイルは 16.5GB。ベンチマーク表、価格曲線、そして追随ラグが162日まで縮んだことの意味をまとめます。

Ken Jo·続きを読む
product update

5つの段階、4つの成果物 — Telli.sh は会議録音に対して実際に何をしているのか

Telli.sh のパイプライン全体を段階ごとに解説します。ライブ録音と音声アップロード、話者識別を伴う AI 会議文字起こし、44 言語を対象としたリアルタイム会議翻訳、10 種類のフォーマットによる AI 要約、そして共有可能なノートまで。正直な限界と正確な価格、そして会議文字起こしの精度が本当に必要とするものも取り上げます。

Ken Jo·続きを読む
meeting operations

誰も「9月」とは言っていない — AI議事録に必要な9分間のレビュー

議事録要約の研究では、実際の市議会の書き起こしを要約した結果の30.4%に少なくとも1つの事実誤りが含まれ、その背後には7つの誤りの型がありました。AIが書いた議事録を書き起こしと突き合わせて確認する実践ガイド。何をどの順で確認するか、そしてレビューを30分ではなく9分で終えるために会議中に何を言うべきか。

Ken Jo·続きを読む
translation

翻訳イヤホン4機種、問いはひとつ ― 会議が終わったとき、何が残るのか

AirPodsのライブ翻訳は10言語をiPhone上だけで処理します。449ドルのTimekettle W4 Proは52言語を掲げ、Pixel Budsは40言語ですが接続が必要です。2026年8月18日、4社の公式サポートページを読み込み、マーケティングが飛ばす問いに答えました。会話が終わったあと、その会話をまだ持っているのはどれか。翻訳イヤホン市場のガイドと、誰も売っていない「もうひとつの仕事」の話です。

Ken Jo·続きを読む
ai and society

Anthropic が Claude の文章に電子透かしを入れ始めた — そして 1,922 件の判決が示す限界

2026年8月11日、Anthropic は Claude が書いた文章に、後から追跡できる印を入れ始めました。この印はコピー&ペーストどころか翻訳にも耐えますが、書き直せば消えます。テキスト電子透かしの仕組み、検出結果が証明できること・できないこと、誤検知による冤罪の歴史、そしてこれまでに記録された 1,922 件のハルシネーション事例がすべてこの検査を通過していたであろう理由を、平易な言葉で整理しました。

Ken Jo·続きを読む
speech-to-text

音声認識も静かにオープンウェイトになった — サイズは1.56GB

アリババのQwen3-ASRはApache 2.0ライセンスで52の言語と方言に対応し、ダウンロードサイズは2ギガバイト未満です。オープンウェイトの文字起こし層をやさしく整理しました。いま何があるのか、自分のノートPCで動かすと実際に何が手に入るのか、そしてクローズドなAPIがいまだに勝っている場所はどこか。

Ken Jo·続きを読む
ai models

中国のオープンウェイト、3週間の疾走:Kimi K3、Qwen3.8-Max、そしてこの波を終わらせかねない逆転

この3週間で、中国の主要AIラボがフロンティア級のオープンウェイトモデルを公開、あるいは予告しました——Kimi K3、Qwen3.8-Max、そして正式提供に達したDeepSeek V4。それぞれが何なのか、何が実際に出て何がまだ約束なのか、そしてなぜ北京がいま自ら育てた波を規制しようとしているのかを、平易な言葉で読み解きます。

Ken Jo·続きを読む
guide

「再会議」をなくす:同じ意思決定を二度しないために

OpenAIの2026年7月の調査では、職種固有のChatGPTメッセージの43.5%が本人の職務外の仕事に関するものでした。そうした仕事は文脈に支えられていますが、組織の文脈の大半は会議のなかで消えていきます。会議を検索可能な業務知識に変える実践ガイド — 何を残し、どう名前を付け、どの会議を記録として保存し、検索がオンボーディングと引き継ぎをどう変えるのか。

Ken Jo·続きを読む
meeting operations

失敗したのは会議ではありません。その後の24時間です

ボトルネックは会議ではなく、その翌日です。決定は輪郭を失い、担当者は曖昧になり、フォローアップはDMの中で消えていきます。実行する組織が実際に回しているノートのループ——決定・担当者・期限を会議中に書き、数分以内に共有し、次の会議をそのノートで開く——を具体的にたどります。

Ken Jo·続きを読む
speech-to-text

単語誤り率2.4%、それでも誰が話したかは分からない

MicrosoftのMAI-Transcribe-1.5は単語誤り率2.4%を記録しました。そして同じモデルの公式ドキュメントには「話者分離はサポートされていません」と書かれています。WERが何を測っているのか、なぜリーダーボードが下限に密集しているのか、そして文字起こしを実用的な議事録に変えるのは音声認識の上のどの層なのかを、平易に整理します。

Ken Jo·続きを読む