1003 | 今週のAIツール速報:エージェントが動き出す

||Download

Show notes

今週の新ツール特集。AIエージェントの進化から開発ツール、音声・動画制作、日常とビジネスのアプリまで、話題の製品を分かりやすく紹介します。

タイムライン

  • 00:00:04 オープニング
  • 00:00:35 エージェントが自立する:実行・信頼・連携
  • 00:03:10 仕事の自動化:投稿・メール・サポート
  • 00:05:14 開発ツール:ハーネスとエディタ
  • 00:06:46 OSSで作る:動画・ブロック・検証ツール
  • 00:08:20 声と映像:生成メディア
  • 00:09:31 ビジネスとデータ:損益・金融・製造
  • 00:10:59 日常の学びと小物
  • 00:12:44 ドキュメント・環境・開発の習慣
  • 00:14:04 クロージング

関連リンク

このエピソードは Bri によって制作されています。Bri は高度な AI 技術で、あなたが気にかけるフィードを聞くためのポッドキャストに変換します。お問い合わせは hi@bri.so まで。

Transcript

葵: こんにちは、聞いてくれてありがとうございます。葵です。

悠真: 悠真です。今日も一日のプロダクト紹介を、8つぐらいの流れにまとめて話していきます。

葵: 今日全体を貫くテーマは、AIエージェントがどんどん「自立」してきて、だからこそ信頼と連携の作り方が重要になっている、ということなんです。

悠真: そう。エージェントに本体と権限を与える話から始まって、仕事に組み込む例、開発ツール、そして生成メディアやビジネス、日常系まで。一つの流れとして見てみましょう。

葵: では最初、一番印象的だったやつから。ManusのCueっていうやつ。

悠真: これ、個人のエージェントに、メールアドレス、電話番号、ウォレット、そして自分のコンピュータまで持たせる、っていう発想なんだよね。

葵: つまりエージェントが「人格」を持ってるみたいな状態で、電話をかけたり、支払いをしたりするところまで代行できる。

悠真: 今までのエージェントって、チャットでテキストを返すだけだったり、ブラウザを操作するくらいだったりしたんだけど、Cueは「行動できる実体」を与えてる。電話番号があれば電話ができる、ウォレットがあれば支払いができる、コンピュータがあれば作業ができる。これは本気で自立させようとしてる。

葵: でもね、ここで絶対に議論になるのが支払いや実行権限の安全性。エージェントにお金を払わせるって、間違えたらどうするの、って話。

悠真: うん。これ、まだ答えが出てない問題で、今後の焦点になると思う。ウォレットを持たせた瞬間、「このエージェントは信頼できるのか」が技術の問題じゃなくて制度の問題になる。

葵: そこで面白い対比になるのが、JarvisCoreっていうPythonのフレームワーク。こっちは複数のエージェントをどう連携させるかの話で、オーケストレーターを使わないP2Pのメッシュ構造にしてる。

悠真: 普通だと、中心に司会者みたいなオーケストレーターがいて、そこからエージェントに指示を配る形なんだけど、JarvisCoreはエージェント同士が直接つながるメッシュにしてる。中央がない分、構造がシンプルになるし、ボトルネックもない。

葵: そして一番気になるのがzero-trust設計で、認証情報をエージェント自身に見せないようにしてる。

悠真: これはCueの支払い問題とつながる話で、エージェントに権限を全部渡すのじゃなくて、「エージェントは仕事をする、でも認証情報はエージェントの手の届かないところで管理される」っていう設計。これならエージェントが暴走しても、直接クレカ情報とかを吸い出せない。

葵: Cueが「全部持たせる」方向、JarvisCoreが「持たせないで安全に動かす」方向で、二つの極が並んでる感じがするね。

悠真: そして三つ目、Codync。これはClaude CodeとかCodexみたいな40以上のエージェントを、名前のついたボットとして実行して、iPhoneから操作できるっていうもの。MITライセンスでオープンソース。

葵: 「名前付きボット」っていうのがいいところで、各エージェントが固有のアイデンティティを持って、どこからでも指示を出せる。オープンソースだから、自分の環境に合わせてカスタマイズもできるし。

悠真: ここまでで、エージェントに「本体を与える」「連携を安全にする」「管理する」っていう3つの視点が出た。次は、実際に仕事にどう組み込まれてるかの例。

葵: うん。まずLinkedIn投稿を全部やってくれるエージェント。英語とフランス語対応で。

悠真: これ何がすごいかって、ただ文章を生成するだけじゃなくて、インタビューして、あなたのエピソードを記憶して、それを計画して、あなたの声で公開する、っていうところまでやってる。

葵: 「あなたの声で」っていうのが大事で、本人の話し方やトーンを学習してるから、生成された投稿が本人が書いたみたいに見える。エンジニアリングマネージャーとか、個人で発信したい人には実用的。

悠真: ただ、ここにも信頼のテーマが現れてるんだよね。「あなたの声で投稿する」っていうのは、エージェントがあなたになりすまして発信するっていうことでもある。どこまで本人の承認を挟むか、っていう設計が必要になる。

葵: そう、それが次のAudryo。メールのライフサイクルをエージェントに任せるんだけど、MCPとAPIを通じて操作して、送信の前に必ず人間の承認を挟むように設計されてる。

悠真: さらにsandbox環境があって、実際に送る前にテストできる。連絡先の保存も無料で提供されてる。つまり「エージェントが書く、でも送るのは人間が承認してから」っていう、中途半端じゃなくて明確な線を引いてる。

葵: 明確な境界線っていうのが、信頼の構築には大事なんだと思う。エージェントに全部任せるんじゃなくて、「ここまではOK、ここから先は人間」って線をはっきりさせる。

悠真: そしてCommunicate。これはカスタマーサポートのAIエージェントで、自社のドキュメントで学習して、引用付きの回答をする。

葵: 引用付きっていうのが信用の部分なんだよ。エージェントが「こうです」って言っても、どこに基づいてるかわからないと、カスタマーサポートとしては使えない。引用があれば、「このドキュメントのこの部分に書いてある」って確認できる。

悠真: さらに、AIで解決できないやつは、共有受信箱で人間に引き継ぐ。価格は月19ドルから。

葵: 三つ並べると、全部「人間の承認」と「人間への引き継ぎ」をシステムに入れてる。これはエージェントが仕事に入ってくる時の標準的なパターンになりそう。

悠真: じゃあ次、開発現場のエージェント活用へ行こう。CodeAFっていうの。

葵: CodeAFはApache 2.0ライセンスのオープンソースのharnessで、オープンウェイトモデル向けに作られてる。

悠真: 「harness」っていうのは、モデルを実際に動かすための土台みたいなもの。モデルだけあっても、タスクを受け取って、実行して、結果を評価する仕組みがないと仕事ができない。

葵: このCodeAF、DeepSWEベンチマークで首位を取ってて、issueあたりのコストが最安と主張してる。

悠真: ここ、注意して聞いてほしいのは、これは開発元の主張であって、僕らが確認したわけじゃないってこと。ベンチマーク首位や最安コストは、実際に試してみないとわからない部分がある。

葵: そうだね。でも方向性としては重要で、「クローズドなモデルじゃなくて、オープンウェイトのモデルでコーディングエージェントを回す」っていう選択肢が現実的になってきてるってこと。

悠真: そして対極にあるのがWu。Zedのフォークで、Rustで書かれたネイティブエディタ。これが面白いのは、AIもテレメトリも入れないって明言してる点。

葵: Zedはもともと速くて軽いことで有名なエディタで、そのフォークだから基本性能は受け継いでる。見た目はVS Codeっぽい。

悠真: 今のエディタって、どこもAI機能が競争軸になってるから、「AIなし」って逆張りに見えるかもしれない。でも、AIがなくても速くて使いやすいエディタが欲しい人には、これは明確な選択肢になる。

葵: CodeAFみたいに「エージェントに全部やらせる」重い方向と、Wuみたいに「AIに頼らず自分で書く」軽い方向、両極が並んでる面白い構図だよね。

悠真: 次はオープンソースの開発ツール群。まずWeftCut。

葵: WeftCutは動画編集のオープンソースで、MITライセンス。特徴は、MCPを通じてAIエージェントが操作できること。

悠真: 動画編集って、普通は人がタイムラインをいじる作業なんだけど、エージェントに任せられるようになってる。リアルタイムタイムラインに対応してて、アニメーションモチーフはコードで書ける。

葵: 「アニメーションをコードで書く」っていうのは、動画制作の世界観が変わる話で、デザイナーじゃなくても、プログラムで演出を作れる。

悠真: 次がslash-editor。React用のNotion風ブロックエディタで、Tiptap v3のheadlessコアをベースにしてて、UIはshadcnで、リアルタイム共同編集も対応。MITライセンス。

葵: 「headless」っていうのがポイントで、見た目は自分で組み立てられるけど、ブロックエディタの面倒なロジックは任せられる。Notionみたいな編集体験を自社アプリに入れたい開発者には便利。

悠真: 三つ目、Open Inspector。ブラウザ拡張のインスペクタで、これもMIT。面白いのは、サイトへの権限要求もネットワーク通信もしないってこと。

葵: 拡張機能って、普通は「このサイトのデータ読みます」みたいな権限を求めるんだけど、これはそれをしない。だからプライバシーの心配がほぼない。

悠真: デザイントークンの出力とWCAG監査ができる。つまり、サイトのデザインをトークンとして取り出して、アクセシビリティのチェックもできるっていう、開発者向けの道具。

葵: 三つともMITで、エージェントや開発者の道具として使えるものが揃ってるっていう流れだね。

悠真: じゃあ、音声と映像の生成メディアに行こう。まずElevenLabsのEleven v4とTurbo。

葵: これ、彼らが「最も表現力豊かな音声」って言ってるモデル。Turboの方は約100ミリ秒の低遅延で、リアルタイムのエージェント向け。

悠真: 100ミリ秒っていうのは、電話で話す感覚に近いレベルの遅延。この低遅延があると、エージェントが声で会話できる。さっきのCueが電話をかけられる、っていう話とつながる。

葵: さらに、10秒の音声からクローニングができる。たった10秒で自分の声を複製できるって、個人でも楽しめるし、ビジネスでも使える。

悠真: 一方で、映像の方はSyllaby Avatars 2.0。高精細なアバターで、リップシンクが改善されてて、表情をカスタマイズできる。カメラなしで数分に動画を制作できる。

葵: 声と姿が揃うと、「エージェントが電話をかけて、相手には人間に見える」っていう世界が具体的になる。技術的にはすごいけど、それが良いのか悪いのか、社会的な議論はまだこれからだよね。

悠真: うん。表現力が上がるほど、「これは人が作ったのかAIが作ったのか」がわからなくなる問題は深まっていく。

葵: で、ビジネスとデータの話に移る。Veltrixっていうの。

悠真: VeltrixはShopifyやXeroのデータをAIで分析して、利益率の損失と改善アクションを提示するサービス。

葵: eコマースって、売上は見えてるけど、「どこの利益が逃げてるか」は意外と見えにくい。配送コストとか、返品とか、広告の非効率とか。それをAIがデータから探して、「ここ損してるから、こうしたらいい」って教えてくれる。

悠真: 最初のチェックは無料で試せる。「損失を見つける」っていうのは具体的な価値で、価格の説明もしやすい。

葵: 金融データの方はFinbar。世界中の金融データをAPIとMCPで提供してて、モデルとリサーチAIも含まれてる。

悠真: 大規模なヘッジファンドがすでに使ってるっていうのが実績として挙げられてる。金融データって、正確性と速さが命だから、プロが使ってるっていう事実は一定の信頼の根拠になる。

葵: そして物理的な制作側、Bambu Lab R1。55WのCO2レーザーで、自動ミラー整合が1分でできる。

悠真: レーザーカッターって、普通、光の道を整えるのが面倒だったりするんだけど、これを1分で自動でやる。作業サイズは600×300ミリで、オプションで3メートルのコンベヤも付けられる。

葵: 「データで利益を見つける」っていうソフトの側と、「レーザーで物理的に制作する」っていうハードの側、両方が揃った感じだね。

悠真: では、日常の学びと小物に移ろう。まずTeachoo。

葵: iAsk.aiチームが作った、無料のAIチューターで、問題の写真を撮ると、答えを教えるんじゃなくて、一問ずつヒントを与えながら導いていく。

悠真: 「答えを教える」んじゃなくて「答えにたどり着かせる」っていうのが教育として正しい方向。無料で使えるっていうのも大きい。

葵: 似た方向でGauthっていうAI講座のやつがある。無限キャンバスに章を並べて、チューターが白板上で答えて、最後にPDFに書き出せる。

悠真: 白板上で答えるっていうのは、黒板で先生が説明するのに近い体験で、学習の理解度が上がりそう。PDFに書き出せるから、復習もできる。

葵: 小物系も行こう。esignaはメールの署名をビジュアルに作れるエディタで、26個のテンプレートがあって、無料でアカウント不要。

悠真: 今の署名をコピペするだけでも動くっていう手軽さがいい。メールの署名、意外とみんな適当にしてて、ちゃんとしたやつにしたいけど面倒っていう人にちょうどいい。

葵: そしてHalo。Macのメニューバーや画面の端にDynamic IslandみたいなUIを出せるアプリで、DDC/CIで外部モニターも制御できる。4.99ドルの買い切りで、アカウント登録不要。

悠真: 「買い切りでアカウント不要」っていうのが心地いいサブスク疲れへの答え。外部モニターの明るさとかをMacから直接制御できるっていうのも実用的。

葵: 最後に軽く、Clef。Cloudflareが出した27Bのオープンソースモデルで、テキスト、JSON、画像、動画を読めて、一つのパスで選択肢ごとの確率を返す。

悠真: マルチモーダルの分類モデルっていう位置づけで、いろんな種類の入力を一つのモデルで扱えるっていうのが便利なところ。オープンソースだから自分で動かせる。

葵: で、最後のトピック。開発者の日常を整えるやつ。

悠真: まずMintlify Desktop。ドキュメントアプリで、ローカルのMarkdownで書けて、オフラインでも動いて、同期される。エージェントネイティブっていう位置づけ。

葵: ドキュメントを「エージェントネイティブ」って言うのは、ドキュメントをエージェントが読んだり書いたりすることを前提に設計してるっていうこと。開発チームのドキュメントって、エージェントが参照する機会が今後どんどん増えるはず。

悠真: 次がMoxie。Claude CodeのためのMacのメニューバーアプリで、ChatGPTやGeminiやOllamaに、セッションを失わずに一括で切り替えられる。

葵: 「セッションを失わずに」っていうのが大事で、エージェントを切り替えると普通は状態が消えたりするから、それを保持したままモデルを変えられるっていう実用性。

悠真: エージェント前提の道具が、メニューバーに住むくらい普通の存在になってきたっていう証拠だと思う。

葵: 最後がShipHQ。RevenueCatとGA4のデータを映すアイソメトリックなオフィスで、朝にDaily Briefが来る。トロフィーは非遡及的っていう仕様で、iPhoneアプリは無料。

悠真: 自分のアプリのメトリクスを「ゲームみたいなオフィス」で見せるっていう発想で、毎朝のBriefが習慣になる。トロフィーが非遡及的っていうのは、過去に遡って付与されるんじゃなくて、これから頑張って取るもの、っていう設計。

葵: 今日の全体を振り返ると、エージェントに本体と権限を与える流れが明確になってきて、同時に、人間の承認、zero-trust、引用、引き継ぎっていう「信頼の仕組み」が道具として組み込まれてるっていうのが、一番大きな流れだと思う。

悠真: うん。エージェントが賢くなることと、エージェントを信用できるようにすること、二つの進歩が並行して進んでる。そして、そのエージェントを支える側の道具、エディタ、動画、ドキュメント、メニューバー、全部が「エージェント前提」に設計され始めてる。

葵: 支払いや実行権限の安全性はまだ答えが出てない課題だから、ここは今後の動きに注目するといいと思う。

悠真: 今日はこれで。聞いてくれてありがとうございました。

葵: またね。