0922 | 今週のAIツール速報:エージェントから可視化まで

||Download

Show notes

今週のAI・開発ツールの新情報を4つのテーマで紹介します。自律エージェントの実用化とセキュリティ、AI検索時代のブランド可視化、クリエイター向け制作ツール、そして仕事と生活を支える実用アプリを取り上げます。

タイムライン

  • 00:00:04 オープニング
  • 00:00:55 自律エージェントの実戦投入と安全確保
  • 00:06:21 AI検索時代のブランド可視性と広告検証
  • 00:12:44 モバイルとローカルで進むクリエイター制作
  • 00:17:32 暮らしと仕事の手続きを自動化する道具
  • 00:23:31 クロージング

関連リンク

このエピソードは Bri によって制作されています。Bri は高度な AI 技術で、あなたが気にかけるフィードを聞くためのポッドキャストに変換します。お問い合わせは hi@bri.so まで。

Transcript

: こんにちは、ポッドキャストの時間です。葵です。

悠真: 悠真です。今日も最近発表された製品やツールを、実際にどんな人が、どんな問題を、どう解決しているのかという視点で拾っていきます。とりあえず軽く全体をつなげておくと、今日出てくるのはどれも「AIに何かを任せる」あるいは「AIに見られる」話ばかりなんですね。画面作業をするエージェント、iPhoneから動かすコーディングエージェント、AIの回答で自社がどう見えているかを測るツール、そして家族で使うAI。どれも距離がすごく縮まっていて、同時に「任せていいのか」という問題が追いついていないのが面白いところです。

: そうそう、あと制作系もモバイルで完結するようになってきたり、履歴書とか返金対応みたいな手続き系の自動化もあったり。前半は自律エージェントの話から入りましょうか。

悠真: はい。じゃあ最初のテーマは、ここが一番濃いので、じっくりいきます。Simularっていう会社の「Sai」なんですが、これを彼らは「ロボ秘書」の集団と呼んでいます。要点は、APIが不要で、自律的に動く「コンピュータ」たちが画面上の仕事をやってくれる、というもの。OSWorldというベンチマークで73%を出している、と彼らは主張しています。無料枠もある、という情報だけ覚えておいてください。

: ここで大事なのは、73%がメーカーの自己申告である、という点ですね。ポッドキャストでは私たちも毎回言っていることですが、これは実測された結果というより「主張」として扱うべきです。じゃなくても、構想は強烈で、つまり、これまでLLMにさせるときは必ずAPIで連携していました。SlackのAPI、ブラウザのAPI、みたいな形で。でも現実の仕事って、人が画面を見て判断して操作する、その形のまま残っているものが多い。SaiはそのままだとAPI化が難しい、そういう部分を「画面作業」としてまるごと引き受けようとしています。

悠真: それが「コンピュータの群れ」という表現なのが意味深で、一人のAI秘書ではなく、秘書を何人も部下のように使う。タブを整理するやつ、ファイルを確認するやつ、みたいな役割分担をAI側で作れる。人間側は指揮するだけ、という姿です。

: で、それが安く速く動くために登場するのがTypeSafe AIの「Jev」。Saiと直接つながっているわけではなくて、別の会社の別の製品ですが、話としては同じ流れの中にあります。Jevは、70から500ミリ秒で「型付きの確率的判断」を返すモデルです。つまり「YesかNoか、確率いくらで」という形の答えだけを出す。名前として、Choice、Score、あとNoulという型が用意されています。

悠真: 40から400倍安い、というのも主張の一部ですね。これは、巨大なチャットモデルに「この文、だからDuかSieか」といちいち聞くのは、電球でアリのふん裂きみたいな話で、判断に特化した小さいモデルならそれで十分だ、という考え方です。70ミリ秒から500ミリ秒という応答速度は、人が待てる範囲、リアルタイムでも通る範囲です。

: で、このJev、実はオープンソースの派生がいて、slop-graderというCLIツールがあります。名前が物騒ですが(笑)。これは、テキストをカスタムルールで採点するコマンドラインツールです。ルールセットは自分で書けて、「AIっぽい埋め草が入っていないか」「文法は正しいか」「Du/Sieの使い分けは合っているか」といった、ドイツ語圏だと実務で本当に痛い問題とか、そういうものを判定して、問題のある行を抽出して「これ、エージェントに直させて」と渡せる形にしてくれます。

悠真: つまり、Jevが「速くて安い判断エンジン」で、slop-graderが「それを文章の品質管理に使う道具」という関係です。エージェントが量産した文章を、さらに別の小さなモデルが点検する。この流れ、後で出てくる「成果物がAIにどう見られるか」という話につながっていきます。

: ただ、自律エージェントは便利な反面、怖い部分もあります。プロンプトインジェクションですよね。このテーマで一番ハードな部分。ここで出てくるのがArcjetです。これは、ランタイムでのセキュリティを提供するもので、具体的には、プロンプトインジェクションの検知、ツール呼び出しの認可、データのマスキング、ボットの遮断、そういうものを「コード内で強制」します。

悠真: 「コード内で強制」というのがポイントで、つまり、アプリケーションのコードの中に、こういうエージェントがツールを呼ぶとき、このメソッドは許可する、このデータは隠す、というルールを直接書く。検知だけでは通さない、ブロックまでやってくれる。プロンプトインジェクションの検知は、実運用だと、外部から来たメールやWebの内容がエージェントに読み込まれた瞬間に、悪意ある指示が混ざっていて、エージェントがそれに従ってしまわないか、という防御です。

: で、自律エージェントをどう運用するかという問題が、今度は「どこから操作するか」という話につながります。Superset Mobileです。これはiPhoneから、Claude CodeとかCodexみたいなコーディングエージェントを監視・指示するためのもの。diffを見て、PRをマージする、ということが全部スマホからできる。初月無料で、コードはMOBILELAUNCH。

悠真: これは変更が大きいと思います。従来のコーディングエージェントは、PCで動かすのが当たり前でした。でも現場の開発者って、移動中、打ち合わせの間、みたいな時間が意外と長い。その間にエージェントが仕事をしていて、その成果をとりあえずスマホで確認して、問題なければマージして次へ、という流れができます。

: その流れで忘れがちなのが、「じゃあそのマージの責任はどこにあるのか」という問題です。エージェントが書いたコードを、スマホの小さい画面でdiffをちらっと見てマージする、という行為がどんどん軽くなっていくと、コードレビューの実質はどこに消えるのか、エージェントの誤動作率を誰がどう測るのか、というのは、このテーマの「まだわからないこと」として残っています。

悠真: で、これが次のテーマへの自然なつなぎになります。エージェントに任せる仕事が増えるということは、成果物がAIにどう見られるかがますます重要になる、ということ。ここからは、「AIに見られる側」の話に入ります。

: 最初の製品はJevtownというもの。これは面白いというか、ちょっとクレイジーな発想で、1万の「模擬AI住民」があなたの投稿を公開前に審査する。弱い文章は0.005ドルで淘汰される。もし受け入れられたら、14秒で拡散まで行く、と。

悠真: つまり、「コンテンツを世に出す前に、世の中の反応を模擬で見る」ということです。実際の人間にテストする前のシミュレーション、みたいな。0.005ドルという数字は、弱い文章を淘汰するコストとして提示されているようです。つまり、数千円レベルではなくて、ほぼゼロに近いコストで、投稿を揉み潰せる。

: これをどう読むか、というのがポイントです。おそらく、LLMを1万体動かして「模擬世論」を作り、そこにコンテンツを投げて、反応を先に見る。強いものだけを現実にリリースする。だからこそ「14秒で拡散」という数字が出てくる、と理解できます。ただ、これは疑問として残しておくべきことです。模擬反応が、実際の反応をどこまで再現するのか、です。AIたちの「好き」と、人間の「好き」がどこまで一致するのか。これは主張としてはあり得るけど、まだ検証が浅いと思います。

悠真: その点を気にするなら、実の人間を使う方法もある、というのがNiubiGEOです。これは、オープンソースのセルフホストの「AI可視性テスト」の部分と、有償の「15万人以上の人間ネットワーク」を組み合わせたもの。人間の側は、テスト、トライアル、コンテンツ、そして配信に使う、と説明されています。

: つまり、SaaSの「AIがどう答えるか」を自分でセルフホストで測る仕組みと、15万人の実人間を利用して、テストしてもらう、トライアルしてもらう、コンテンツを作ってもらう、そして実際に配信してもらう、という部分。これ、先ほどのJevtownと対比で見るとわかりやすいです。Jevtownは「模擬AI住民で先行審査」、NiubiGEOは「実人間ネットワークで補完」。どちらも「世に出る前に反応を見たい」という動機なのに、アプローチが正反対なんです。

悠真: じゃあ、あなたのブランドが「見えているか」をどう測るのか、というところに入ります。Lead Sparkerです。ブランドのURLを貼ると、Oriane APIが、InstagramとTikTokの中から、タグ付けされていない言及、つまり、あなたのことを話してくれているのに、タグでつながっていない人を見つけます。

: 例としてLiquid Deathが出されていますが、これは、タグがないために、あなたが届かないリーチを持つUGCが存在している、という現象です。Lead Sparkerの例では、5人のタグ付けされていないクリエイターと、216,000の見えていなかったビューが発見された、とあります。つまり、216,000のビューが、毎回どれだけの機会損失か、を可視化した、という話です。

悠真: これは、発見の経路として、あなたの公式チャンネルやハッシュタグでなくても、誰かがあなたの話をしているという事実を、AIが探してくれる、ということ。今までは、ハッシュタグで探す、みたいな手動の発見でしたが、それを自動化して、「これくらいの機会損失があった」と可視化してくれる。

: そして、その「見え方」を測定・管理するのが、Simha DigitalというSEOのワークスペースです。これは、サイトの健康度を0から100でスコア化して、修正計画を優先順位付きで出してくれる、というSEOの基本機能に加えて、AI回答での可視性、つまりGEO/AEOの追跡をやってくれます。価格は月19.90ドルから。

悠真: 用語を整理しておくと、SEOは検索エンジンでの順位。GEO/AEOは、AIに聞いたときに、あなたのサービスが答えの中に含まれているかどうか。たとえば「こんな問題に合うサービスは?」とAIに聞いたとき、あなたの名前が出てくるか、出てこないか。この測定を、SEOのダッシュボードと並べて管理できる、というのがSimha Digitalです。月19.90ドルは、そういう機能としてはかなり入門的な価格です。

: この流れで、もっと別の見え方の話を繋げましょう。広告の話。Decodeの「AI Creative Insights」という製品です。これは、広告に対する反応を、お金を払う前に予測するもの。アテンションヒートマップ、感情のカーブ、カテゴリーベンチマーク、という機能が出されています。

悠真: つまり、クリエイティブができあがったら、まだ一円も配信にお金を払う前に、それをAIで見て、「どこに視線が集まるか」「感情がどう動くか」「同じカテゴリ内で、どんな位置にあるか」を予測してくれる。これも先ほどの「Jevtownの模擬住民」と、そして「NiubiGEOの15万人ネットワーク」と同じ、「世に出る前に見る」という流れの中にあります。方法が、模擬AI、実人間、予測モデル、と分かれているだけです。

: ここで、このテーマの全体像を一度まとめると、AI経由の発見が、新しい集客の前面になりつつある、ということ。それに対して、実に三つの側面から取り組む道具が出てきています。1つは「AIにどう見られるか」の測定と管理。もう1つは「世に出る前にどう反応されるか」の予測とテスト。そして3つ目は「見えない言及を発見する」こと。これが、今後の標準的な組み合わせになっていくかもしれない、という予感があります。ただ、未知として残るのは、模擬反応が実反応をどこまで再現するのか、という点です。あと、AI回答の測定は、AI側の変化にどれだけ追従できるのか、という課題もあります。

悠真: そうそう、ここでSecAIQ Watchという、テーマの枠を越える補足情報を入れておきます。これは、オープンソースのローカルの読み取り専用ダッシュボードで、自分のマシン上にある約37のAIツールを検出して、接続先、権限、トークンの使用量を見せてくれる。そしてAI-BOMという、AIの部品表を出力する。PHPとSQLiteで動く、MITライセンスです。

: これは、最初のテーマのArcjetの「あなたが作るエージェントをどう守るか」とは逆で、「あなたの環境に勝手にいるAIをどう見るか」という話です。エージェントを増やすと、この視点の重要性が増します。で、このSecAIQ Watchは後半の話にもつながるので、そこでも出てきます。

悠真: さて、テーマを変えます。今の話は「AIにどう見られるか」でしたが、次は「モバイルとローカルで、クリエイターの制作がどう変わるか」。これは撮影から編集までがどんどん現場で完結していくという流れです。

: 最初にGoogle Flowのモバイル版です。これはiOSとAndroid向けのAIクリエイティブスタジオで、2つの特徴が出されています。1つは「カメラロールへの接地」、もう1つは「端末間のプロジェクト同期」。

悠真: つまり、スマホのカメラロールにある自分の映像を素材としてAIに渡して、AIがその素材を使って何かを作る。そして、スマホで始めたプロジェクトを、別の端末で続きができる。制作の入口が、重い編集機ではなく、常に持ち歩くスマホになる、という流れです。

: ここで、撮影の工程を見てみましょう。DJI Osmoというカメラで撮った映像を、Macに取り込むためのアプリがOsmoticです。無料でオープンソース、MITライセンス。Wi-Fi経由で映像をダウンロードできて、速度は約33MB/s。そして、ダウンロードを再開可能にして、日付フォルダ単位で整理してくれます。さらに、リモートコントロールと、USB接続でWebカメラとして使う機能も。MITライセンスで誰でも確認できる、という点は、先ほどのslop-graderと同じで、開発者ツールの透明性という流れの中にあります。

悠真: つまり、撮影して、Wi-FiでMacに取り込んで、そしてそのMacで編集する。この取り込みの部分が、商用ツールではなくオープンソースで解決される、というのが地味に重要です。取り込みって、実はクリエイターの一番に義務感のある作業で、そこが33MB/sで、しかも中断があっても再開できるというのは、時間の節約としては大きい。

: で、その取り込んだ映像を、特に「ドキュメンタリー編集」の文脈で助けてくれるのがSupacutです。これは、ドキュメンタリー編集者向けのツールで、インタビューのサウンドバイトを見つけて、複数のインタビューにわたって回答を比較して、編集可能なラフカットを生成してくれます。価格は年間39ドルで、自分のAPIキーを使う方式です。

悠真: ドキュメンタリー編集の本当に面倒な部分は、インタビューの生の映像を全部見て、使える言葉を見つけるところです。数時間のインタビュー映像があると、それを全部人間が見て、いいセリフを拾い出す。これをAIにやらせて、さらに、複数のインタビューの中で、同じ質問に対する回答を比較してくれる。つまり「誰がこの質問に一番いい答えをしたか」を一発で見つけられる。そして、最後のラフカットは「編集可能な形」で出力される、というのが大事です。つまり、AIが完成形を出すのではなく、人間がその後、編集できる形に落とす。これは、AI制作ツールの設計として、あるべき形だと思います。

: ただし、ここにも未知があります。AI生成のラフカットの「編集品質」です。AIが選んだシーンが、本当にいい選択なのかどうか。これは実際に使ってみないとわからないことで、主張としての「生成できる」と「実際に使い物になる」は別の話です。

悠真: そして、このテーマの補足として、App Storeの制作側を支えるAppGrowthKitというものがあります。これは、App StoreやGoogle PlayのスクリーンショットをAIで作るものです。デバイスフレーム、AIによるレイアウトとコピー、ローカライズ、アイコン、そしてワンクリックでのエクスポート。

: これは、先ほどのSupacutと同じ、「制作の最後の工程をAIで埋める」という流れの中にあります。映像を作っても、Appとして出すときにスクリーンショットが必要で、これは実は商材として重要なのに、多くの開発者にとって苦痛な作業。それをAIで一気にやる、というものです。

悠真: もう1つ補足として、Gradio Workflowというものがあります。これは、Hugging FaceのSpacesやモデル、データセット、そしてPython関数をつなげるためのビジュアルキャンバスで、AIパイプラインを構築できます。そして、URLかREST APIで共有できる。

: これは、クリエイターの話というより、開発者の話に近いのですが、制作の流れの中に置くと、「AIの機能を組み合わせて、自分だけの制作パイプラインを作る」ための道具です。サンドボックスのワークフローを、URLで共有できる、という点は、チームでの利用を意識しています。

悠真: このテーマをまとめると、制作の全工程がモバイルとローカルで完結しつつあり、Google Flowが「同期の面」、Osmoticが「取り込みの面」、Supacutが「編集の面」を埋めている。同期とローカル処理の組み合わせが、今後どう進むか、というのが注目点です。そして、コンテンツが完成したら、次は「配信や公開の工程」です。これは後半の話につながります。

: さて、最後のテーマは、暮らしと仕事の手続きを自動化する道具たち。ここは、家族、官公庁、App Store、就職と、実にいろいろな「面倒な手続き」が、個別に、でもほぼ同じタイミングで、自動化の対象になってきています。

悠真: まずGoogle LabsのCC。これは、家族で共有するAIエージェントです。最大6人までメンバーを追加できて、各メンバーが、何を共有するかを自分で選べる。そして、このエージェントは、自分のGoogleアカウントを持つ、という点が面白いです。

: 「自分のGoogleアカウントを持つ」というのは、つまり、家族の誰かのアカウントを借用するのではなく、エージェント自体が独立した存在として、Googleの各サービスにアクセスできる、ということです。これは後で権限の話に関わってくるので、覚えておいてください。そして「最大6人で、それぞれが何を共有するかを選べる」という設計は、家族のプライバシーを壊さずにAIに手伝ってもらう、という問題意識の表れだと思います。

悠真: これは、家族という「ゆるく結びついた複数人の集団」にAIを入れる最初の本格的な試み、と位置づけられると思います。仕事のチームと違って、家族は、役割も権限もきちんと定義できない。その中で、何を共有して、何を共有しないかを、各人が自分で決められる、という設計です。未知の点としては、家族のデータをどう扱うのか、ということです。これは明らかに、まだ問いとして残っています。

: 次は、まったく別の世界、政府入札の世界です。Sell to Stateという製品です。これは、64カ国にわたる300万件の政府入札を、1つの検索で探せるようにするもの。入札、サプライヤー、そして政府機関、これらを横断して検索できる。価格は月49ドルの一律で、REST APIとMCPが用意されています。

悠真: 月49ドルの「一律」がポイントで、 通常この手の政府データのサービスは、国ごと、あるいは項目ごとに価格が変わったりします。それを一律にして、APIまで開けている。つまり、あなたのシステムに、直接組み込める、ということです。MCPが用意されているのも、最初のテーマのエージェントの話とつながります。エージェントに「政府入札を探して、こういう条件に合うものを教えて」とやらせる、という使い方ができます。

: ただし、未知の部分として、政府データの更新頻度があります。64カ国のデータを、どのくらいのタイミングで更新しているのか、これが実用の重要な鍵ですが、資料からは読み取れません。これは、使う前に確認すべき点です。

悠真: 次は、App Storeの返金対応を自動化するRefoidです。これは、iOSとmacOSの開発者向けに、App Storeの返金リクエストへの回答を自動化するもの。そして、Appleの最終的な判断を追跡してくれます。主張として出されているのは、返金リクエストの約70%は、拒否できる、という数字です。

: これは、開発者の実体験として、App Storeの返金って、お知らせが来て、それにどう対応するかを考える、という手間が、いちいち割り込んでくるんです。それを自動化して、かつ、「結局Appleがどう判断したか」まで追跡してくれる。これは、開発者の頭の中から、返金対応という「割り込みタスク」を消す、というものです。ただし、ここでも「約70%は拒否できる」というのは、あくまで開発元の主張であって、それが実際にどのくらいの正解率で運用できるかは、検証が必要です。

悠真: そして最後、就職の世界のPlumeです。これは、無料の履歴書ビルダーです。既存のCVを、PDFやWord、それから写真として取り込むと、ATS対応の履歴書を生成してくれます。43のテンプレートから選べて、PDFは透なしなしで無料でダウンロードできる。Proプランが月4.99ユーロで、AIによる調整が追加されます。

: ATS対応というのがポイントです。ATSは応募者追跡システムで、企業が応募者を管理するシステムです。履歴書をCSV的にパースして検索するので、レイアウトが凝っていると、読み込めないことがあります。Plumeは、既存の履歴書を取り込んで、ATSが読める形式に整えてくれる、ということです。そして、無料で基本機能が使えて、透かしなしのPDFがダウンロードできる。Proは、AIによる調整、つまり、求人情報に合わせて履歴書を最適化する機能が付く、という価格設定です。

悠真: このテーマを全体として見ると、GoogleのCCが「家族」、Sell to Stateが「政府」、Refoidが「App Store審査」、Plumeが「就職」。それぞれの世界で、「面倒な手続き」が、独立して、でもほぼ同時に、自動化され始めている。今後は、権限管理つきの共有エージェントが普及していくのではないか、と予想されます。

: ただ、その便利さの裏で、最後に問いが残ります。ツールの状態を、どこまで把握できるか。ここでSecAIQ Watchに戻ります。これは、最初のテーマでも触れましたが、あなたのマシン上にある約37のAIツールを検出して、接続先、権限、トークンの使用量を見せてくれる、読み取り専用のローカルダッシュボードです。そして、AI-BOMという、AIの部品表をエクスポートできる。

悠真: これが最後の問いにつながります。エージェントに任せる仕事が増えて、家族でAIを共有して、政府入札を検索して、返金対応を自動化して、履歴書を生成して、と、便利な道具がどんどん増えていくと、結局、自分の環境に、何が、どういう権限で、どうつながっているのか、という全体像を、誰が把握しているのか、という問題です。SecAIQ Watchは、その「把握」を、ローカルで、読み取り専用で、オープンソースで、安全にやるための道具として提案されています。

: これで今日の4つのテーマがすべて終わりました。全体を通してつなげると、AIが安く、速く、モバイルからも動くようになって、そして、AIに任せる対象が、仕事の画面作業から、家族の手伝い、政府入札、返金対応、履歴書作成まで広がっている。その反面、任せたものの安全性、成果物の品質、そして自分の環境の全体像の把握、という問いが、それに対応する形で道具として現れ始めています。

悠真: それでは、今日はこの辺で。次回も、この流れを追いかけます。ありがとうございました。

: ありがとうございました。