現状調査 / AI MEETING AGENTS

会議に座るAI、
2026年8月の現在地

「聞いて書く」AIは完成した。「進行する」AIはまだ実験室にいる。その間に、我々にだけ空いている席が一つある。

結論

ファシリテートはまだ買えない。
買えるのは「会議中に、組織の記憶を引き出す口」。

記録・要約・宿題抽出はどの製品も実用段階。ただしそこは Plaud + SoT で既に閉じている領域で、買っても増えるのは記録経路の重複だけです。AIが音声で割り込んで議論を仕切る領域は、遅延・多人数のターン判定・日本語の「間」の三つで詰まっていて、まだ実験段階。ただし自社AIを会議に座らせる技術基盤(Recall.ai 等)はもう成熟していて、作ること自体は普通にできます。

LAYER 1 / 内蔵型
会議ツール自前のAI

Zoom AI Companion、Teams Copilot、Meet の Gemini。介入は画面とテキストのみ。

Plaud と重複
LAYER 2 / ボット参加型
外から入るノートテイカー

Otter、Fireflies、Granola ほか多数。中身はほぼ「録る・書く・要約する」で横並び。

Plaud と重複
LAYER 3 / 開発基盤
自社AIを会議に入れるAPI

Recall.ai ほか。喋らせるところまで可能。「カスタマイズできる」の正体はここ。

検討に値するのはここだけ
この資料で決めていただきたいこと

今は入れずに半年後に再点検(推奨)か、Layer 3 で「読み取り専用の参謀」を1会議だけ試すか。詳細は下の 05 に置きました。無回答なら推奨どおり、ウォッチだけ回して動かない形で進めます。

↓ 各章はクリックで開きます

01市場は3層に分かれている地図

LAYER 1 — 会議ツールが自前で持っているAI

Zoom AI Companion、Microsoft Teams Copilot(Facilitator)、Google Meet の Gemini。ボットを外から入れる必要がなく、既にライセンスに含まれていることが多い層です。ここでいちばん進んでいるのは Teams の Facilitator で、アジェンダ検知・議題ごとのタイマー・時間超過アラート・決定/未決の抽出を「会議中に」画面とチャットへ出します。

ただし介入はすべて画面とテキスト。音声で喋って場を仕切るわけではありません。日本語は3社とも正式サポートですが「会議あたり1言語」の制約が共通してあります。追加費用は、Teams の場合 M365 Copilot ライセンスが別途必要です。

LAYER 2 — 会議URLに外から入ってくるノートテイカー

Otter.ai、Fireflies.ai、Read.ai、Granola、Fathom、tl;dv、Circleback、Spinach.io など。数は多いのですが、機能の中心はほぼ全社が「録る・書く・要約する・後で検索する」で揃っていて、差は連携先とUIに出ています。Fireflies は CRM 連携と発話時間分析、Granola は「自分が手で書いたメモをAIが膨らませる」逆転の発想、Fathom / tl;dv はクリップ共有。音声で喋って介入するものは、この層にはほぼありません。相場は1人あたり月 $8〜20。

LAYER 3 — 自社のAIを会議に入れるためのAPI

Otakeさんが言われた「自分たち用にカスタマイズできるもの」は、正体としてはここです。中心は Recall.ai の Meeting Bot API(Zoom の公式パートナー、3,000社以上が利用)。Zoom RTMS / Google Meet Media API / Teams Real-time Media を1本に束ねた抽象化レイヤーで、各社のAPIを直接叩くよりこちらが実質標準になっています。

できることは、ボットとして入室 → 音声をリアルタイムで受け取る → 自社のLLMで処理 → Output Media API で音声を返して「喋らせる」まで。つまり Claude を会議参加者として座らせる構成は、技術的にはもう作れます。料金は録画 $0.50/時 + 文字起こし $0.15/時で、文字起こしを自前LLMに回すこともできます。

読み替えると

Layer 1・2 を買う話は「議事録サービスを増やす話」。Layer 3 を触る話が「AIを会議に組み込む話」です。我々にとって検討に値するのは Layer 3 だけで、Layer 1・2 は既に Plaud が埋めている席です。

02ファシリテートは、どこまで来たか核心

Otakeさんの問い ——「ファシリテートで力になってくれるのかどうか」。ここが今回いちばん知りたかった点なので、機能単位で割りました。

会議中の機能実装レベル実在する製品実用度
タイムキープ・議題残時間画面 + チャット通知Teams Facilitator、Fellow実用
発言バランスの可視化画面のみ(円グラフ・%)Equal Time、Zoom AI Companion実用
未決事項・宿題のその場抽出共有ノート・チャットTeams Copilot、Otter、Fireflies実用
脱線検知「本題に戻しましょう」画面提示が中心Teams Facilitator(間接的)部分的
AIが音声で問いを投げる音声発話まで到達MeetGeek の voice agent 等 要検証実験段階
議論の誘導・対立の調整—研究レベル(ACM 論文等)未到達

出典: Microsoft 公式サポート、Zapier「Best AI meeting assistants 2026」、各社公式ドキュメント。要検証 は Grok のライブ検索経由で拾った情報で、一次確認まで取っていません。

音声で割り込むAIが、まだ壁にぶつかっている理由

200–300ms
音声モデル単体の応答速度。Gemini Live 系・GPT Realtime 系の最良条件
1秒超
「今割り込むべきか」の判断を挟むと到達する遅延。ここを超えると人は不自然と感じる
多人数
最大の難所。1対1の音声対話は完成しているが、「誰のターンか」「今のは相槌か発言か」が会議では崩れる

そして日本語には固有の壁が重なります。相槌が多いのでターン検知が誤作動する。「そういう方向で」「まあそれはそれで」「じゃあそれで」——この曖昧な合意を決定として拾えるかどうかが、そのまま議事録の質になります。これは、我々が Plaud の要約を SoT に落とすときに毎回人の目で見ている部分と、まったく同じ壁です。

ファシリテートについての答え

「AIに仕切らせる」は、まだ買えません。ただし「人が仕切りながらAIのダッシュボードを見る」形なら既に実用になっています。2026年8月時点のAIファシリテーションとは、ファシリテーターを置き換えるものではなく、ファシリテーターの手元に計器盤を足すものです。

なお日本国内でも、AI司会・バーチャルファシリテーターを掲げるサービス(AGREEBIT「D-AGREE」、Notta Brain、Rimo Voice 等)が出てきています。ただし今回のライブ検索で拾った範囲では、製品ページとブログ記事の区別が付ききっていません。国産系を本気で見るなら、改めて一次情報を取りに行きます。

03我々にとっての、重複と空白自己診断

ここがいちばん大事な節です。我々は既に Plaud で録り、Claude Code のスキルで SoT に構造化し、決定・宿題・未回答の問いを積み、次回のアジェンダ案とアンチョコまで自動で出しています。「記録 → 構造化 → 次回準備」のループは既に閉じている。その上で会議ボットを入れると、何が重なり、何が新しく増えるのか。

重複する / 買っても増えない
  • 音声の記録
  • 文字起こし
  • 会議の要約
  • 決定事項の抽出
  • 宿題・アクションアイテムの列挙
  • 会議後のフォローアップ生成
  • 過去会議の検索
空白 / 会議ボットにしか出せない
  • 会議中に過去の決定を根拠付きで引ける
  • 「あれ、前どう決めたっけ」で会議が止まらない
  • 記憶違いによる蒸し返しを、その場で止められる
  • 残り時間と議題の進捗が全員に見える
  • 発言していない人が可視化される

左の列は、買った瞬間に「正本がどれか分からない」問題を持ち込みます。Plaud の記録、ボットの記録、Meet/Zoom 側の記録、そして SoT。四つが並立して要約が食い違ったとき、どれを信じるかを毎回調べることになる。これは機能の追加ではなく、運用コストの追加です。

右の列だけが、既存資産では原理的に埋まらない部分です。Plaud は「後で読むための記録」であって、「会議中に答える口」ではない。ここが唯一の投資対象になります。

04対面が混じると、ボットは弱い現場条件

我々の会議はオンラインと対面のハイブリッドです。ここはボット参加型が構造的に苦手とする領域なので、先に押さえておきます。

  • 会議室側の話者分離ができない。オンライン参加者は1人1マイクなので識別できますが、会議室は1本のマイクに複数人が乗ります。誰の発言か分からない、小声が落ちる、発言者名を取り違える。
  • 非言語が全部落ちる。指差しながらの「これ」、ホワイトボードの図、紙の資料、うなずきによる合意。カメラがあっても部屋全体の1枚映像では対応づけられません。
  • 記録上の影響力が偏る。ボットはデジタル側(チャット・画面共有・オンライン参加者名)を優先して拾うので、対面側の発言が記録上軽くなります。精度の問題ではなく、後から読む人にとって事実の重みが変わる問題です。
  • 会議前後のサイドトークを取れない。本質的な確認が開始前・休憩中・終了直後に起きることは多い。ここは Plaud のような物理レコーダーの方が強い領域です。
  • 外部参加者の会議では入れない。オーナー様・取引先が同席する会議で「録音ボットが参加者として入る」ことへの抵抗は現実にあり、主催者の入室許可も要ります。宿泊者名やトラブル内容が会話に出る以上、常時参加は情報管理の面でも不利です。
つまり

ボットを記録の主系にしてはいけない。Plaud を主系に置いたまま、ボットは「オンライン定例の、会議中だけの補助輪」として限定的に置く——これが我々の現場条件から出る配置です。

05今どうするか判断
A
今は入れない。半年後に再点検する推奨 ファシリテート能力は買える水準に達しておらず、記録系は既に自前で閉じている。今動く理由が薄い。音声モデルの多人数対応が進む2027年前後が実質的な見直し時期。ただし「AI会議参加」をウォッチ対象として ai-stack-watch に載せておく。
B
Layer 3 で、読み取り専用の「参謀」を1会議だけ試す Recall.ai でボットを1つのオンライン定例に入れ、呼ばれた時だけ SoT の過去決定を根拠付きで答える。自律発言なし、SoTへの書き込みなし、Plaud は継続。評価軸は「要約が上手いか」ではなく「探すために会議が止まる時間が減ったか」。コストは会議1時間あたり $0.65 程度+開発工数。
C
Layer 1 の範囲で、既に払っているものを使い切る 新規投資ゼロ。Google Workspace / Zoom 側のAI機能で、タイムキープと発言バランスがどこまで出るかだけ確認する。ファシリテートの「計器盤」部分を、買わずに味見する形。

Aを推す理由は単純で、今困っていないとOtakeさんご自身が書かれている通りだからです。困っていない領域に成熟していない技術を入れると、得られるのは機能ではなく運用の負債になります。「拙速に取り込むよりまず現状を見る」という当初の構えは、調査結果から見ても正しい構えでした。

ただしBは、やるなら筋がいい。これは「AIに会議を任せる」話ではなく、「我々が積んできた SoT を、会議中に引き出せるようにする」話だからです。投資対象はAIではなく、既存資産の出口。将来やるとしても、入口はここ一箇所に絞るべきだと考えています。

06出典と調査手段裏付け
  • Microsoft — Facilitator in Microsoft Teams meetings(support.microsoft.com)
  • Microsoft Inside Track — Facilitator 社内導入レポート
  • Zoom — AI Companion 公式ブログ/料金(zoom.us/pricing/aic)
  • Google — Take notes for me / Workspace AI for meetings(support.google.com/meet/answer/14754931)
  • Recall.ai — Pricing(recall.ai/pricing)
  • Recall.ai — Stream media / Output Media API(docs.recall.ai/docs/stream-media)
  • Zoom Developers — Recall.ai リアルタイムデータ提携アナウンス
  • Zapier — The 11 best AI meeting assistants in 2026
  • Granola — Meeting note tool pricing 比較(vs Fireflies / Fathom / Otter)
  • Notta 公式 / Notta Brain リリース
  • AGREEBIT「D-AGREE」(agreebit.jp)要検証
  • Crystal Method — AIファシリテーター解説(crystal-method.com)要検証
  • Inworld / flowtivity — Realtime voice agent レイテンシ比較
  • ACM — CLARA(virtual facilitator 研究)

調査手段: Grok 4.20 reasoning + live web search(現状マップ/ファシリテーション深掘りの2本)、ChatGPT(既存 Plaud + SoT 資産との重複評価1本)。要検証 は一次情報の確認が取れていない項目です。