Articles

24 अप्रैल 2026Masahiro Taima

नवीनतम AI से क्या किया जा सकता है? Gemini, Claude, Open AI, OpenClaw, Genspark आदि की आधिकारिक दस्तावेजों से लगभग 600 फीचर्स का व्यापक संकलन


はじめに

AIの進歩はめざましく、次々とできることが増えています。ただ、SNSやテックニュースだと、断片的な活用事例の紹介が多く、全体としてどのようなことができるのかについては、俯瞰する情報は見当たらないです。ここでは、グローバルでユーザー数の多い主要なAIを15個程度取り上げ、公式ドキュメントを中心として、機能を網羅的に列挙しています。一般ユーザー向け・開発者向け両方の情報も入っています。いま、AIでどのようなことができるのか、ご参考いただければと思います。

AIの機能は、理解、検索、推論、生成、行動、その他の6つで分類しています。これは、最近のAIエージェントがReAct(Reason + Act)フレームワークやRAG(Retrieve + Generate)モデル、Retrieve-Reason-Actループなどを統合した概念と捉えられるため、AIエージェントの代表的な構成要素として理解、検索、推論、生成、行動を取り上げて、分類しています。


対象のAIと参照ドキュメント


”理解”に関する機能

ユーザーの意図、曖昧な自然言語、画像や音声などのマルチモーダルな入力データを構造的に把握する機能です。

テキスト理解・要約・情報抽出

  • テキスト要約 (Text summarization): 長文や複数のドキュメントの文脈を理解し、主要な要点や結論を抽出する基本機能 [OpenAI, Google/Gemini, Anthropic/Claude, Microsoft Copilot, Mistral, Meta/Llama, Kimi, DeepSeek]

  • 構造化データの抽出 (Structured output / JSON schema): 定義されたJSONスキーマに従い、非構造化テキストからエンティティや特定の値を正確に抽出・解釈する機能 [OpenAI, Google/Gemini, Anthropic/Claude, Meta/Llama, xAI, DeepSeek]

  • エンティティ抽出 (Entity extraction): 長文の中から人物名、企業名、日付、金額などの固有名詞やキーワードを識別して抽出する機能 [OpenAI, Google/Gemini, Anthropic/Claude, Microsoft Copilot]

  • トピックとユーザー意図の解釈 (Intent recognition / Topic triggering): ユーザーの発話や曖昧な質問から目的(意図)を解釈し、適切なエージェントフローを起動する機能 [Microsoft Copilot, OpenClaw, Google/Gemini]

  • 多言語の翻訳と文脈理解 (Multilingual support): 多言語で書かれたテキストをネイティブに解釈し、指定された言語へ翻訳・要約する機能 [OpenAI, Google/Gemini, Anthropic/Claude, Meta/Llama, xAI, DeepSeek]

  • コンテンツのモデレーションと安全性解釈 (Moderation / Safety checks): テキストにポリシー違反、有害性、不適切な要素がないかを分析・理解する機能 [OpenAI, Meta/Llama, Google/Gemini, xAI]

  • 会話コンテキストの把握 (Context management / Threads): 過去のメッセージ履歴やセッションの流れを記憶・理解し、文脈に沿った応答を行う機能 [OpenAI, Anthropic/Claude, Google/Gemini, xAI, OpenClaw, Perplexity]

  • 感情分析とトーンの解釈 (Sentiment analysis): テキストの言葉尻や表現から、ユーザーの感情状態やトーンを理解・抽出する機能 [Google/Gemini, OpenAI, Microsoft Copilot]

  • 大規模コンテキストの全体俯瞰 (Long-context understanding): 100万〜500万トークン、あるいは256Kなどの超長文を一度に読み込み、全体を俯瞰して理解する機能 [Google/Gemini, Anthropic/Claude, Meta/Llama, Kimi, DeepSeek]

  • プロンプト変数の自動抽出と解釈 (Templatize a prompt): ユーザー入力から変数を自動で特定・抽出し、システムに組み込みやすいテンプレート構造として理解する機能 [Anthropic/Claude]

  • キャラクターの心理推論と関係性抽出 (Character mind map): 本や物語から、登場人物の思考プロセスや人間関係を解釈して整理する機能 [Meta/Llama]

  • ペルソナと振る舞いのルール解釈 (Persona understanding): システムプロンプトや設定ファイル(AGENTS.md等)に記載された役割、トーン、ルールを自律的に理解し適応する機能 [OpenClaw, Anthropic/Claude, Mistral, OpenAI]

  • 研究論文・学術データの深い分析 (Analyze research papers): 複雑なフォーマットの学術論文や研究データを読み解き、科学的なインサイトを抽出する機能 [Meta/Llama, Google/Gemini, Anthropic/Claude]

  • 複数ドキュメントの横断的理解 (Multi-document analysis): アップロードされた複数のファイル間の関連性や矛盾を解釈して統合的に理解する機能 [OpenAI, Anthropic/Claude, Google/Gemini, Mistral, Kimi]

  • 組織データの業務文脈理解 (Data grounding): 社内のSharePoint、メール、チャットなどを読み解き、企業固有の業務文脈として理解する機能 [Microsoft Copilot, Google/Gemini]

  • プロンプトキャッシングによる文脈の再利用 (Prompt caching): 長大なコンテキストをキャッシュし、再計算なしで効率的に情報を解釈・抽出する機能 [OpenAI, Anthropic/Claude, xAI, DeepSeek]

  • チャットプレフィックスによる文脈の継続理解 (Chat Prefix Completion): 途中まで書かれたテキストのプレフィックスを正確に理解し、後続の文脈を予測・抽出する機能 [DeepSeek, OpenAI]

  • 法的文書・契約書の条項解釈 (Legal document analysis): 長大な法的ドキュメントから、リスク条項や義務内容を正確に理解・抽出する機能 [Anthropic/Claude, OpenAI, Google/Gemini, Kimi]

  • 履歴書の職歴・スキル抽出 (Resume/Profile extraction): 人事データや履歴書から、スキルセットや経歴を構造化して抽出・理解する機能 [OpenAI, Google/Gemini, Anthropic/Claude]

  • 医療データ・ヘルスケア記録の文脈抽出 (Healthcare data extraction): 診療記録や患者データから重要な医療インサイトや症状を解釈して抽出する機能 [Google/Gemini]

  • 会議録からのアクションアイテム抽出 (Action item extraction): ミーティングやサポートチャットの履歴から、決定事項やタスクを解釈して抽出する機能 [OpenAI, Microsoft Copilot, Anthropic/Claude]

  • 個人情報・機密情報の識別と抽出 (Sensitive Data Protection / PII extraction): 入力データから個人情報を理解し、保護・マスキングのために抽出する機能 [Google/Gemini, OpenAI, Microsoft Copilot]

マルチモーダル・視覚情報の理解(画像・動画・UI)

  • 画像内のオブジェクトとシーンの理解 (Image understanding / Vision): 画像に写っている物体、状況、空間的関係を視覚的な文脈として理解する機能 [OpenAI, Google/Gemini, Anthropic/Claude, xAI, Meta/Llama, DeepSeek, Kimi]

  • 光学文字認識とテキスト抽出 (OCR / DeepSeek-OCR-2): 画像化された文書や写真内の文字情報を抽出し、構造化データとして解釈する機能 [OpenAI, Google/Gemini, DeepSeek, Anthropic/Claude]

  • UIモックアップのコード解釈 (Image mock up to HTML): 画像に描かれた手書きメモやUIデザインの意図を理解し、コードの構造として解釈する機能 [Google/Gemini, OpenAI, Anthropic/Claude]

  • 複雑なチャートやグラフの視覚的分析 (Chart & Graph analysis): 画像化されたデータグラフから、数値的インサイトや論理的なトレンドを読み解く機能 [Anthropic/Claude, Meta/Llama, OpenAI, Google/Gemini]

  • 視覚的因果関係と論理構造の理解 (Visual Causal Flow): 複雑な図解やフローチャートから、情報の流れや論理的な因果関係を解釈して抽出する機能 [DeepSeek]

  • 動画のフレームと文脈理解 (Video understanding): 動画ファイルを入力とし、シーンの遷移や内容、動きの文脈を解析して情報を抽出する機能 [Google/Gemini, xAI, Kimi]

  • PDFのテキストと視覚コンテンツの統合解析 (PDF support / Document AI): PDF内のテキストだけでなく、図表やレイアウト構造も同時に解釈・抽出する機能 [Anthropic/Claude, Google/Gemini, OpenAI, Kimi, Mistral]

  • SNSポスト内のマルチモーダル解釈 (Enable Image/Video Understanding): ソーシャルメディアの投稿に含まれる画像や動画の文脈を特化して抽出・理解する機能 [xAI]

  • コンピュータ画面のUI構造解釈 (Computer use vision): デスクトップ画面のスクリーンショットから、UIの配置や操作可能な要素を視覚的に理解する機能 [Anthropic/Claude, OpenAI]

  • 画像編集用マスクの透過領域解釈 (Masking understanding): 指定されたマスク画像のアルファチャンネルを理解し、編集・再生成すべき領域を解釈する機能 [OpenAI]

  • カメラを通じた物理世界の視覚的解釈 (Device Camera Vision): モバイルアプリなどのカメラから直接入力された現実世界の映像を解釈し、状況を理解する機能 [OpenClaw, Google/Gemini]

  • マルチターン画像生成の文脈把握 (Multi-turn image context): 会話の途中で前回生成した画像(Previous response ID)の文脈を引き継いで解釈する機能 [OpenAI]

  • 顔写真からの年齢・生体情報の視覚的推論 (Age Assurance / Persona Verification): セルフィー画像から生体情報を分析・解釈し、ユーザーの年齢帯を推定する機能 [C.AI, OpenAI]

  • マルチモーダル混合エキスパート理解 (Mixture-of-Experts Vision-Language): 画像とテキストが混在する高度な入力を、最適なエキスパートモデルを割り当てて解釈する機能 [DeepSeek]

  • 空間的照明と3D構造の視覚的解釈 (ReLi3D / SViM3D): 単一の2D画像から、物体の3D形状や環境の照明(ライティング)条件を物理的に解釈する機能 [Stability AI]

  • 動画内の音声と映像の同期解釈 (Video audio analysis): 動画コンテンツにおける音声トラックと映像の動きを統合的に理解・抽出する機能 [Google/Gemini]

  • 地理空間データの解釈 (Geospatial Analytics / Earth Engine): 衛星画像や地図データから、地形の変化や空間的なインサイトを抽出・理解する機能 [Google/Gemini]

コード・システム・ログの理解

  • プロジェクト全体のコード構造と依存関係の理解 (Codebase understanding): 単一ファイルではなく、プロジェクト全体の複数ファイル間のロジックや依存関係を理解する機能 [Google/Gemini, Anthropic/Claude, OpenAI, Kimi]

  • エラーログとスタックトレースの解釈 (Error trace analysis): ターミナル出力やクラッシュログから、システムエラーの根本原因を抽出・理解する機能 [Anthropic/Claude, Google/Gemini, OpenAI]

  • GitコミットやPR差分の意図解釈 (Diff understanding): 変更されたコードの差分(Diff)を分析し、修正の意図やレビューのポイントを解釈する機能 [Anthropic/Claude, Google/Gemini, Microsoft Copilot]

  • データベーススキーマとSQLの意図解釈 (Database Assistance): 既存の複雑なSQLクエリのロジックやテーブルメタデータを理解し、言語化して解説する機能 [Google/Gemini, Microsoft Copilot]

  • スプレッドシートデータのインサイト抽出 (Code Interpreter data analysis): CSVやExcelデータを読み込み、その数値的な意味を解釈してチャートやトレンドを抽出する機能 [Mistral, OpenAI, Microsoft Copilot]

  • ターミナル環境とディレクトリ構造の自律的理解 (CLI Workspace understanding): CLIツールが現在のプロジェクト環境やディレクトリ構成を自律的に把握・解釈する機能 [Anthropic/Claude, Mistral, Google/Gemini]

  • API仕様やポリシーコードの解釈 (Apigee / API policy understanding): エンタープライズのAPI仕様書やセキュリティポリシーコードを読み解き、設定の意図を理解する機能 [Google/Gemini]

  • MLOpsにおけるデータ偏りとドリフトの解釈 (Model Monitoring): 機械学習モデルへの入力データの偏り(スキュー)や劣化傾向を分析して理解する機能 [Google/Gemini]

  • セキュリティログと脅威インテリジェンスの解釈 (Security Copilot / Threat Analysis): 膨大なシステムログや通信データからサイバー攻撃の兆候や脅威の文脈を抽出する機能 [Microsoft Copilot, Google/Gemini]

  • クラウドインフラ設定とリソースの解釈 (Cloud Assist / Infrastructure understanding): ソースコードやエディタの文脈から、最適なクラウドリソースやデプロイ構成を解釈する機能 [Google/Gemini]

  • セッション履歴やエージェント状態の文脈理解 (Session history retrieval): エージェントが過去のセッション情報を読み取り、タスクの進行状況や文脈を遡って理解する機能 [OpenClaw, OpenAI]

  • 外部データソース(Jira/Google Drive等)の構造理解 (MCP server resources): MCP経由で接続された外部SaaSのチケット情報やドキュメントの構造を理解・抽出する機能 [Anthropic/Claude, OpenAI, Microsoft Copilot]

  • FIM補完における前後文脈の解釈 (Fill-in-the-Middle Completion): コードの前後の記述から、中間に挟まるべき欠落したロジックを解釈して理解する機能 [DeepSeek, OpenAI]

  • コードモダナイゼーションの要件理解 (Code modernization analysis): レガシーコードを最新フレームワークに移行する際、元のビジネスロジックを解釈して理解する機能 [Google/Gemini, Anthropic/Claude]

  • トラブルシューティング手順の抽出 (Troubleshooting extraction): ユーザーのエラー状況の説明から、必要な解決ステップをマニュアル等から抽出して理解する機能 [Google/Gemini, Anthropic/Claude]

  • Webhookペイロードの構造解釈 (Webhook event parsing): 外部システムから送信されたWebhookのJSONデータを理解し、必要なイベント情報を抽出する機能 [OpenAI, OpenClaw]

  • モバイルデバイスの状態・センサー情報の解釈 (Mobile node context): モバイルノードから送られるバッテリー残量やシステム状態などをエージェントが文脈として理解する機能 [OpenClaw]

  • Gitワークツリーの独立した文脈理解 (Worktrees context): 複数の作業環境で別々のタスクが進行している際、現在のディレクトリ固有の文脈を理解する機能 [Anthropic/Claude]

  • 開発者向けトレースログの意味抽出 (Trace / Debug log understanding): モデルの内部処理やネットワークリクエストのログから、ボトルネックやエラー箇所を解釈する機能 [OpenAI, OpenClaw]

  • クラウドコスト・FinOpsデータの傾向解釈 (Cost Management / Billing analysis): APIの利用料金やインフラコストのデータを読み解き、異常な消費傾向や最適化ポイントを抽出する機能 [Google/Gemini, OpenAI]

  • プロジェクト指示ファイル(CLAUDE.md等)の自律解釈: ディレクトリに置かれた指示ファイルをエージェントが自ら読み込み、プロジェクトの要件を理解する機能 [Anthropic/Claude, OpenClaw]

  • サードパーティモデルのプロンプト互換性解釈 (OpenAI Compatibility): OpenAIのAPIフォーマットで送られたリクエストを、他モデルが理解できる形式に解釈・変換する機能 [Meta/Llama, Perplexity, DeepSeek]

音声・オーディオの理解

  • 音声認識と文字起こし (Speech-to-text / Whisper): 音声データを入力とし、発話内容を正確なテキストとして解釈・抽出する機能 [OpenAI, Google/Gemini, xAI]

  • リアルタイム音声の感情・トーン解釈 (Realtime API / Voice API): 極低遅延の音声入力から、言葉の意味だけでなく話し手の感情やトーンをリアルタイムに理解する機能 [OpenAI, xAI, Microsoft Copilot]

  • 話者分離と会話構造の理解 (Diarization): 音声データから「誰が、いつ話したか」を識別し、複数人の会話フローや構造を理解する機能 [OpenAI]

  • IVRにおけるユーザー意図の音声解釈 (Interactive voice response): カスタマーサポート等の音声対応において、顧客の要望を解釈してオペレーターへの引き継ぎを判断する機能 [Microsoft Copilot]

  • 音声同意記録の文脈理解 (Voice Consents interpretation): 音声合成API等の利用時に必要なユーザーの同意情報をテキストや音声から抽出・理解する機能 [OpenAI]

検索結果・外部知識・ツールの理解

  • Web検索結果の統合的要約 (Web-grounded summarization): 複数のWebページから得られた情報を統合し、関連性と矛盾を理解して要約する機能 [Perplexity, OpenAI, Google/Gemini, Anthropic/Claude, Mistral, Kimi]

  • 複雑なトピックの深層理解 (Deep research / Sonar): 複雑なテーマについて、Web上の情報を多段階で読み解きながら深く理解し要約する機能 [OpenAI, Google/Gemini, Perplexity]

  • 情報ソースの信頼性と関連性の解釈 (Search API filters): LLMによる生成を行わず、検索結果のタイトルやスニペットから情報の意味的関連性を抽出する機能 [Perplexity]

  • 検索結果のドメイン固有文脈の解釈 (Domain controls): 特定のドメイン(医療・金融など)に絞った検索結果から専門的なコンテキストを理解する機能 [Perplexity]

  • RAGにおける文脈を保持した情報抽出 (Contextual retrieval): 情報を分割(チャンク化)する際に、ドキュメント全体の文脈が失われないよう解釈して抽出する機能 [Anthropic/Claude, Perplexity]

  • テキストの意味的ベクトル化と解釈 (Embeddings): テキストの意味やニュアンスを多次元ベクトルとして数値的に解釈し、類似性を見出す機能 [OpenAI, Anthropic/Claude, Perplexity, Google/Gemini]

  • Xのリアルタイムトレンドとスレッドフローの理解 (Thread fetch & Trend analysis): SNSのスレッド全体の会話の流れや最新の話題をコンテキストとして解釈する機能 [xAI]

  • ファクトチェックにおける根拠の解釈 (Grounding verification): モデルの回答とWebの検索結果を照らし合わせ、事実関係が合致しているかを理解する機能 [Google/Gemini, Microsoft Copilot]

  • 引用元の正確なコンテキスト抽出 (Citation extraction): 検索結果から回答の根拠となる文章を正確に抽出し、引用として紐付ける機能 [Perplexity, OpenAI, Google/Gemini]

  • ユーザーの独自コレクションの意味的理解 (Collections / Knowledge base): ユーザーがアップロードした独自ドキュメント群のメタデータを抽出し、全体の文脈を理解する機能 [xAI, Mistral]

  • ツールの選択意図と引数の理解 (Tool choice / Function calling interpretation): ユーザーの要求から「どのツールをどのようなパラメータで使うべきか」を自律的に解釈する機能 [OpenAI, Anthropic/Claude, Google/Gemini, Meta/Llama, xAI, DeepSeek, Mistral]

  • eDiscoveryのための法的証拠抽出 (Legal hold retrieval): 組織データから訴訟や監査に関連する会話履歴やファイルを意味的に検索・抽出・理解する機能 [Microsoft Copilot]

  • ユーザーの過去のプロンプト傾向の学習と解釈 (Personalization / Memory): ユーザーの過去の指示や好みを記憶し、現在のプロンプトの意図をより正確に解釈する機能 [Google/Gemini, OpenAI, OpenClaw]

  • 通信ネットワークデータのトラフィック解釈 (Telecom Data Fabric / Subscriber Insights): 通信キャリアのトラフィックデータや加入者情報を分析し、行動パターンを理解・抽出する機能 [Google/Gemini]

  • 小売業向け商品検索の意図解釈 (Vertex AI Search for commerce): ECサイトにおいて、ユーザーの曖昧な検索クエリから求めている商品の特徴を理解する機能 [Google/Gemini]

  • ニュースや株価のリアルタイムデータ抽出 (Real-time data extraction): 検索結果から、最新のニュース見出しや金融市場の数値を構造化して抽出・理解する機能 [Perplexity]

  • 多様なドキュメントフォーマットの構造理解 (Markup interpretation): Markdown、HTML、DOCXなどの見出しや表などのマークアップ構造を保持したまま意味を解釈する機能 [OpenAI, Anthropic/Claude, Google/Gemini, Mistral, Kimi]

推論モデル・分析アプローチによる深い理解

  • 推論モデルによる複雑な課題の深層解釈 (Reasoning models): 直感的なパターンマッチングではなく、段階的な論理思考プロセスを用いて問題の真意を理解する機能 [OpenAI, DeepSeek, xAI, Google/Gemini, Kimi]

  • 拡張思考による多段階文脈の解釈 (Extended thinking): 時間をかけて問題の背景や制約を深く読み解き、論理的な文脈を解釈する機能 [Anthropic/Claude]

  • 適応型思考によるタスク難易度の解釈 (Adaptive thinking): 入力されたタスクの複雑さを自律的に理解し、割り当てるべき推論レベルを調整する機能 [Anthropic/Claude]

  • 推論エフォート(思考レベル)の要求解釈 (Reasoning effort): ユーザーが指定した思考の深さを理解し、それに応じた粒度で情報を抽出する機能 [OpenAI, OpenClaw]

  • 数学的・科学的難問の論理的解釈 (Deep thought / Math reasoning): 数式や物理法則を含むテキストから、厳密な論理展開や定理の文脈を解釈する機能 [DeepSeek, xAI, Google/Gemini]

  • データインサイトの自動抽出 (Data Insights): データベースのテーブルやログデータから、相関関係やビジネス上の意味を自律的に理解・抽出する機能 [Google/Gemini, Microsoft Copilot]

  • マーケティング成果の文脈抽出 (Campaign summarization): キャンペーンの配信結果データから、成功・失敗の要因を理解して要約する機能 [Google/Gemini]

  • エージェントの健全性とパフォーマンス指標の解釈 (Agent analytics): ボットの会話ログから、ユーザーのフラストレーションや解決率を理解して改善点を抽出する機能 [Microsoft Copilot]

  • プロンプトの自己評価と最適化意図の理解 (Prompt optimizer analysis): モデルが自らの応答結果を分析し、ユーザーの本来の意図を満たすようプロンプトを再解釈する機能 [OpenAI]

  • 自動テストセット(Evals)における正答の解釈 (Evaluations grading): LLM自身がテストの回答を読み解き、基準に沿って正解・不正解の文脈を解釈する機能 [OpenAI, Anthropic/Claude, Google/Gemini]

  • ライブストリーミングのリアルタイムチャット解釈 (Twitch chat analysis): 配信のチャットコメントから、視聴者の総意や質問をリアルタイムに抽出・理解する機能 [OpenClaw]

  • チャットアプリにおけるメンションと宛先の理解 (Mention / Routing interpretation): SlackやDiscord等で、誰に対するメッセージなのか、ボットが応答すべきかを解釈する機能 [OpenClaw, Anthropic/Claude, Microsoft Copilot]

  • 非対話型モードでの自動タスクのゴール解釈 (Non-interactive mode analysis): 人間のフィードバックなしで、初期プロンプトから最終目標を完全に理解してタスクを遂行する機能 [Anthropic/Claude]

  • APIリクエストのレート制限・メタデータの解釈 (Rate limit / Meta info extraction): APIのレスポンスヘッダから、残りのトークン枠やリクエストIDをシステム的に解釈する機能 [OpenAI, Perplexity]

  • エージェント間でのハンドオフ文脈の共有と理解 (Handoff context understanding): ボットからオペレーター、または別エージェントへタスクを引き継ぐ際、それまでの会話文脈を解釈する機能 [OpenAI, Microsoft Copilot]

  • 動画への広告挿入ポイントの文脈解釈 (Video Stitcher API): 動画コンテンツの文脈を理解し、サーバーサイドで広告を動的に挿入する適切なタイミングを抽出する機能 [Google/Gemini]

  • ユーザー活動シグナルからの年齢推論・理解 (Age assurance signals): ログイン情報やプラットフォーム上の活動履歴等のシグナルを総合的に分析・理解し、年齢層を判断する機能 [C.AI]


”検索”に関する機能

AIが学習していない最新情報や社内の機密データを、外部のデータベースやWebから取得する機能です。

Web検索・深層リサーチ

  • 自律的Web検索 (Web search tool): モデルが自律的にインターネット上の最新情報や事実関係を検索し、回答に組み込む [OpenAI, Anthropic/Claude, xAI/Grok, Kimi].

  • 深層リサーチ (Deep research): 複雑なトピックについて、Web上の複数の情報源を自律的に多段階でたどりながら深く調査する [OpenAI, Google/Gemini].

  • Webグラウンディング (Web Grounding): 検索エンジンのリアルタイムな結果を利用して、回答に根拠を持たせ最新情報を取得する [Google/Gemini, Microsoft Copilot, Perplexity].

  • 生のWeb検索結果取得 (Search API): LLMの推論を挟まず、生のWeb検索結果(タイトル、URL、スニペット)をランキング付きで取得する [Perplexity].

  • Webフェッチツール (Web fetch tool): 指定したURLのWebページに直接アクセスし、コンテンツを読み込んで情報を取得する [Anthropic/Claude].

  • Le Chat Web検索 (Le Chat Web search): チャット画面上でWeb検索を実行し、最新情報を取得してCanvasでのリサーチに活用する [Mistral].

  • M365 Webグラウンディング (Microsoft 365 Copilot Chat): Web上の検索結果を用いて、最新情報のリサーチや安全なファクトチェックを行う [Microsoft Copilot].

  • 引用付きAI回答 (Sonar API): Web上の知識をリアルタイムにリサーチし、「引用付きのAI回答」を生成・取得する [Perplexity].

  • ファクトチェック・ダブルチェック (Double-check): 生成された回答に対し、Web上の情報ソースを検索して内容の事実確認を行う [Google/Gemini].

  • 関連ソースの表示 (View related sources): 回答の元となったWebソースを検索・表示し、ユーザーが直接確認できるようにする [Google/Gemini].

  • ドメイン制御・フィルタリング検索 (Search Filters / Domain Controls): 特定のドメインやサイトに絞り込んでWeb検索結果を取得する [Perplexity].

  • マルチクエリ並行検索 (Multi-query support): 一度のリクエストで複数の検索クエリを並行実行し、複合的なWeb検索結果を取得する [Perplexity].

  • リアルタイムデータ抽出 (Real-time data extraction): 検索結果からリアルタイムなデータ(ニュースや株価など)を抽出して取得する [Perplexity].

  • エージェントAPI検索 (Agent API): 複数のサードパーティモデルを用いて、統合されたWeb検索ツールとプリセットでリサーチを行う [Perplexity].

  • 検索クローラーインデックス取得 (Perplexity Crawlers): 公式クローラーが収集したWebインデックスデータに基づいて情報を取得する [Perplexity].

RAG・ベクトル検索・エンベディング

  • ファイル検索 (File search): アップロードされたPDFなどのファイル群から、ユーザーの質問に関連する箇所を検索・抽出する [OpenAI, Anthropic/Claude].

  • 検索拡張生成 (Retrieval / RAG): 独自のドキュメント群から意味的に情報を探し出し、回答の根拠として利用する [OpenAI, Mistral, Meta/Llama, Anthropic/Claude].

  • ベクトルストア管理 (Vector Stores): 検索を高速かつ高精度に行うために、ドキュメントのベクトルデータを保存・管理・検索する [OpenAI].

  • テキストエンベディング (Embeddings API): テキストの意味を数値ベクトル化し、セマンティック検索や独自RAGの検索精度を向上させる [OpenAI, Perplexity, Anthropic/Claude].

  • 文脈を保持した検索 (Contextual retrieval): ドキュメントを分割する際に、全体の文脈を保持させることでRAGの検索精度を大幅に向上させる [Anthropic/Claude].

  • 文脈化エンベディング (Contextualized Embeddings): 文脈を考慮したベクトルデータを生成・取得し、RAGシステムの検索精度を上げる [Perplexity].

  • コレクション検索 (Collections Search): ユーザーが作成した独自のコレクション(ドキュメント群)内から、必要な情報をセマンティック検索する [xAI/Grok].

  • コレクションのメタデータ取得 (Collection Metadata): 作成したRAG用コレクションのメタデータやプロパティ情報を取得する [xAI/Grok].

  • ファイルAPI連携検索 (Files API Retrieval): API経由でアップロードされたテキストファイルやドキュメントを読み込み、情報を検索する [OpenAI, Anthropic/Claude, xAI/Grok].

  • PDFからの統合検索 (PDF support): PDF内のテキストだけでなく、チャートやグラフなどの視覚的な情報も統合的に検索・取得する [Anthropic/Claude].

  • 超長文コンテキスト直接検索 (Ultra-long Context Retrieval): 256Kなどの長大なコンテキストを利用し、RAGを使わずに全文書から情報を直接探し出す [Kimi].

  • カスタムエージェントナレッジ検索 (Custom agent knowledge base): カスタムエージェントに紐付けられた独自のナレッジベースから、業務に固有の情報を検索・取得する [Mistral].

  • エンタープライズ文書検索 (Vertex AI Search): 企業内の大規模な非構造化データから意味を理解して情報を瞬時に検索する [Google/Gemini].

  • ベクトル検索基盤 (Vector Search): データサイズや要件に応じてスケーラブルな意味的検索を提供するインフラ機能 [Google/Gemini].

  • Llama RAG統合 (Llama RAG Integration): Cookbookなどを通じ、モデルをベクトルDBと連携させて外部知識を検索する [Meta/Llama].

社内データ・SaaS連携検索

  • M365業務データグラウンディング (Microsoft 365 Data Grounding): 組織内のドキュメント、メール、Teamsチャットなどの業務データを横断的に検索し、回答の根拠とする [Microsoft Copilot].

  • Google Workspaceデータ検索 (Connected Apps): Gmail、Googleドライブ、ドキュメントなどから個人の業務データやファイルを検索・取得する [Google/Gemini].

  • MCPサーバーリソース検索 (MCP and Connectors): Model Context Protocolを利用して、リモートサーバーにある外部DBやSaaSから標準プロトコルでデータを取得する [OpenAI, Anthropic/Claude, Microsoft Copilot].

  • Jira/Slackデータ取得 (MCP SaaS Retrieval): MCPを介して、Jiraのチケット情報やSlackのメッセージ履歴を直接検索・抽出する [Anthropic/Claude, OpenClaw].

  • Google Driveドキュメント取得 (Google Drive Retrieval): MCPを通じて、Google Drive上に保存された仕様書や設計ドキュメントを検索して読み込む [Anthropic/Claude].

  • 外部APIデータ直接取得 (Data retrieval): ChatGPT Actions等と連携し、特定のエンドポイント(社内データベースなど)から必要なデータを直接検索・取得する [OpenAI].

  • コネクタ拡張検索 (Connectors): 外部のSaaSシステムや独自のデータベースを接続し、エージェントのリサーチ範囲やデータ取得能力を拡張する [Microsoft Copilot].

  • 公開サイトを知識ソース化 (Knowledge sources - Public website): エージェントに特定の公開Webサイトを指定し、そこから情報をリサーチさせる [Microsoft Copilot].

  • SharePointナレッジ検索 (Knowledge sources - SharePoint): 組織内のSharePointを知識ソースとして接続し、セキュアな環境で社内文書を検索する [Microsoft Copilot].

  • 非構造化データ抽出 (Document AI): 帳票などの非構造化ドキュメントを検索・処理し、必要なデータを自動で抽出・取得する [Google/Gemini].

  • 統合データカタログ検索 (Dataplex Universal Catalog): クラウド上の全データを横断的に検索・管理・取得する [Google/Gemini].

  • eDiscovery/法的保持検索 (eDiscovery / Legal hold): 訴訟や監査に備えて、保存されたCopilotの会話履歴やシステムログを検索・取得する [Microsoft Copilot].

  • Power Platformコネクタ取得 (Power Platform Connector Retrieval): Power Automate等のフローにおいて連携するコネクタからのデータを検索してCopilotに渡す [Microsoft Copilot].

コード・データベース・開発リサーチ

  • GitHubリポジトリ検索 (GitHub Repository Search): GitHubリポジトリをインポート・接続し、コードベースや履歴について直接検索する [Google/Gemini, Microsoft Copilot].

  • プライベートコードベース横断検索 (Custom Codebase Search): 自社のGitHub/GitLab等を接続し、プライベートな巨大コードベースからコードを検索する [Google/Gemini].

  • コードレビュー文脈取得 (Code Review Context Retrieval): GitHub等でのコードレビュー時に、関連するPRやコードの文脈を検索・取得する [Google/Gemini, Anthropic/Claude].

  • ローカルコードベース検索 (Claude Code File Search): CLI環境でローカルのコードベース全体を自律的に読み取り、必要なファイルや依存関係を検索する [Anthropic/Claude].

  • エラートレース検索 (Error Trace Retrieval): ターミナル上のエラーログや症状から、コードベース内のバグの根本原因を追跡・検索する [Anthropic/Claude].

  • BigQueryメタデータ取得 (BigQuery Data Insights): データベース内のテーブルメタデータを検索し、インサイトとなる有用なクエリや情報を取得する [Google/Gemini].

  • データベースクエリ検索 (Database Search): 自然言語を用いた指示で、SQLデータベース内を検索・情報取得する [Google/Gemini, Microsoft Copilot].

  • コードインタプリタデータ取得 (Code Interpreter Data Retrieval): スプレッドシート等のデータを読み込ませ、コードを実行してその中から必要な情報やインサイトを検索・抽出する [Mistral, OpenAI, Microsoft Copilot].

  • API仕様スマート検索 (Smart Search in API hub): 開発者が社内のAPI仕様などを効率的に検索・取得できるVertex AI搭載機能 [Google/Gemini].

  • クラウドレスポンスログ/トレース取得 (Cloud Logging / Trace Retrieval): システムのログやエラートレースを検索して取得し、パフォーマンスを可視化する [Google/Gemini].

  • ツールの自律検索 (Tool search): 利用可能な多数のツール群の中から、実行したいタスクに最適なツール自体を検索して探し出す [OpenAI].

  • サンドボックス内ファイル取得 (Docker Sandbox File Retrieval): 安全なコンテナ(サンドボックス)環境内に保存された実行結果やファイルを外部から安全に検索・取得する [OpenClaw].

  • Llama Stack検索 (Llama Stack Retrieval): Llama StackのAPI層を通じて、自社ホストモデルから独自データを検索・取得する [Meta/Llama].

プラットフォーム・SNS・特化型検索

  • Xポスト検索 (X Search): X(旧Twitter)のリアルタイムなポストをキーワードやユーザー指定で検索し、トレンドや事実を取得する [xAI/Grok].

  • X特定アカウント検索 (allowed_x_handles): 特定のXアカウント(最大10個)に絞ってポストを検索・取得する [xAI/Grok].

  • X除外アカウント検索 (excluded_x_handles): 特定のXアカウントを検索結果から除外して情報を取得する [xAI/Grok].

  • X特定期間検索 (Date Range): 日付範囲(ISO8601)を指定して、特定の期間のXのポストを検索する [xAI/Grok].

  • Xスレッド取得 (Thread fetch): X上の特定のスレッドやポストの会話の流れ全体を取得し、コンテキストとして利用する [xAI/Grok].

  • X画像/動画コンテンツ検索 (Media Understanding): X検索において、テキストだけでなく画像や動画の内容も検索・解釈して取得する [xAI/Grok].

  • セキュリティ脅威インテリジェンス検索 (Security Copilot Threat Retrieval): 膨大なセキュリティデータやログの中から、サイバー攻撃の兆候や脅威情報を検索・取得する [Microsoft Copilot, Google/Gemini].

  • 財務データ検索 (Copilot for Finance): ERPシステムや財務データから、ビジネスに必要な財務インサイトや関連データを検索・取得する [Microsoft Copilot].

  • CRM営業データ検索 (Copilot for Sales): Dynamics 365などのCRMシステムから、顧客情報や商談履歴を検索して取得する [Microsoft Copilot].

  • サポートナレッジ検索 (Copilot for Service): カスタマーサポートの際、関連するナレッジベースや過去のケース履歴を検索・取得する [Microsoft Copilot].

  • データ分析基盤の統合検索 (Copilot in Microsoft Fabric): 関連性のない複数のデータソースから必要なデータを検索・取得し、分析基盤に統合する [Microsoft Copilot].

  • Azureクラウドリソース検索 (Copilot in Azure): Azure上のクラウドリソースの状態や操作履歴、トラブルシューティングガイドを検索・取得する [Microsoft Copilot].

  • Eコマース向け商品検索 (Vertex AI Search for commerce): 小売業向けに、企業データから高度な商品検索とリコメンド情報を取得する [Google/Gemini].

  • 通信加入者データ取得 (Telecom Subscriber Insights): 通信業界向けに、加入者データを検索・インジェストして取得する [Google/Gemini].

  • 地理空間データ取得 (Geospatial Data Retrieval): Google Earth Engine等から、地球観測データや衛星画像を検索・取得する [Google/Gemini].

会話履歴・コンテキスト・メモリ検索

  • プロンプトキャッシュ検索 (Prompt caching): キャッシュされた長大なコンテキストの中から、再処理なしで素早く過去の入力ファイルや文脈を検索・引き出す [OpenAI, Anthropic/Claude, xAI/Grok].

  • チャットスレッド履歴取得 (Conversation History / Threads): 過去のチャットスレッド履歴から文脈や過去のメッセージ情報を検索して取得するAPI機能 [OpenAI].

  • ローカルセッション履歴検索 (sessions_history): エージェントが過去のやり取りや別のセッション履歴を遡って、必要なコンテキストを自律的に検索・取得する [OpenClaw].

  • ローカルセッション一覧取得 (sessions_list): エージェントが自身のワークスペース内に存在するすべてのアクティブなセッション一覧を検索・取得する [OpenClaw].

  • カスタム指示・メモリの検索 (Personalization retrieval): 過去のチャット履歴やカスタム指示から、ユーザーの好みや文脈を検索・抽出して応答に反映する [Google/Gemini].

  • デスクトップ画面情報の視覚的取得 (Computer Use Desktop Retrieval): デスクトップ環境を視覚的に見て、画面上のアプリやブラウザの情報を自律的に検索・取得する [Anthropic/Claude].

  • モデレーションデータ取得 (Moderation Retrieval): 安全性モデルを利用し、テキストがポリシーに違反していないかの判定結果やフラグデータを取得する [OpenAI, Meta/Llama].

ファイル・ローカルシステム検索

  • ローカルファイル直接読み取り (read tool): エージェントがローカルデバイスに保存されたファイルやドキュメントを直接読み取り、情報を取得する [OpenClaw, Anthropic/Claude].

  • プロセス・システム状態取得 (Process / Bash Retrieval): シェルコマンドを実行し、ローカルシステムの状態やプロセス情報を検索して取得する [OpenClaw, Anthropic/Claude].

  • モバイルノード状態取得 (Mobile Node Retrieval): ペアリングされたiOS/Androidノードから、デバイスのセンサー情報やシステム状態を検索・取得する [OpenClaw].

  • ファイル一覧取得 (List files): APIやワークスペースにアップロードされているすべてのファイルの一覧を検索して取得する [OpenAI, xAI/Grok, Anthropic/Claude].

  • ファイルコンテンツ取得 (Retrieve file content): 保存されている特定のファイルの内容そのものをダウンロード・取得する [OpenAI, xAI/Grok].

  • アップロード状態取得 (Files Upload Status): 容量の大きいアップロード処理中のファイルのステータス情報を検索して取得する [OpenAI, xAI/Grok].

  • ベクトルストアファイル取得 (Retrieve vector store file): ベクトルストア内に保存された特定のファイルやステータスを検索・取得する [OpenAI].

  • ファイルバッチ取得 (Retrieve a file batch): ベクトルストアに一括で追加されたファイル群のバッチ処理ステータスを検索・取得する [OpenAI].

メタデータ・管理ログ・評価データ取得

  • 実行ログ検索 (Retrieve runs): アシスタントAPIなどで実行されたスレッドの実行ログ(Runs)を検索して取得する [OpenAI].

  • バッチ処理結果取得 (Retrieve a batch): 非同期のバッチ処理の結果やステータス情報を検索して取得する [OpenAI, xAI/Grok].

  • メッセージバッチ処理結果取得 (Message Batches Retrieval): 一括処理されたメッセージのステータスや結果を検索して取得する [Anthropic/Claude].

  • ワークスペース監査ログ取得 (Audit Logs Retrieval): 管理者がAPIキーの利用履歴やユーザーアクションなどの監査ログを検索して取得する [OpenAI, xAI/Grok].

  • 管理者向けデータ取得 (Admin API Data Retrieval): 管理者がワークスペースの権限設定やAPIキーの利用データを検索・取得する [Anthropic/Claude, OpenAI].

  • エージェントパフォーマンス分析データ取得 (Agent Analytics Retrieval): エージェントの健全性や会話ログ、パフォーマンスデータを分析するために情報を検索・取得する [Microsoft Copilot].

  • 請求・利用状況取得 (Billing & Usage Retrieval): ワークスペースごとのAPI使用量、コスト、請求情報を検索して取得する [Mistral, xAI/Grok, OpenAI].

  • API利用枠・レート制限取得 (Rate Limits Retrieval): ユーザーの現在のAPI利用枠やレート制限のステータスを取得する [Perplexity, OpenAI].

  • システムステータス取得 (System Status Retrieval): APIのシステム全体的な稼働状況をAPI経由で取得する [Perplexity, Anthropic/Claude].

  • Webhookイベント情報取得 (Webhook event retrieval): 外部システムからWebhook経由で送信されたイベント情報やペイロードを取得・解析する [OpenAI, OpenClaw].

  • 生成画像の引用元メタデータ取得 (Citations Retrieval): Web検索の結果として、回答の根拠となった画像の引用元(Citations)のメタデータを取得する [Perplexity, xAI/Grok].

  • モデル評価レポート取得 (Vertex AI Model Evaluation Retrieval): 生成AIモデルの客観的な評価指標(BLEU, ROUGEなど)の分析結果を検索・取得する [Google/Gemini].

  • 評価データ検索 (Retrieve an eval): モデルの客観的評価を行った過去のテストセットや評価データ(Evals)を検索して取得する [OpenAI].

  • クラウドクォータ取得 (Cloud Quotas Retrieval): クラウド上の全サービスの割り当て(クォータ)情報を検索して取得する [Google/Gemini].

  • モデル一覧取得 (List models): 利用可能なAIモデルのリストや詳細情報をAPI経由で検索して取得する [OpenAI, xAI/Grok, DeepSeek].


”推論”に関する機能

複雑なタスクを小さなステップに分解し、AだからBになる、といった論理的な思考や計画を行う機能です。

推論モデル・思考プロセス

  • 推論特化モデル (Reasoning models): 直感的な応答ではなく、段階的な論理思考プロセス(Chain of Thought)を用いて複雑なタスクを解決 [OpenAI, DeepSeek, xAI/Grok, Kimi]

  • 推論エフォートの制御 (Reasoning effort): APIリクエスト時に思考の深さ("low", "medium", "high"など)を指定し、推論にかける計算リソースを制御 [OpenAI, OpenClaw]

  • 拡張思考・推論 (Extended thinking): 長時間をかけて段階的な思考プロセスを踏むことで、複雑な問題に対する深い論理的推論を実行 [Anthropic/Claude]

  • 適応型思考 (Adaptive thinking): タスクの複雑さや難易度をモデルが自律的に解釈し、推論(思考)のレベルを動的に調整 [Anthropic/Claude]

  • 推論労力とタスク予算の管理 (Task budgets / Effort): 推論にかける労力や計算予算を設定し、分析プロセスの深さとコストをコントロール [Anthropic/Claude]

  • 思考モード (Thinking Mode / deepseek-reasoner): 複雑なプロンプトに対して明示的な思考プロセスを展開し、より深い論理的分析を実行 [DeepSeek]

  • 高速推論モデル (Fast-reasoning models): ツール呼び出しの精度と推論スピードのバランスを最適化し、低遅延で分析や論理展開を実行 [xAI/Grok]

  • 思考プロセスの明示的生成 (Reasoning Trace generation): 最終的な回答を出す前に「頭の中でどのように論理展開したか」という思考の軌跡をテキストとして出力 [OpenAI, DeepSeek]

  • 多段階推論モデル (Thinking Models): 複雑なビジネス課題やデータ分析タスクに対する論理的な解決ステップを多段階で推論 [Kimi]

  • 思考レベルの動的コマンド制御 (/think command): チャットコマンド等を用いて、エージェントの推論の深さをローカル環境から動的に調整 [OpenClaw]

データ分析・計算推論

  • コードインタープリタ (Code interpreter): AIが自律的にPythonコード等を生成・実行し、数学的計算やデータセットの分析、グラフ作成を論理的に実施 [OpenAI, Microsoft Copilot, Mistral]

  • ローカルコード実行推論 (Code execution tool): AI自身がローカルまたはサンドボックス環境でコードを実行し、数値集計や統計分析を推論 [Anthropic/Claude, xAI/Grok]

  • データベースの自動インサイト推論 (BigQuery Data Insights): データベースのメタデータを解釈し、データ分析に有用なインサイトやSQLクエリを自動推論・生成 [Google/Gemini]

  • SQLクエリの意図・パフォーマンス分析 (Database Development Assistance): 複雑なSQLのロジックを推論して言語化し、パフォーマンス向上のための最適化案を分析 [Google/Gemini]

  • スプレッドシートデータの分析と推論 (Le Chat Code Interpreter): 表計算データを読み込み、コードを実行してデータの傾向分析、チャート生成、インサイトの推論を実施 [Mistral]

  • 複数データソースの統合インサイト推論 (Copilot in Microsoft Fabric): 関連性のない複数のデータソース間のつながりを見出し、有益なビジネスインサイトを自動推論・生成 [Microsoft Copilot]

  • 最適なデータ視覚化の推論 (Power BI Copilot): 分析したデータ結果に基づき、ユーザーが理解しやすい最適なダッシュボード構成やグラフ表現を推論 [Microsoft Copilot]

  • 顧客データからのインサイト推論 (Dynamics 365 Copilot): CRM上の顧客データや商談履歴を分析し、最適なセールスアクションや顧客の潜在的ニーズを推論 [Microsoft Copilot]

  • データサイエンス向けノートブックでの推論 (Colab Enterprise): データ分析やMLモデル学習のワークロードにおいて、Pythonコードの推論と実行をシームレスに支援 [Google/Gemini]

  • 大規模データセットの一括推論 (Batch processing reasoning): 大量のデータ分析や推論タスクを非同期で一括処理し、コストを抑えてインサイトを抽出 [OpenAI, Anthropic/Claude, xAI/Grok]

コーディング・開発・デバッグにおける推論

  • コードベース全体の潜在的バグ推論 (Codebase understanding): 単一のファイルだけでなく、プロジェクト全体のコンテキストから潜在的なバグや脆弱性を推論 [Google/Gemini, Anthropic/Claude]

  • 欠落ロジックの推論 (FIM Completion): 前後のコードの文脈(Fill-in-the-Middle)を理解し、中間に欠落している論理的なコードブロックを推論して生成 [DeepSeek, OpenAI]

  • プレフィックスからの後続ロジック推論 (Chat Prefix Completion): 提供されたコードの接頭辞(プレフィックス)を基に、これまでの文脈を解釈して後続の論理展開を推論 [DeepSeek]

  • プロジェクト横断的な依存関係の推論 (Cross-file reasoning): CLI環境等でコードベースを読み取り、複数ファイル間の論理的な依存関係やシステム構造を推論 [Anthropic/Claude, Kimi]

  • アーキテクチャの推論・設計 (Architecture reasoning): ユーザーの要件定義から最適なシステムアーキテクチャを推論し、複雑なプログラムコードの基盤を設計 [OpenAI, Google/Gemini]

  • エラートレースからの根本原因推論 (Error trace reasoning): ターミナルのエラーログやスタックトレースから、コード内のバグの根本原因を論理的に追跡・推論 [Anthropic/Claude, Google/Gemini, OpenAI]

  • コミット・PR差分の意図推論 (PR diff reasoning): 変更されたコードの差分を分析し、なぜその修正が行われたのかという論理的意図を推論してメッセージ化 [Anthropic/Claude, Google/Gemini]

  • アプリクラッシュの要因分析 (App crash analysis): Firebase等のクラッシュログを要約・分析し、バグの根本原因とトラブルシューティング手順を論理的に推論 [Google/Gemini]

  • プロジェクト概要からの構造推論 (Scaffolding reasoning): ターミナルから自然言語で概要を伝えるだけで、プロジェクトに必要なディレクトリ構造や初期ファイルを論理的に推論 [Mistral]

  • プログラミング中の次の一手推論 (Code completion reasoning): 開発者がコードを書く過程で、プロジェクト内の文脈を読み取って次に必要なコードロジックを自動推論 [Microsoft Copilot, Google/Gemini]

リサーチと複雑な問題解決の推論

  • 深層リサーチの情報統合推論 (Deep research reasoning): Web検索を多段階で繰り返し、複数の情報を論理的に統合して深い洞察や結論を推論・分析 [OpenAI, Google/Gemini]

  • 検索結果の統合に基づく事実推論 (Web-grounded reasoning): Web上の最新知識を収集し、複数の情報源の関連性や矛盾を推論して正確な回答を導出 [Perplexity, OpenAI]

  • 情報ソースの信頼性と関連性の分析推論 (Search API filtering): LLMによるテキスト生成を行わず、生の検索結果の意味的関連性や信頼性の高さをスコアリング・推論 [Perplexity]

  • 科学的・数学的難問の深い論理推論 (Scientific/Math reasoning): 高度な数学的計算(DeepSeek-Math等)や物理法則を含むテキストから、厳密な論理展開や定理の証明プロセスを推論 [DeepSeek, xAI/Grok, Google/Gemini]

  • 研究論文・学術データの深い分析推論 (Analyze research papers): 複雑なフォーマットの研究論文や学術データを読み解き、科学的なインサイトを論理的に抽出・分析 [Meta/Llama, Anthropic/Claude]

  • 超長大コンテキストの俯瞰的分析推論 (Long-context analysis): 数百万トークンのコンテキスト全体を分析し、マクロな視点での推論や総合的な要約を実施 [Meta/Llama, Google/Gemini, Kimi]

  • エージェントワークフローの計画推論 (Agent API workflow planning): 外部モデルやWeb検索ツールを組み合わせた複雑なリサーチワークフローの最適な実行ステップを推論・計画 [Perplexity, OpenAI, Anthropic/Claude]

  • 複数ドキュメントの統合分析とレポート構築推論 (Canvas analysis): 検索結果やアップロードされた複数のドキュメントを横断的に分析し、レポートや企画書の論理的構成を推論 [Mistral, OpenAI]

  • 登場人物の心理推論と関係性分析 (Character mind map reasoning): 小説や長文のコンテキストから、登場人物の思考プロセスや人間関係を推論しマインドマップとして整理 [Meta/Llama]

  • 予測分析と生成AIの融合推論 (Predictive AI integration): 従来の機械学習による数値的な予測結果と、生成AIの論理的推論能力を組み合わせて高度なビジネス推論を実行 [Google/Gemini]

視覚・マルチモーダル推論

  • 画像内のオブジェクト関係性の論理的推論 (Visual reasoning): 画像に写っている物体同士の関係性や状況の背景を視覚的に推論・解釈 [OpenAI, Anthropic/Claude, Google/Gemini, xAI/Grok, Kimi]

  • チャートやグラフからのインサイト推論 (Chart/Graph analysis): 画像化されたグラフデータから、数値的なインサイトや論理的なトレンド、相関関係を視覚的に推論 [Anthropic/Claude, Meta/Llama, OpenAI]

  • マルチモーダル混合エキスパート推論 (Mixture-of-Experts Vision-Language): 画像とテキストが混在する入力に対して、モデル内部の最適なエキスパートを推論・選択して高度な理解を実行 [DeepSeek]

  • 視覚的因果関係と論理構造の推論 (Visual Causal Flow): 複雑な図解やフローチャート、光学文字認識(OCR)結果から、情報の流れや論理的な因果関係を推論 [DeepSeek]

  • 3D空間構造と照明の物理的推論 (ReLi3D / 3D reasoning): 単一の2D画像から、対象物の3D形状、環境の照明条件、素材の反射特性を物理的に推論・再構築 [Stability AI]

  • 画像からの動きと空間の視覚的推論 (SViM3D / Video generation reasoning): 単一の静止画を入力とし、そこに存在するはずの自然な動きや3Dマテリアル構造を視覚的に推論して動画化 [Stability AI]

  • ソーシャル投稿内のマルチモーダル推論 (Social media multimodal reasoning): Xの検索において、投稿テキストだけでなく含まれる画像や動画の視覚的コンテキストも統合して論理的に推論 [xAI/Grok]

  • デスクトップ画面のUI構造の視覚的推論 (Computer use vision): PCの画面を視覚的に理解し、目的を達成するためにどのUI要素を操作すべきかの手順を推論 [Anthropic/Claude, OpenAI]

  • UIモックアップからのコード構造推論 (UI to HTML reasoning): 手書きやUIのモックアップ画像を視覚的に解釈し、対応するフロントエンドの論理的なコード構造を推論 [Google/Gemini, OpenAI]

  • 動画の文脈と時間的因果関係の推論 (Video analysis reasoning): アップロードされた動画のフレーム遷移や音声を解析し、時間的な因果関係やアクションの意図を推論 [Google/Gemini, xAI/Grok]

  • 画像編集用マスク領域の論理的推論 (Masking understanding): 画像編集において、指定されたマスク画像の領域とユーザーのプロンプト意図を照らし合わせ、最適な編集内容を推論 [OpenAI]

  • セルフィー画像からの生体・年齢の推論 (Age assurance vision): セルフィー画像から顔の生体情報を分析し、ユーザーの年齢(18歳以上か等)を視覚的に推論・判定 [C.AI, OpenAI]

  • マルチモーダル情報の統合推論 (Integrated multimodal reasoning): テキスト、画像、動画、音声などの異なるモダリティの入力をシームレスに組み合わせて統合的な論理推論を実施 [Google/Gemini, Kimi, OpenAI]

システム・セキュリティ・運用推論

  • 機械速度でのセキュリティ脅威推論 (Security threat reasoning): 膨大なセキュリティログを高速で分析し、サイバー攻撃などの脅威の兆候や攻撃パターンを論理的に推論 [Microsoft Copilot]

  • クラウド運用状態の診断推論 (Cloud infrastructure diagnostics): クラウドインフラのログやメトリクスを分析し、システムの運用状態の診断やボトルネック解消の手順を推論 [Microsoft Copilot, Google/Gemini]

  • コンテンツモデレーションの有害性推論 (Content moderation reasoning): テキストや画像の内容を分析し、ポリシー違反や潜在的な有害性の有無を論理的に推論・スコアリング [OpenAI, Meta/Llama]

  • データ偏りとモデル劣化の監視推論 (MLOps monitoring): 機械学習モデルへの入力データのスキュー(偏り)やドリフトを分析し、モデルの劣化状況を客観的に評価・推論 [Google/Gemini]

  • 組織データ横断の業務文脈推論 (Enterprise context reasoning): 社内のSharePoint、メール、チャットなどを横断的に読み解き、情報を論理的に整理して現在の業務状況や回答を推論 [Microsoft Copilot]

  • APIポリシーのコード解釈推論 (API policy reasoning): エンタープライズ環境のAPI仕様書やセキュリティポリシーコードを解釈し、その設定の意図を推論 [Google/Gemini]

  • ソースエディタコンテキストに基づくアーキテクチャ推論 (Editor context reasoning): クラウドインフラのソースエディタ上のコード記述から、最適なデプロイ構成やリソースを推論 [Google/Gemini]

  • ユーザー活動シグナルからの総合的年齢推論 (Age assurance signals): ログイン情報やプラットフォーム上の活動履歴などのシグナルを総合的に分析し、ユーザーの年齢層を推論 [C.AI]

  • ガードレールに準拠した安全行動推論 (Guardrails reasoning): エージェントがツール呼び出しを行う際、事前に定義された安全性や倫理ポリシーを自律的に照らし合わせて安全な行動を推論 [OpenAI, Microsoft Copilot, Anthropic/Claude]

  • デバッグ推論の可視化 (Developer mode trace / Trace logs): エージェントの内部的なネットワークリクエストや思考ログを出力し、開発者がシステムのボトルネックを推論・解析 [OpenAI, OpenClaw]

ツール選択・エージェント行動推論

  • ツール選択とパラメータの自律推論 (Tool choice reasoning): ユーザーの指示を分析し、提供された複数の外部ツールのうち「どれを、どのような引数(JSON)で呼び出すべきか」を自律的に推論 [OpenAI, Anthropic/Claude, Google/Gemini, xAI/Grok, Meta/Llama, Mistral, DeepSeek]

  • エージェントフローの論理設計推論 (Agent flow reasoning): 自然言語の指示から、エージェントが実行すべき複雑な処理手順や条件分岐のワークフローを論理的に設計・推論 [Microsoft Copilot]

  • サブエージェントへのタスク委譲推論 (Orchestration reasoning): メインエージェントが複雑なタスクを細かいステップに分割し、どの専門サブエージェントに委譲すべきかを計画・推論 [OpenAI, Anthropic/Claude]

  • エージェントの動的ルーティング推論 (Multi-agent routing): 受信するチャンネルやユーザーごとに、どのワークスペースやエージェントの文脈を適用すべきかを推論してトラフィックを振り分け [OpenClaw]

  • ペルソナと行動計画の自律的推論 (Persona/Workspace reasoning): ワークスペース内の設定ファイル(AGENTS.md等)を読み込み、プロジェクト要件やユーザーの好みを分析して行動計画を推論 [OpenClaw, Anthropic/Claude]

  • 構造化データ出力のスキーマ推論 (Structured output reasoning): 非構造化データから推論した結果を、厳密なJSONスキーマの構造にマッピングして確実に出力し、データ分析基盤へ渡す [OpenAI, Anthropic/Claude, Google/Gemini, Meta/Llama, DeepSeek]

  • 会話コンテキストと履歴からの意図推論 (Context management reasoning): 過去のやり取りや、以前生成した出力内容の文脈を論理的に考慮して、後続の回答やアクションを推論 [OpenAI, Anthropic/Claude, Google/Gemini]

  • データ取得結果の解釈と最終回答推論 (Action retrieval reasoning): 外部APIから取得した生のデータベース情報を解釈し、ユーザーの質問に対する最終的な回答を推論 [OpenAI, Microsoft Copilot]

  • ユーザー発話からのトピックトリガー推論 (Topic trigger reasoning): ユーザーの曖昧な発話から真の意図(トピック)を推論し、適切なエージェントのワークフローを起動 [Microsoft Copilot, Google/Gemini]

  • セッション履歴の遡及的推論 (Session history reasoning): エージェントが自律的に過去のやり取りや別のセッション履歴を遡って読み取り、現在のタスクに必要な情報を推論・抽出 [OpenClaw]

  • ユーザー固有の指示・好みの学習推論 (Personalization reasoning): 過去のチャット履歴やカスタム指示から、ユーザーの好みや業務の文脈を推論してパーソナライズされた応答を生成 [Google/Gemini, OpenClaw]

  • リアルタイム音声からの感情・文脈推論 (Voice/Emotion reasoning): 極低遅延の音声入力から、言葉の意味だけでなくユーザーの感情やトーン、会話の文脈をリアルタイムに推論して応答 [OpenAI, xAI/Grok, Microsoft Copilot]

推論の最適化・評価・自己改善

  • オープンモデルのファインチューニング (Fine-tuning recipes): Llamaモデルなどを特定ユースケース向けに微調整 [Meta/Llama]

  • プロンプトキャッシング (Prompt caching): 長大なプロンプトをキャッシュし、APIのレイテンシとコストを削減 [OpenAI, Anthropic, grok]

  • プロンプトの自己推論・自動最適化 (Prompt optimizer reasoning): モデルが自身の推論プロセスを客観的に分析し、タスク解決に最もパフォーマンスを発揮するプロンプト構造を自律的に推論・再構築 [OpenAI, Anthropic/Claude]

  • プロンプト変数の自動推論 (Prompt templating): ユーザーの入力テキストから変数を自動で特定・抽出し、システムに組み込みやすいプロンプトテンプレートの構造へと推論・変換 [Anthropic/Claude]

  • モデル推論の客観的評価 (Model evaluation / Evals): 定義されたテストセットを用いて、AIモデル自身の推論の正確さや論理性をデータ駆動で分析・スコアリング [OpenAI, Google/Gemini, Anthropic/Claude]

  • エージェントパフォーマンスの分析推論 (Agent analytics reasoning): 自律型エージェントの会話ログや健全性を分析し、エラー率の低下やユーザー満足度向上のための改善ヒントを推論 [Microsoft Copilot]

  • パラメータ調整による推論変化の比較分析 (Playground analysis): プレイグラウンド上でプロンプトや推論パラメータを調整し、モデル出力の論理的な変化を比較・分析 [Mistral, OpenAI]

  • 推論パターンの学習と適応 (Reasoning fine-tuning / SFT): 教師あり学習(ファインチューニング)を通じて、特定の業務データに特化した固有の推論パターンをモデルに学習させる [OpenAI, Google/Gemini]

  • テキストの意味的距離推論 (Embeddings reasoning): テキストの意味を多次元ベクトル化し、情報間の意味的な類似性や距離を数学的に推論・分析してRAGに活用 [OpenAI, Anthropic/Claude, Perplexity, Google/Gemini]

  • 長文脈検索における意味的つながりの推論 (Contextual retrieval reasoning): ドキュメントをチャンクに分割して検索する際に、文書全体の文脈や情報のつながりを保持して推論・抽出 [Anthropic/Claude, Perplexity]

  • コンテキストキャッシングによる再推論の省略 (Context Caching): 大規模な入力コンテキストをシステム側でキャッシュし、不要な論理計算を避けて効率的に後続の推論を展開 [DeepSeek]

  • 予測出力による高速推論 (Predicted Outputs reasoning): キャッシュや既知の出力内容を活用し、モデルに予測させることで推論レイテンシを最適化して結果を導出 [OpenAI]

  • テスト結果の正答基準推論 (Evaluations grading): LLM自身が自動テストの回答を読み解き、人間が設定した基準に沿って正解・不正解の文脈を論理的に解釈・推論 [OpenAI, Anthropic/Claude]

インフラ・ハードウェア推論最適化

  • 推論の量子化とメモリ最適化推論 (Quantization reasoning): メモリ制約のあるデバイスでも、量子化によって最適化されたモデルを用いて高度な推論を実行・オフロード [Stability AI/Diffusers]

  • PyTorchコンパイルによる推論速度ブースト (torch.compile reasoning): モデルの推論グラフをコンパイル最適化し、実行速度をソフトウェアレベルで劇的に向上 [Stability AI/Diffusers]

  • NVIDIA TensorRT最適化推論 (TensorRT optimized reasoning): NVIDIA GPUアーキテクチャ向けに、画像生成や言語モデルの推論速度を極限まで最適化して計算を実行 [Stability AI/Diffusers]

  • AMD GPU最適化推論 (AMD Optimized reasoning): AMD環境での推論処理に特化したモデルチューニングを適用し、ハードウェアのパフォーマンスを最大化 [Stability AI/Diffusers]

  • エージェント推論のストレージ帯域ボトルネック解消 (DualPath inference): Agentic LLMにおける推論時のストレージ帯域幅のボトルネックを解消する高度な推論計算手法 [DeepSeek]

  • FP8および潜在アテンションのカーネル最適化推論 (DeepGEMM / FlashMLA): FP8精度のGEMMカーネルや効率的なマルチヘッド潜在アテンションを用いてモデルの推論処理を高速化 [DeepSeek]

ドメイン特化・検索・情報の推論

  • リアルタイムなソーシャルデータのトレンド推論 (Social trend reasoning): X(Twitter)等のソーシャルメディア上の最新ポストから、話題のトレンドや社会的なインサイトをリアルタイムに推論・抽出 [xAI/Grok]

  • マーケティング成果の要因推論 (Campaign summarization reasoning): メッセージングキャンペーンなどの成果データを分析し、成功・失敗の要因と改善のための具体的なアクションを推論 [Google/Gemini]

  • 独自のコレクションからの意味的推論 (RAG data reasoning): ユーザーがアップロードした独自のドキュメント群(コレクション)からメタデータを抽出し、意味的なインサイトを推論 [xAI/Grok, Mistral]

  • ドメイン固有データの専門的推論 (Domain controls reasoning): 医療や金融など特定のドメインに絞った検索結果から、高い専門性が要求されるコンテキストを推論して情報を抽出 [Perplexity]

  • 引用元の信頼性推論 (Citation reliability reasoning): 検索結果を用いて回答を生成する際、どの情報源が最も信頼性が高く適切かを推論して引用として紐付け [Perplexity, xAI/Grok, OpenAI]

  • スレッド全体の会話フロー推論 (Thread fetch reasoning): SNS上の特定のスレッドやポストを遡り、会話の流れ全体のコンテキストを総合的に推論 [xAI/Grok]

  • エンタープライズ文書の意味的推論 (Enterprise Search reasoning): 社内の膨大な非構造化データから、文脈や意味的な関連性を推論して瞬時に検索・要約 [Google/Gemini, Microsoft Copilot]

  • 通信ネットワークのトラフィック推論 (Telecom Data Fabric reasoning): 通信キャリアのトラフィックデータや加入者情報を分析し、行動パターンやネットワークの最適化ポイントを推論 [Google/Gemini]

  • 地理空間データの空間的推論 (Geospatial Analytics reasoning): Google Earth Engine等の衛星画像や地図データから、地形の変化や空間的なインサイトを推論・抽出 [Google/Gemini]


”生成”に関する機能

検索・推論した結果を踏まえ、最終的に人間にとって価値のあるテキスト、画像、コードなどを出力する機能です。

テキスト・ドキュメント・コンテンツ生成

  • 自然言語テキストの生成 (Text Generation): プロンプトに基づき、エッセイ、記事、報告書などのテキストを生成 [OpenAI, Google/Gemini, Anthropic/Claude, Meta/Llama, xAI/Grok, Mistral, DeepSeek, Kimi, Perplexity]

  • 引用付きリサーチレポートの生成 (Citation-backed Generation): 最新のWeb検索結果を根拠とし、事実に基づく正確な引用(Citations)を含んだレポートを生成 [Perplexity, OpenAI, Google/Gemini]

  • 複数ファイルからの要約生成 (Summary Generation): 大量のドキュメントやアップロードされたファイルを横断的に読み込み、要点を抽出した要約テキストを生成 [OpenAI, Anthropic/Claude, Google/Gemini, Mistral, Kimi]

  • 複数ターン対話の生成 (Multi-round Conversation): 過去の履歴を記憶し、文脈を維持した一貫性のある自然な対話を生成 [OpenAI, Anthropic/Claude, Google/Gemini, xAI/Grok, DeepSeek, Kimi]

  • クイズ・学習教材の生成 (Quiz/Flashcards Generation): ドキュメントやノートブックの内容から、学習用クイズや暗記用フラッシュカードを自動生成 [Google/Gemini]

  • 挿絵付き絵本の生成 (Illustrated Storybook): 物語のテキストと共に、内容に合ったイラスト(画像)を組み合わせて絵本コンテンツを生成 [Google/Gemini]

  • マーケティングコピーの生成 (Campaign generation): キャンペーンデータや商品情報を元に、魅力的で効果的な広告文やコピーを生成 [Google/Gemini, Microsoft Copilot]

  • インサイトと推奨事項の生成 (Actionable Recommendations): クラッシュログやキャンペーン成果を分析し、具体的な改善策やトラブルシューティングの手順を生成 [Google/Gemini]

  • コードの解説文生成 (Code Explanation): 複雑で難解なプログラムコードのロジックや意図を読み解き、自然言語によるわかりやすい解説文を生成 [Google/Gemini, Anthropic/Claude, OpenAI, Microsoft Copilot]

  • 多言語翻訳テキストの生成 (Translation Generation): 入力されたテキストを理解し、指定された多様な言語へ正確に翻訳して生成 [OpenAI, Google/Gemini, Anthropic/Claude, Meta/Llama, DeepSeek]

  • ペルソナ・トーンに合わせたテキスト生成 (Persona generation): 指定された特定のトーンや人格(海賊、専門家など)を模倣して文章を生成 [OpenAI, Anthropic/Claude, OpenClaw]

  • 会議の議事録とアクションアイテム生成 (Meeting summaries): 音声やトランスクリプトから、決定事項やTodoリストを整理して生成 [Microsoft Copilot, OpenAI, Anthropic/Claude]

  • カスタマーサポートの返信文生成 (Customer support reply): 問い合わせ内容とナレッジベースを元に、最適なサポート対応の返信メールを生成 [Microsoft Copilot, Anthropic/Claude]

  • 思考プロセス(推論トレース)の明示的生成 (Reasoning Trace generation): 最終的な回答を出す前に「頭の中でどのように論理展開したか」という思考プロセス自体をテキストとして生成 [OpenAI, DeepSeek]

  • 履歴書とカバーレターの生成 (Resume/Cover letter generation): ユーザーの職歴データや応募先企業の情報に基づき、カスタマイズされた履歴書やカバーレターを生成 [OpenAI, Anthropic/Claude]

  • アイデアとブレインストーミングの生成 (Ideation): ユーザーの抽象的な要望から、プロジェクト企画や問題解決のための多様なアイデアのリストを生成 [OpenAI, Google/Gemini, Anthropic/Claude, Meta/Llama]

  • ドメイン固有の専門的回答生成 (Domain-controlled Generation): 医療や金融など、特定のドメインに絞った検索結果のみを元に、専門性の高い回答を生成 [Perplexity]

画像生成・デザイン・編集

  • テキストからの新規画像生成 (Text-to-Image): 自然言語のプロンプトから高品質な画像をゼロから生成 [OpenAI, Google/Gemini, xAI/Grok, Stability AI, Midjourney]

  • 画像から画像の生成 (Image-to-Image): 元画像とテキスト指示を組み合わせ、画風を変換したり内容を改変した新しい画像を生成 [Stability AI/Diffusers, OpenAI]

  • 画像の部分編集・インペインティング (Inpainting / Masking): マスク画像を指定し、画像の特定部分だけを新しいプロンプトに従って再生成・編集 [OpenAI, Stability AI/Diffusers]

  • 画像のバリエーション生成 (Create Variation): 元の画像の構図やスタイルを維持したまま、異なるパターンの画像を複数生成 [OpenAI, Stability AI]

  • 画像のアウトペインティング (Outpainting / Extend): 既存の画像の枠外の背景や風景を推測し、自然に拡張して生成 [OpenAI, Stability AI]

  • 超解像・アップスケーリング (Super Resolution): 粗い画像や生成された画像のディテールを推測し、高解像度に拡大生成 [Stability AI/Diffusers]

  • 潜在空間アップスケーリング (Latent Upscale): 潜在空間上で画像の解像度を向上させる生成処理 [Stability AI/Diffusers]

  • 照明の再計算と生成 (ReLi3D): 3Dモデルや画像の照明(ライティング)を再計算し、異なる光の当たり方で画像を再生成 [Stability AI]

  • 色彩補正とカラーガイダンス生成 (ReSWD): 画像のカラー補正や色調を、分布マッチング技術を用いて再生成 [Stability AI]

  • 輪郭・骨格制御による画像生成 (ControlNet): 輪郭線や人物のポーズなどの制御画像を用いて、構図を固定した画像を生成 [Stability AI/Diffusers]

  • 無条件の画像生成 (Unconditional Image Generation): テキストプロンプトなどの条件なしで、ランダムな画像を生成 [Stability AI/Diffusers]

  • キャラクターの一貫性保持生成 (Character Reference): 特定のキャラクターの参照画像を用い、同じ特徴を維持したまま異なるシーンの画像を生成 [Midjourney, OpenAI]

  • スタイル参照生成 (Style Reference): 参照となる画像のビジュアルスタイルを模倣して、新しい画像を生成 [Midjourney]

  • オムニリファレンス生成 (Omni Reference): 同じキャラクターやオブジェクトを複数画像間で一貫して生成 [Midjourney]

  • 画像のマルチターン対話生成 (Multi-turn image generation): 過去の画像生成履歴(Previous response ID)の文脈を引き継いで、対話的に画像を修正・生成 [OpenAI]

  • 画像フォーマットと圧縮率を適用した生成 (Image formatting): PNG, JPEG, WebPなどのフォーマット指定や、圧縮率を適用した画像ファイルを生成 [OpenAI]

動画・3D・マルチモーダル生成

  • テキストからの動画生成 (Text-to-Video): テキストプロンプトから、高品質で動きのある映像を生成 [OpenAI, Google/Gemini, xAI/Grok]

  • 画像からの動画生成 (Image-to-Video): 1枚の静止画を入力し、そこに自然な動きを与えた動画を生成 [Stability AI, OpenAI]

  • 音声同期付き動画生成 (Video with Synced Audio): テキストから、動きだけでなく映像に同期したオーディオ付きの動画を生成 [OpenAI]

  • 動画のリミックスと編集 (Remix / Edit Video): 既存の動画コンテンツのスタイルや要素を変更し、新しい動画としてリミックス生成 [OpenAI]

  • 3D映像の生成 (Stable Virtual Camera): 単一の入力画像から、カメラワークの動きを持たせた3Dの映像表現を生成 [Stability AI]

  • 3Dマテリアル生成 (SViM3D): 単一の画像から、3Dオブジェクト用のマテリアルや自然な動きを拡散モデルで生成 [Stability AI]

  • 動画へのキャラクター挿入生成 (Create Character / Video): 指定されたキャラクター情報を元に動画内にキャラクターを生成 [OpenAI]

  • マルチモーダル混合出力の生成 (Mixture of Modalities / Janus): 単一のモデル内で画像とテキストがシームレスに混在する出力を生成 [DeepSeek]

音声・オーディオ生成

  • テキスト読み上げ・音声合成 (Text-to-Speech / TTS): テキストを自然で表現力豊かな人間の音声に変換して生成 [OpenAI, Google/Gemini, xAI/Grok]

  • リアルタイム音声会話生成 (Realtime Audio Generation): 極低遅延でテキストと音声の入力を受け取り、自然な音声応答をリアルタイムに生成 [OpenAI, xAI/Grok, Microsoft Copilot]

  • ポッドキャスト風音声の生成 (Audio Overviews): ドキュメント等の資料から、複数のホストが会話するポッドキャスト形式の音声を生成 [Google/Gemini]

  • 動画に合わせた効果音の生成 (Foley Control): 動画内の動きやシーンを解析し、それにぴったり合った自然な効果音を同期生成 [Stability AI]

  • 音声翻訳の出力生成 (Speech Translation): 入力された音声を別の言語に翻訳し、その結果を音声として合成・生成 [OpenAI]

  • 音楽・オーディオの生成 (Audio generation): テキストから音楽やメロディ、環境音などを生成 [Google/Gemini, Stability AI/Diffusers]

  • 話者分離タイムスタンプの生成 (Diarize Output): 会話の音声データから「誰が、いつ話したか」というタイムスタンプ記録を生成 [OpenAI]

  • 対話型音声エージェントの応答生成 (IVR Generation): 電話などの音声チャネルにおいて、エージェントが顧客と対話するための発話を生成 [Microsoft Copilot]

  • 音声同意記録の生成 (Voice Consents): 特定の音声合成APIを利用する際に必要な、ユーザーの同意記録データを作成・生成 [OpenAI]

プログラミング・コード生成

  • 自然言語からのコード生成 (Code Generation): 開発者のプロンプトに基づき、関数やクラスなどのプログラムコードを生成 [OpenAI, Google/Gemini, Anthropic/Claude, Mistral, Microsoft Copilot]

  • プロジェクト横断的なファイル編集・生成 (Multi-file Code Generation): コードベース全体を読み取り、複数のファイルにまたがる新機能実装コードを生成 [Anthropic/Claude, Google/Gemini]

  • リアルタイム・コード補完 (Code Completion): エディタ上で開発者がコードを書く過程で、コンテキストを読み取って次の一手を自動補完・生成 [Microsoft Copilot, Google/Gemini]

  • FIM補完 (Fill-in-the-Middle Completion): 前後のコードの文脈を理解し、欠落している中間のロジックを推論して生成 [DeepSeek, OpenAI]

  • チャットプレフィックス補完 (Chat Prefix Completion): ユーザーが途中まで書いたコードやテキストのプレフィックスを引き継ぎ、後続のコードを生成 [DeepSeek, OpenAI]

  • プロジェクトのスキャフォールド生成 (Project Scaffolding): 自然言語で概要を伝えるだけで、ディレクトリ構造や初期のファイル群を一括生成 [Mistral]

  • SQLクエリの生成 (SQL Generation): 自然言語の指示から、データベースのスキーマを理解した複雑なSQLクエリを生成 [Google/Gemini, Microsoft Copilot]

  • GraphQLスキーマとミューテーションの生成 (Firebase Data Connect): アプリケーション用のデータスキーマやGraphQLクエリを生成 [Google/Gemini]

  • コミットメッセージの自動生成 (Commit message generation): 変更されたコードの差分を理解し、適切なGitコミットメッセージを生成 [Anthropic/Claude, Google/Gemini]

  • プルリクエスト(PR)の説明文生成 (PR description generation): 実装された機能や修正内容を要約し、PRのタイトルや説明文を自律的に生成 [Anthropic/Claude, Google/Gemini]

  • コード分析用Pythonスクリプトの生成 (Code Interpreter generation): AI自身がPythonコードを生成して実行し、データ分析や計算処理を行う [OpenAI, Microsoft Copilot, Mistral]

  • パッチ(差分)の生成 (Apply Patch): エージェントがコードベースの特定箇所に対する修正パッチを生成し、自律的に適用 [OpenAI, Google/Gemini]

  • シェルコマンドの生成 (Shell Command Generation): ユーザーの目的に合わせて、ターミナルで実行すべき適切なbashやシェルコマンドを生成 [Anthropic/Claude, OpenClaw, OpenAI]

  • ユニットテストの生成 (Unit Test Generation): 未テストのソースコードに対して、モックやアサーションを含む適切なテストコードを生成 [Anthropic/Claude, Google/Gemini]

  • API仕様書(OpenAPI/Swagger)の生成 (API specification generation): 既存のバックエンドコードからAPIの仕様書を生成 [Google/Gemini]

  • ローカルファイルの直接生成 (File Write / Create): エージェントが自律的にwriteやeditツールを使用し、ユーザーのデバイス上に直接スクリプトやドキュメントを生成 [OpenClaw, Anthropic/Claude]

構造化データ・ベクトル・メタデータ生成

  • JSON構造化出力の生成 (Structured Output): 定義された厳密なJSONスキーマに従い、非構造化テキストから正確なデータフォーマットを生成 [OpenAI, Anthropic/Claude, Google/Gemini, Meta/Llama, DeepSeek, xAI/Grok]

  • テキストエンベディングの生成 (Embeddings Generation): テキストの意味を多次元の数値ベクトルとして生成し、RAGや意味的検索の基盤とする [OpenAI, Anthropic/Claude, Perplexity, Google/Gemini]

  • 文脈を考慮したエンベディングの生成 (Contextualized Embeddings): ドキュメント全体の文脈を保持したままチャンクをベクトル化し、精度の高いエンベディングを生成 [Perplexity, Anthropic/Claude]

  • バッチ処理による大量データ生成 (Batch Generation): 非同期のバッチAPIを利用し、大規模なテキスト生成や構造化データの抽出を一括で生成 [OpenAI, Anthropic/Claude, xAI/Grok]

  • ツール呼び出し引数の生成 (Tool / Function Calling Generation): ユーザーの指示を論理的に解釈し、外部APIやツールを実行するために必要な引数(JSONデータなど)を生成 [OpenAI, Anthropic/Claude, Google/Gemini, Meta/Llama, xAI/Grok, DeepSeek, Mistral]

  • ベクトルストア・インデックスの生成 (Vector Store Indexing): アップロードされたファイル群から自動的にチャンクとベクトルを生成し、検索用のインデックスを構築 [OpenAI]

  • 予測出力による高速生成 (Predicted Outputs): 既知の出力内容(ソースコードの大部分など)をモデルに予測させ、レイテンシを大幅に下げて高速に応答を生成 [OpenAI]

  • 安全性フラグとモデレーション結果の生成 (Moderation Output): 入力やモデル出力の内容を評価し、ポリシー違反や有害性の有無を示すスコアやフラグデータを生成 [OpenAI, Meta/Llama, Google/Gemini]

  • トークン消費とコスト集計データの生成 (Usage/Tokens Output): APIリクエストにおいて、プロンプトや生成にかかった入出力トークン数、キャッシュヒット率などの使用量データを生成 [OpenAI, Anthropic/Claude, DeepSeek, xAI/Grok]

  • バウンディングボックス座標の生成 (Bounding box generation): 画像内の特定のオブジェクトや人物の位置を検出し、その座標データをテキストやJSONとして生成 [OpenAI, Google/Gemini]

UI・デザイン・ワークスペース生成

  • モックアップ画像からのHTML生成 (Image Mock up to HTML): 手書きのスケッチやUIデザインの画像から、対応するHTML/CSS等のコードを生成 [Google/Gemini, OpenAI, Anthropic/Claude]

  • チャット内UIコンポーネント生成 (Artifacts / Claude Cowork): チャット画面内でReactコンポーネントやSVG、HTMLなどを生成し、動的なプレビューとして描画 [Anthropic/Claude, OpenAI]

  • 動的UIのリアルタイムレンダリング (Live Canvas / A2UI): エージェントがユーザーの指示に基づき、画面上に操作可能なUIを自律的に生成・配置 [OpenClaw]

  • ドキュメント・プロトタイプの生成 (Canvas): 企画書やアプリのひな形を、専用の共同作業スペース(Canvas)上に生成 [Mistral, OpenAI]

  • インタラクティブなデータ視覚化・グラフ生成 (Visualizations): 分析したデータから、ユーザーが理解しやすいグラフやチャートを自動生成 [Microsoft Copilot, Mistral]

  • ビジネスダッシュボードの生成 (Power BI dashboards): 企業データウェアハウスの情報を統合し、ダッシュボードのデザイン・構成を生成 [Microsoft Copilot]

  • キャラクターマインドマップの生成 (Character Mind Map): 長大な物語から登場人物の思考や関係性を解釈し、視覚的なマインドマップ構造を生成 [Meta/Llama]

エージェント・自動化・プロンプト生成

  • オープンモデルのファインチューニング (Fine-tuning recipes): Llamaモデルなどを特定ユースケース向けに微調整 [Meta/Llama]

  • プロンプトキャッシング (Prompt caching): 長大なプロンプトをキャッシュし、APIのレイテンシとコストを削減 [OpenAI, Anthropic, grok]

  • 最適なプロンプトの自己生成 (Prompt Generator): ユーザーの短い要件から、AIモデルが最も良いパフォーマンスを発揮する「構造的なプロンプト」自体を生成 [OpenAI, Anthropic/Claude]

  • プロンプトテンプレートの生成 (Templatize a Prompt): テキストから変数を自動で特定・抽出し、システムに組み込みやすいプロンプトテンプレートとして生成 [Anthropic/Claude]

  • 自律型エージェントの生成 (Create / Build an Agent): 自然言語の指示から、ボットの振る舞いやナレッジ設定をゼロから生成・構築 [Microsoft Copilot, OpenAI, Google/Gemini, Mistral]

  • エージェントフローの生成 (Build an Agent Flow): 複雑な業務手順や条件分岐を伴うエージェントのアクションフローを、自然言語の指示から自動生成 [Microsoft Copilot]

  • 自動化ワークフローの生成 (Automation Flow Generation): 複数システム間のAPI連携や自動化処理のフローを、AIが視覚的エディタ上で生成・ドキュメント化 [Google/Gemini]

  • サブエージェントの動的生成 (Subagent Spawning): メインエージェントが複雑なタスクを分割し、特定の作業を処理するための子エージェントを動的に呼び出し・生成 [OpenAI, Anthropic/Claude, OpenClaw]

  • カスタムエージェントナレッジの生成 (Custom agent knowledge base): 特定のドキュメント群から、エージェントが利用するための専用の知識ベースやインデックスを生成 [Mistral]

インフラ・システム設定・テスト生成

  • 評価用テストセットの生成 (Evaluation Test Sets): モデルのパフォーマンスを客観的に評価するための、多様なテストケースやグラウンドトゥルースを自動生成 [Microsoft Copilot, OpenAI]

  • CI/CDパイプライン自動化設定の生成 (CI/CD integration generation): コードレビューや自動テストを行うための、GitHub Actions等のCI/CD設定ファイルを生成 [Anthropic/Claude, GitHub]

  • ワークスペース定義ファイルの生成 (Workspace config generation): エージェントの性格やツール権限を定義するAGENTS.mdやSOUL.mdなどの設定ファイルを生成 [OpenClaw]

  • シェル実行ログの生成 (Shell execution logs): サンドボックス環境内でコードやシェルスクリプトを実行し、その標準出力やエラーログのテキスト結果を生成 [OpenAI, OpenClaw]

  • Webhookペイロードの動的生成 (Webhook payload generation): 外部システムやサーバー側のコントロールに対して、イベント通知を行うためのJSONペイロードを動的に生成 [OpenAI, OpenClaw]

  • スケジュール・Cronジョブの生成 (Cron Configuration): エージェントに定期実行させるためのCronスケジュール設定を生成 [Google/Gemini, Anthropic/Claude, OpenClaw]

ストリーミング・その他生成

  • ストリーミングイベントの生成 (Streaming Events): 生成中のテキストトークンや画像の部分データをリアルタイムにSSEでストリーミング生成 [OpenAI, Anthropic/Claude, Perplexity]

  • フォールバック応答の自動生成 (Fallback response generation): メインのAPIがエラーになった際に、代替モデルやローカル機能を呼び出して安全にフォールバック応答を生成 [OpenClaw]


”行動”に関する機能

外部のツール(API、ブラウザ、計算機、社内システムなど)を呼び出し、実際に現実世界やシステムに介入する機能です。

エージェント構築・オーケストレーション基盤

  • 自律型エージェントの構築 (Create / Build agents): 自然言語の指示からエージェントの振る舞いや構造を自律的に構築する機能 [OpenAI, Google/Gemini, Microsoft Copilot, Mistral]

  • エージェントSDKによるコードベース構築 (Agents SDK / Agent API): コードレベルでエージェントのオーケストレーションやハンドオフ、ツール実行を構築する機能 [OpenAI, Anthropic/Claude, Perplexity]

  • フルマネージドのエージェント環境 (Managed Agents): 状態を保持するセッションや永続的なイベント履歴を備えたエージェントをインフラ上で管理・展開する機能 [Anthropic/Claude, Google/Gemini]

  • サブエージェント・マルチエージェント連携 (Subagents / Child agents): メインエージェントがタスクを分割し、特定の作業を処理する子エージェントを呼び出して並行作業を行う機能 [OpenAI, Anthropic/Claude, Microsoft Copilot, OpenClaw]

  • カスタムワークフローの自律実行 (Custom workflows / Gems): 特定のタスクを自動化するために独自のミニアプリやフローをエージェント化して実行する機能 [Google/Gemini, Mistral]

  • エージェントのバックグラウンド実行 (Background mode / Routines): ユーザーが離れていても、エージェントのタスクをクラウドやバックグラウンドで自律的に継続実行させる機能 [OpenAI, Anthropic/Claude]

  • スケジュール・Cronジョブの自動実行 (Schedule actions / Cron): 指定した時間や定期的なスケジュール(朝のPRレビューなど)でエージェントにアクションを自動実行させる機能 [Google/Gemini, Anthropic/Claude, OpenClaw]

ツール呼び出し・API連携 

  • 関数・ツール呼び出し基盤 (Function / Tool calling): ユーザーの指示に基づき、AIが自律的に外部ツールの実行コマンド(JSON等)を生成・実行要求する共通基盤機能 [OpenAI, Google/Gemini, Anthropic/Claude, xAI, Meta/Llama, Mistral, DeepSeek] 

  • Model Context Protocol連携 (MCP and Connectors): 標準化されたプロトコル(MCP)を利用し、ローカルやリモートの外部データソース・ツールと連携・操作を行う機能 [OpenAI, Anthropic/Claude, Microsoft Copilot, GitHub] 

  • カスタムアクションの実行 (Custom Actions): AIチャットから外部API(データベースやSaaS)を直接呼び出し、システムへのデータ送信や更新を自律的に実行する機能 [OpenAI, Microsoft Copilot, Google/Gemini] 

  • フックによるコマンド自動トリガー (Hooks): ファイル編集後やコミット前などに、フォーマッターやLintなどの任意のシェルコマンドを自動的にトリガーして実行する機能 [Anthropic/Claude] 

  • プラットフォーム拡張機能 (Extensions / Plugins): 既存のプラットフォーム環境に外部ツールへのアクション実行能力を付与する機能 [Google/Gemini, Microsoft Copilot]

デスクトップ・ローカルシステム操作 

  • コンピュータ画面の視覚的自律操作 (Computer use tool): AIがデスクトップ画面を視覚的に理解し、マウス移動やクリック、キーボード入力を自律的に実行する実践的アクション機能 [Anthropic/Claude, OpenAI] 

  • ローカルシェル環境でのコマンド実行 (Local shell / Bash tool): エージェントがシステム上のターミナル・シェル環境で自律的にコマンドを実行する機能 [OpenAI, Anthropic/Claude, OpenClaw] 

  • テキストファイルの直接編集ツール (Text editor / Edit tools): エージェントがローカルのテキストファイルを直接開いて内容を編集・上書きする機能 [Anthropic/Claude, OpenClaw] 

  • ファイルシステムの自律的な読み書き (read / write tools): エージェントがユーザーのデバイス上にあるファイルを探索し、直接読み書きを行う機能 [OpenClaw, Anthropic/Claude] 

  • プロセス管理の自律実行 (Process tool): エージェントがローカルシステムで稼働しているプロセスを管理(起動、停止など)する機能 [OpenClaw] 

  • ローカルワークツリーの自律管理 (Worktrees): 独立したローカル環境を作成し、メインの作業環境を汚さずにエージェントに別タスクを実行させる機能 [Anthropic/Claude] 

  • ターミナルでの自律的トラブルシューティング (CLI Agents): CLI環境でエラーやシステム状態を読み取り、解決策を自律的に推論して実行・修復する機能 [Google/Gemini, Anthropic/Claude, OpenClaw]

コーディング・開発自動化

  • コードインタプリタによる実行 (Code interpreter): 安全なサンドボックス環境内で、エージェント自身がPythonなどのコードを記述・実行しデータ処理などのタスクを完遂する機能 [OpenAI, Microsoft Copilot, Mistral] 

  • 複数ファイル横断のコード自律編集 (Agent Mode): IDEやCLIにおいて、複数ファイルにまたがる新機能実装やバグ修正を自律的に行う機能 [Google/Gemini, Anthropic/Claude] 

  • パッチ(差分)の自動生成と適用 (Apply Patch): エージェントがコードベースの特定箇所に対する修正パッチを生成し、自律的に適用するツール機能 [OpenAI] 

  • プロジェクトのスキャフォールド自動生成 (Scaffolding): 自然言語の概要から、プロジェクトに必要なディレクトリ構造や初期ファイル群を一括で自律生成する機能 [Mistral] 

  • Gitリポジトリ操作の自動化 (Git automation): gitと直接連携し、変更のステージング、コミットメッセージの作成、ブランチ作成からPRのオープンまでを自律的に実行する機能 [Anthropic/Claude] 

  • Pull Requestの自律的コードレビュー (PR Review): GitHub等で提出されたPRをAIが自動レビューし、コードの修正アクションを提案・実行する機能 [Google/Gemini, Anthropic/Claude, Microsoft Copilot] 

  • CI/CDパイプラインでのAI自動実行 (CI/CD integration): GitHub ActionsやGitLab等のパイプライン内でAIをトリガーし、イシューのトリアージやレビューを自動化する機能 [Anthropic/Claude, GitHub] 

  • GitHub Issue管理ワークフロー自動化 (GitHub Actions): リポジトリのIssueの分類や対応のワークフローをAIが自律的に実行する機能 [Microsoft Copilot, GitHub] 

  • データベーススキーマとクエリの自動生成・更新 (Firebase Data Connect): 自然言語の指示からGraphQL等のスキーマやミューテーションを生成し、DB操作を自動化する機能 [Google/Gemini] 

  • API仕様作成の自律支援 (Apigee / API Management): エンタープライズコンテキストを用いて、APIの仕様作成やポリシー設定のアクションを支援・生成する機能 [Google/Gemini]

外部アプリ・サービス連携

  • Google Workspaceアプリの操作 (Connected Apps): AIがユーザーのGmailやGoogleドライブにアクセスし、メールの下書きやファイル作成を代行する機能 [Google/Gemini] 

  • Googleカレンダーイベントの自律作成 (Calendar control): ユーザーの指示からスケジュールを解釈し、カレンダーのイベントを直接作成・調整する機能 [Google/Gemini] 

  • スマートホームデバイスの音声制御 (Smart home control): AIアプリを通じて、連携するスマートホームデバイスの電源や設定を直接制御する機能 [Google/Gemini] 

  • CRMシステムの自律的レコード更新 (Dynamics 365 actions): 営業やサポートの会話内容から、AIが自律的にCRMシステム(Salesforce等)のデータを更新する機能 [Microsoft Copilot] 

  • Power Platform連携による自動化 (Power Platform AI actions): 自動化ワークフロー(Power Automate等)にAIを組み込み、システム間のアクションをAI駆動にする機能 [Microsoft Copilot] 

  • SaaS間連携ワークフローの視覚的生成 (Application Integration): 複数のサードパーティアプリやAPIを繋ぐ自動化フローを、AIの支援で視覚的に構築・生成する機能 [Google/Gemini] 

  • Jira / Slackなどのタスク連携・更新 (MCP SaaS tools): MCP等を通じて、Jiraのチケット更新やSlackへの通知を自律的に実行する機能 [Anthropic/Claude, OpenClaw] 

  • WhatsAppからの通話・メッセージ自動送信 (WhatsApp actions): モバイルのAIアプリから、WhatsApp等を通じて通話の発信やメッセージ送信を代行するアクション機能 [Google/Gemini, OpenClaw]

セキュリティ・サンドボックス・ガバナンス

  • ガードレールによる行動制限 (Guardrails): エージェントの行動範囲や権限を安全に制限し、ポリシー違反のアクションを防ぐ機能 [OpenAI, Microsoft Copilot] 

  • サンドボックス内での安全なツール実行 (Sandbox execution): エージェントのアクションによるシステム破壊を防ぐため、Docker等の隔離環境内でツールを実行させる機能 [OpenAI, OpenClaw] 

  • SSH/OpenShell経由のリモートアクション (Remote Sandbox): リモートや別環境のシステムにSSH等で安全にアクセスし、エージェントにアクションを実行させる機能 [OpenClaw] 

  • アクションのアクセス権限制御 (Data policies / Allowlist): エージェントが実行できるアクションやアクセス可能なデータを管理者が制御・制限する機能 [Microsoft Copilot, OpenClaw] 

  • セキュリティインシデントへの自動防御アクション (Security Copilot Plugins): サイバー脅威の検知時に、AIが防御アクションや封じ込めを自動実行する機能 [Microsoft Copilot] 

  • クラウドインフラの自律診断と最適化 (Cloud Assist): クラウド環境の運用状態を分析し、インフラの最適化アクションやコスト削減を自律的に提案・実行する機能 [Google/Gemini] 

  • MLOpsパイプラインの自動オーケストレーション (MLOps automation): AIモデルの監視、評価、再学習などのパイプライン処理を自動的に実行・管理する機能 [Google/Gemini] 

  • 未知のDMからのアクセス承認制御 (DM pairing): セキュリティ保護のため、未知のユーザーからのメッセージに対してペアリングコードを要求しアクションを制限する機能 [OpenClaw]

メッセージング・チャットプラットフォーム連携

  • マルチチャンネルインボックスの自律応答 (Multi-channel gateway): WhatsApp, Slack, Discord, Telegram等、多数のプラットフォームに同時接続しエージェントが自律応答する機能 [OpenClaw] 

  • メッセージごとのエージェント動的ルーティング (Multi-agent routing): 受信するチャンネルやユーザーごとに、自動で異なるエージェント(ワークスペース)に振り分けて対応させるルーティング機能 [OpenClaw] 

  • Discord / Slack固有アクションの実行 (Platform native actions): DiscordやSlackのAPIに特化した、チャンネルの作成や権限管理などのシステムアクションを実行する機能 [OpenClaw] 

  • Slackからのタスク直接トリガー (AI for Slack): Slack上でのメンションから、エージェントが直接タスク(例:バグ修正のPR作成)を実行し結果を返す連携機能 [Anthropic/Claude, OpenClaw] 

  • Webhookイベントからの自律アクション起動 (Webhooks): 外部システムからのWebhookを受信し、それをトリガーとしてエージェントの自律的アクションを開始する機能 [OpenAI, OpenClaw] 

  • メール受信をトリガーとしたアクション (Gmail Pub/Sub): Gmailでの特定メール受信をフックにし、エージェントに自律的なアクションを実行させる機能 [OpenClaw] 

  • カスタムチャットウィジェットのアクション連携 (ChatKit / UI Actions): チャットのUI内にカスタムウィジェットを組み込み、ボタン操作等でシステムアクションを実行する機能 [OpenAI] 

  • 新規セッションの自律的な立ち上げ (sessions_spawn): エージェント自身が必要に応じて新しいセッションを立ち上げ、サブタスクを並行処理する機能 [OpenClaw] 

  • 別セッションへのメッセージ送信 (sessions_send): エージェントが他の実行中セッションに対して自律的にメッセージを送信し連携する機能 [OpenClaw] 

  • オペレーターコマンドによる状態の動的制御 (Operator commands): チャット上からコマンド(/reset, /think等)を入力し、エージェントの思考レベルや行動モードを即座に変更する機能 [OpenClaw]

音声・リアルタイム・UI・デバイス操作

  • リアルタイム音声エージェントの自律応答 (Voice agents / Realtime API): 音声入力をリアルタイムで処理し、自然な音声で対話しながら同時にシステムアクションを実行する機能 [OpenAI, xAI, Microsoft Copilot] 

  • IVR(自動音声応答)のハンドオフ制御 (Interactive voice response): 電話などの音声チャネルで自律的に応答し、必要に応じて人間のオペレーターへコンテキストを保ったまま引き継ぐ(ハンドオフ)機能 [Microsoft Copilot] 

  • ウェイクワードによるエージェント起動 (Voice Wake): デバイス上でウェイクワードを待機し、音声による指示から即座にエージェントのアクションをトリガーする機能 [OpenClaw] 

  • 動的UIのリアルタイムレンダリングと操作 (Live Canvas / A2UI): エージェントがユーザーの指示に基づき、モバイルアプリ等の画面上に操作可能なUIコンポーネントを自律的に生成・配置する機能 [OpenClaw] 

  • モバイルデバイスの自律遠隔操作 (Mobile nodes): モバイルアプリとペアリングし、エージェントがスマートフォンのカメラや画面キャプチャ、デバイスコマンドを遠隔から実行する機能 [OpenClaw]

検索・情報収集の自律アクション

  • X (Twitter) のリアルタイムデータ自律検索 (X Search tool): 指定したキーワードに基づいて、エージェントが自律的にXのポストを検索しデータ収集を行う機能 [xAI] 

  • アカウント指定の検索アクション (X Search - handles): 特定のXハンドル(最大10個)を許可または除外して、ノイズのない検索アクションを実行する機能 [xAI] 

  • マルチプロバイダ検索ワークフローの自動化 (Agent API): 複数のサードパーティモデルとWeb検索ツールを組み合わせ、自律的なリサーチワークフローを実行する機能 [Perplexity] 

  • 公式Webブラウザツールの自律操作 (Web Search / Browser tool): エージェントが自律的にWebブラウザを操作し、必要なページへアクセスして情報を取得する機能 [OpenAI, Anthropic/Claude, DeepSeek, Kimi, OpenClaw]

ネットワーク・デプロイ・その他運用系アクション 

  • エージェントのワンクリック統合デプロイ (Teams / M365 deployment): 構築したエージェントをTeamsやMicrosoft 365の業務環境に直接デプロイし、組織全体で利用可能にするアクション [Microsoft Copilot] 

  • Tailscale統合によるセキュアなリモートアクション制御 (Tailnet integration): VPN(Tailnet)を利用し、安全なリモート環境下でエージェントのアクションやゲートウェイを制御する機能 [OpenClaw] 67. CLIオンボーディングによる自律的セットアップ (CLI Onboarding): ターミナル上でエージェントの初期設定、チャンネル連携、デーモンインストールまでを自動で実行・案内する機能 [OpenClaw] 

  • エージェント用クラウドインフラの自動オーケストレーション (Enterprise Agent Platform): エンタープライズ向けに、AIエージェントのデプロイ、スケーリング、管理を一元的に自動実行する機能 [Google/Gemini, Microsoft Copilot] 

  • アプリ内ブラウザの自律レンダリング (In-app browser): エージェントがCLIやIDE内で直接Webページをレンダリングし、調査結果を表示させる機能 [Anthropic/Claude] 

  • AIモデルの自社インフラ向けセルフホストAPI構築 (Llama Stack): Llamaモデルを利用して、自社インフラ上にAPIやエージェント連携システムをエンドツーエンドで自動構築する機能 [Meta/Llama]

タスク最適化とエラーハンドリング

  • リアルタイムストリーミングによるイベント配信 (Streaming events): エージェントがツールを呼び出したり行動するプロセスを、リアルタイムのイベントとして外部に配信する機能 [OpenAI] 

  • 会話と実行状態の永続化管理 (Conversation state): エージェントの会話履歴や実行中の状態を保存し、長期間にわたる複雑なアクションを継続する機能 [OpenAI] 

  • エージェントワークフローの自動テスト・評価 (Evaluate workflows): 構築したエージェントのアクションフローが正しく機能するかを自動テスト・評価する機能 [OpenAI] 

  • スキルレジストリからの能力拡張 (Skills / ClawHub): 独自の行動手順や能力をまとめた「スキル」をワークスペースに動的に追加し、エージェントのアクション範囲を拡張する機能 [Anthropic/Claude, OpenClaw] 

  • エンドポイント状態の自己診断と修復 (Self-diagnostics / Doctor): 設定ミスや環境の不具合を自動的に検出してトラブルシューティングアクションを実行する機能 [OpenClaw] 

  • サーバーサイドからの通話制御 (Server-side controls): Realtime API等の実行中、サーバー側から割り込んでエージェントの音声発話やアクションを制御する機能 [OpenAI] 

  • アプリクラッシュの自律的トラブルシューティング (Firebase error analysis): アプリのクラッシュログから根本原因を特定し、自律的にコードの修正アクション(パッチ等)を提案する機能 [Google/Gemini] 

  • アプリケーションコードの自律的モダナイゼーション (Code modernization): 古い言語やフレームワークのコードベースを読み込み、最新のアーキテクチャへと自律的に書き換えるアクション [Anthropic/Claude] 

  • CI/CD環境での自動コード整形 (Auto-formatting in CI): フックを利用し、エージェントがコードを編集した直後にフォーマッター(Prettier等)を自律的に実行する機能 [Anthropic/Claude] 

  • 自動Lintチェックの実行 (Auto-linting): コミット前やPR作成前に、エージェントが自律的にLintツールを実行しエラーを修正する機能 [Anthropic/Claude]

システムインテグレーションと自動化

  • パッケージ管理ツールを用いた依存関係の自動更新 (Dependency update): エージェントがnpmやpip等のパッケージマネージャを自律的に操作し、ライブラリをアップデートする機能 [Anthropic/Claude] 

  • コンパイル・ビルドプロセスの自動実行 (Build automation): エージェントがシステムのビルドコマンド(make, buildなど)を自律的に実行し、エラーを解決する機能 [Anthropic/Claude] 

  • 実行中コンテナへの自律アタッチ (Container manipulation): エージェントが稼働中のDockerコンテナにアタッチし、内部でコマンドを実行するアクション [OpenClaw] 

  • カスタムプロンプトからの自動ツール生成 (Prompt as a tool): ユーザーが記述したカスタムプロンプト自体をツールとしてラップし、他のエージェントから呼び出し可能にする機能 [Microsoft Copilot] 

  • 音声エージェントの対話シミュレーションテスト (Test voice-enabled agents): 構築した音声通話エージェントのアクションや応答を、シミュレータ上で自動テストする機能 [Microsoft Copilot] 

  • シングルサインオン(SSO)連携のアクション自動化 (SSO Integration): Teams等でのエージェント利用時に、Entra ID等を用いた認証アクションを自律的に処理する機能 [Microsoft Copilot] 

  • ファイルアップロードを用いた自律データ処理 (File inputs processing): エージェントがユーザーからアップロードされたファイルを受け取り、自律的に解析・変換処理を実行する機能 [OpenAI] 

  • テキストからの音声合成アクション (TTS execution): エージェントが生成したテキストを、APIに送信して音声データを出力・再生する機能 [OpenAI, xAI, OpenClaw] 

  • 音声からの文字起こしアクション (STT execution): エージェントが音声データを受け取り、外部の文字起こしツールを呼び出してテキスト化する機能 [OpenAI, xAI] 

  • RAGパイプラインの自律オーケストレーション (RAG integrations): エージェントがユーザーの質問を受け、自律的にベクトルDBを検索し、情報を統合して回答を生成する一連のアクション [Anthropic/Claude, Mistral] 

  • ライブ配信プラットフォームとのチャット連携 (Twitch integration): Twitchなどのライブ配信プラットフォームのチャットにエージェントが接続し、視聴者と自律的に対話する機能 [OpenClaw] 

  • 非対話型モードでの自動タスク実行 (Non-interactive Mode): CI/CDパイプライン等で、人間が介入せずにCLIエージェントを完全自動で実行しタスクを完了させるモード [Anthropic/Claude] 

  • クラウドインフラのコード化自動適用 (Terraform/IaC execution): エージェントがインフラ管理ツール(Terraformなど)のコードを生成し、自律的に適用(apply)して環境を構築するアクション [Google/Gemini] 

  • システムエラー発生時のフォールバックアクション (Fallback routing): メインのエージェントやAPIがダウンした際に、自動的にサブシステムや軽量モデルにルーティングしてタスクを継続する機能 [OpenClaw] 

  • メイン・非メインセッションの権限自動切り替え (Permission switching): ユーザー自身の操作と外部からのアクセスで、ツール実行の権限やサンドボックスの要否を自律的に切り替える機能 [OpenClaw] 

  • 独自の開発環境内でのインラインアクション (IDE integrations): VS CodeやJetBrains等のエディタ内で、エージェントが直接コードの挿入やリファクタリングアクションを実行する機能 [Anthropic/Claude, Google/Gemini] 

  • ブラウザ内での自律的Web調査とデータ抽出 (Web fetch / scraping): URLを指定されたエージェントが自律的にWebページを取得し、DOMを解析して必要なデータを抽出するアクション [Anthropic/Claude] 

  • 複数クエリの並列自律実行 (Multi-query support): エージェントが複雑なタスクを複数の検索クエリに分割し、同時にAPIを実行して情報を収集する機能 [Perplexity] 

  • Xスレッドの自律的全体フェッチ (Thread fetch): エージェントがX上の特定のスレッドを遡り、会話の文脈全体を自律的に取得するアクション [xAI] 

  • サードパーティプラットフォームとのエンドツーエンド統合 (WhatsApp/Cloud Provider integration): Llamaモデル等を利用して、WhatsApp等のアプリからクラウドインフラへの一連のアクションを自律的に連携する機能 [Meta/Llama]


その他の機能

上記の理解、検索、推論、生成、行動以外の機能です。学習・最適化、評価・監視、管理・運用、セキュリティ・ガバナンス、インフラ・デプロイ、開発者ツールなどに関連する機能です。

学習・カスタマイズ・パフォーマンス最適化


  • ファインチューニング (Supervised fine-tuning): 独自のデータセットでモデルを微調整し、特定のタスクの精度を向上 [OpenAI]

  • 視覚機能のファインチューニング (Vision fine-tuning): 画像データを含めたマルチモーダルな微調整 [OpenAI]

  • 直接選好最適化 (Direct preference optimization / DPO): 人間の好みに合わせてモデルの出力を最適化 [OpenAI]

  • 強化学習ファインチューニング (Reinforcement fine-tuning): 特定の報酬に基づいてモデルの振る舞いを最適化 [OpenAI]

  • カスタムモデルの独自学習 (Custom training): オープンモデル等を自社環境で独自にトレーニング [Google/Vertex AI]

  • オープンモデルのファインチューニング (Fine-tuning recipes): Llamaモデルなどを特定ユースケース向けに微調整 [Meta/Llama]

  • プロンプトキャッシング (Prompt caching): 長大なプロンプトをキャッシュし、APIのレイテンシとコストを削減 [OpenAI, Anthropic, xAI]

  • コンテキストキャッシング (Context Caching): 大規模な入力コンテキストをシステム側でキャッシュ [DeepSeek]

  • バッチ処理API (Batch API): 非同期で大量のAPIリクエストを一括処理し、コストを半減 [OpenAI, Anthropic, xAI]

  • 遅延最適化 / 予測出力 (Predicted Outputs): 既知の出力を予測させることで生成速度を大幅に向上 [OpenAI]

  • 優先度・フレックス処理 (Priority / Flex processing): APIリクエストの処理優先度を下げてコストを最適化 [OpenAI]

  • プロビジョンド・スループット (Provisioned Throughput): 専用のコンピュートリソースを予約し、安定したスループットを確保 [xAI]

  • 推論の量子化とメモリ・オフロード (Quantization & Offloading): リソースの限られたデバイスで大規模モデルを動かすための最適化 [Diffusers]

  • TensorRT最適化モデル (NVIDIA TensorRT optimized): NVIDIA GPU向けに推論速度を極限まで最適化 [Stability AI]

  • AMD GPU最適化モデル (AMD Optimized): AMD環境での画像生成に特化したモデルチューニング [Stability AI]

  • PyTorchコンパイル最適化 (torch.compile): コードをコンパイルして推論速度をブースト [Diffusers]

  • プロンプトの自己最適化 (Prompt optimizer): モデルが自身のプロンプトを分析し、最も効果的な構造に自動修正 [OpenAI]

  • Microsoft 365 Copilot Tuning (プレビュー): 組織特有のデータや用語に合わせてCopilotをチューニング [Microsoft]

評価・監視・オブザーバビリティ

  • モデルの自動評価ツール (Evals / Graders): データ駆動でモデルのパフォーマンスや正確性を評価・採点 [OpenAI]

  • 評価用テストセットの作成 (Create test sets): エージェントを評価するための独自テストデータを作成 [Copilot Studio]

  • 評価ツールUI (Evaluation Tool): コンソール上でプロンプトの出力を並べて視覚的に評価 [Anthropic]

  • エージェントワークフローの自動評価 (Evaluate workflows): 複雑なエージェントの行動フローが正しく機能するかをテスト [OpenAI]

  • モデルプレイグラウンド (Studio playground): パラメータを調整しながらモデル出力をリアルタイムに比較・テスト [Mistral AI]

  • 生成AIモデル評価サービス (Gen AI Evaluation): エンタープライズ品質の客観的なモデル評価基盤 [Google/Vertex AI]

  • MLOpsプラットフォーム (MLOps): モデルの監視、評価、パイプラインのオーケストレーションを自動化 [Google Cloud]

  • モデルの入力スキューとドリフト監視 (Model Monitoring): 運用中のデータ傾向の変化やモデルの劣化を監視 [Google/Vertex AI]

  • エージェントパフォーマンス分析 (Analytics): 会話の成功率やユーザー満足度などの指標を分析 [Copilot Studio]

  • 自律型エージェントの健全性分析 (Agent health): 自律行動するエージェントのエラー率や稼働状態を監視 [Copilot Studio]

  • クラウドシステムのオブザーバビリティ (Cloud Logging / Monitoring): インフラやAPIのログ、メトリクスを統合監視 [Google Cloud]

  • アプリケーショントレース (Error Reporting / Trace): APIコールの遅延やエラーの発生源を追跡・特定 [Google Cloud]

  • APIシステムステータスAPI (System Status API): サービスの稼働状況をプログラムから監視 [Perplexity]

  • 詳細なトークン使用量トラッキング (Counting tokens / Usage): プロンプトやキャッシュで消費されたトークン数を正確に監視 [OpenAI, Anthropic]

管理・運用・課金

  • 組織・ワークスペース管理 (Manage workspaces): チームごとに独立したワークスペースや環境を作成・管理 [Mistral AI, Anthropic]

  • プロジェクト管理 (Projects): アプリケーションごとにAPIキーや設定を分割するプロジェクト機能 [OpenAI]

  • ユーザー招待・管理 (User Management / Invites): 組織へのメンバー招待やアカウントのライフサイクル管理 [OpenAI, Mistral AI]

  • ロール割り当て (Roles / Permissions): ユーザーごとに閲覧・編集・管理者などの権限を付与 [OpenAI, Mistral AI]

  • APIキーの作成とローテーション (API Key Management): ワークスペースごとにAPIキーを発行・無効化 [全般]

  • 管理者向けAPI (Admin API): ワークスペースやキーの管理をプログラムから自動化 [OpenAI, Anthropic]

  • 管理者追跡用APIキー (Admin API Keys): 組織全体の利用状況を追跡するための特別なAPIキー [OpenAI]

  • 請求・FinOpsダッシュボード (Billing Management): チームごとのAPI利用額やコストを可視化・管理 [Mistral AI, xAI]

  • 利用枠とレート制限の管理 (Rate limits & Tiers): 現在のAPIレート制限(RPM/TPM)やティアの確認と上限管理 [OpenAI, Perplexity]

  • クラウドコスト管理ツール (Cost Management): インフラ全体のコストを最適化・予算アラートを設定 [Google Cloud]

  • 監査ログ機能 (Audit Logs): 誰がいつシステムに変更を加えたかの履歴を記録し、セキュリティ監査に利用 [OpenAI, xAI, Microsoft]

  • ライセンスの割り当て (Assign licenses): Copilotやエージェントの利用ライセンスをユーザーに付与 [Copilot Studio]

  • モデルレジストリ (Model Registry): 学習済みモデルのバージョンやメタデータを一元管理 [Google/Vertex AI]

  • 特徴量ストア (Feature Store): MLモデルで再利用する特徴量(Feature)を共有・管理 [Google/Vertex AI]

  • サブスクリプション自動更新管理 (Managing Subscription): 有料プランのアップグレード/ダウングレードや自動更新の管理 [Midjourney]

  • 組織の税務ステータス設定 (Tax / VAT): 法人向けのVAT免除や税務情報の構成 [Midjourney]

  • クレジット消費管理 (Credits management): 画像生成等におけるクレジット(通貨)の消費トラッキング [Stability AI]

セキュリティ・ガバナンス・アクセス制御

  • シングルサインオン統合 (SSO / SAML): 企業のIdP(Okta等)を用いたセキュアなログイン統合 [Mistral AI, xAI]

  • Microsoft Entra IDによるSSO統合: Teams等でのエージェント利用時のシームレスな認証 [Microsoft]

  • ロールベースのアクセス制御 (RBAC): きめ細かい権限設定によるAPI・リソースへのアクセス制御 [xAI]

  • エージェントのデータポリシー構成 (Data policies): エージェントがアクセスできる社内データや実行可能なアクションを制限 [Copilot Studio]

  • 安全性フィルター・モデレーション (Moderation): 有害なプロンプトや出力をブロック・評価するAPI [OpenAI, Meta]

  • サイバーセキュリティ検証 (Cybersecurity checks): アプリケーションがセキュリティ基準を満たしているかのチェック [OpenAI]

  • 年齢検証・未成年保護 (Under 18 API / Age Assurance): 生体情報や利用シグナルからユーザーが18歳以上かを判定 [OpenAI, C.AI]

  • コンプライアンス管理 (Compliance): SOC 2, GDPR, CCPAなどの厳格な規制基準への準拠機能 [xAI]

  • データレジデンシ制御 (Data residency): データを保存・処理する地理的リージョン(国)を厳密に指定 [xAI]

  • データの暗号化と分離 (Encryption / Separation): 学習に利用しないデータの分離保存と、送受信・保存時の暗号化 [Meta]

  • mTLS認証 (mTLS Authentication): クライアントとサーバーの双方向で証明書を用いた厳格なAPI認証 [xAI]

  • セキュリティコマンドセンター (Security Command Center): クラウド上の脅威や脆弱性を統合的に監視 [Google Cloud]

  • 機密データの保護 (Sensitive Data Protection): PII(個人情報)などの機密データを自動で発見し、マスキング・保護 [Google Cloud]

  • VPC Service Controls (VPC-SC): 企業ネットワークから外部へのデータの持ち出し(流出)を防止 [Google Cloud]

  • eDiscoveryとデータ保持 (eDiscovery / Legal hold): 訴訟や監査に備えて、Copilotの会話履歴を保持・検索 [Microsoft 365]

  • APIのフィンガープリント管理 (Fingerprint): バックエンドのモデル変更を追跡するための識別子管理 [xAI]

  • DMペアリングとアクセス制御 (DM pairing / Allowlist): 未知のユーザーからのDMをブロックし、承認制にする機能 [OpenClaw]

  • 安全なサンドボックス環境 (Docker/SSH Sandbox): エージェントにシステム操作をさせる際、隔離されたコンテナ環境に制限 [OpenClaw]

インフラ・デプロイ・スケーリング

  • Llama Stack (APIレイヤーのセルフホスト): Llamaモデルを自社インフラ上でAPIとしてホストするための基盤 [Meta]

  • Llama Everywhere (エッジ展開): デスクトップやLinuxベースのオンプレミス環境にモデルを直接展開 [Meta]

  • AIエッジデプロイメント (Google AI Edge): モバイルや組み込みデバイス向けに軽量AIモデルを展開 [Google]

  • クラウドモデルデプロイ (Prediction / Serving): 学習したモデルをバッチ推論やオンライン予測のAPIとして公開 [Google/Vertex AI]

  • サーバレスコンテナ展開 (Cloud Run / Cloud Functions): AIアプリのバックエンドをインフラ管理なしで自動スケール展開 [Google Cloud]

  • Kubernetesクラスター統合 (Google Kubernetes Engine): コンテナ化された大規模なAIワークロードをオーケストレーション [Google Cloud]

  • エンタープライズエージェント展開 (Enterprise Agent Platform): 構築したエージェントを本番環境にスケーラブルにデプロイ [Google Cloud]

  • サードパーティクラウドへの展開: Amazon BedrockやVertex AIのインフラ上でClaudeモデルを運用 [Anthropic]

  • Microsoft Foundryでのデプロイ: エンタープライズ向けPaaS環境でAIモデルやエージェントをデプロイ [Microsoft]

  • APIゲートウェイと統合 (Apigee / Application Integration): 自社APIを安全に公開し、AIと連携させるためのルーティング基盤 [Google Cloud]

  • Tailscaleネットワーキング統合: Tailnetを利用して、リモート環境からローカルのAIアシスタントに安全にアクセス [OpenClaw]

  • エアギャップ・オンプレミス展開 (Google Distributed Cloud): インターネットから隔離された閉域網環境にAIインフラを展開 [Google Cloud]

  • CI/CDパイプライン (Cloud Build / Cloud Deploy): AIアプリケーションのビルドとデプロイメントを自動化 [Google Cloud]

  • インフラストラクチャのコード化 (Infrastructure Manager): Terraform等を用いてAI用クラウドインフラをコードで管理・構築 [Google Cloud]

  • バッチ・タスクスケジュール (Cloud Scheduler / Batch): 非同期の重いデータ処理や推論タスクをスケジュール実行 [Google Cloud]

  • 専用推論エンドポイント (Inference Endpoints): Hugging Face上でカスタムモデルを専用のAPIインフラとしてデプロイ [Hugging Face]

開発者体験・インターフェース・エコシステム

  • Web Control UIダッシュボード: ブラウザからローカルエージェントのチャット、構成、セッションを管理 [OpenClaw]

  • CLIオンボーディング (openclaw onboard): ターミナル上で対話的にエージェントのインストールや設定を自動実行 [OpenClaw]

  • macOS向けシステム管理アプリ (OpenClaw.app): メニューバーからゲートウェイの起動やステータスを管理 [OpenClaw]

  • システムの自己診断機能 (openclaw doctor): 設定ミスや環境の不具合を自動的に検出してトラブルシューティング [OpenClaw]

  • 開発チャンネル切り替え (Update channels): Stable, Beta, Devなどのリリースチャンネルをコマンドで切り替え [OpenClaw]

  • IDE統合拡張機能 (VS Code / JetBrains extension): 開発環境のエディタ内にAIアシスタントを直接統合 [Anthropic, Google]

  • ローカルワークツリー環境 (Worktrees): メインの作業環境を汚さずに、エージェント用の独立した作業ブランチを作成 [Anthropic]

  • プロジェクト固有の指示ファイル (CLAUDE.md / AGENTS.md): リポジトリのルートに配置し、エージェントにプロジェクトの規則を自動で読み込ませる機能 [Anthropic, OpenClaw]

  • 非対話型自動化モード (Non-interactive Mode): CI/CDなどで人間が介入せずにCLIエージェントを自動実行するモード [Anthropic]

  • 開発者モード / トレース (/trace): エージェントの内部処理やネットワークリクエストのログを詳細に出力 [OpenAI, OpenClaw]

  • OpenAI互換APIエンドポイント (OpenAI Compatibility): 既存のOpenAI用SDKをそのまま使って他社モデル(Llama, DeepSeek等)を呼び出せる機能 [Meta, Perplexity, DeepSeek]

  • Model Context Protocol (MCP) エコシステム: 異なるAIモデルやツール間でコンテキストを標準化して連携させるプロトコル基盤 [Anthropic, OpenAI, Microsoft]

  • カスタムウィジェット組み込み (ChatKit Widgets): ChatGPTのUI内にサードパーティ製のカスタムウィジェットを組み込む開発機能 [OpenAI]

  • プロンプト比較と管理 (GitHub Models): 複数のプロンプトの出力を並べて比較・管理する開発者向けツール [GitHub]

  • GitHub Actions自動化連携: リポジトリのイベントをトリガーに、AIモデルをCI/CDワークフロー内で実行 [GitHub]

  • ノートブック環境統合 (Colab Enterprise): Jupyter Notebookライクな環境でAIモデルの開発とデータサイエンスを統合 [Google Cloud]

  • アプリ内ブラウザ統合 (In-app browser): エージェントがCLIやIDE内で直接Webページをレンダリングし、調査結果を表示 [Anthropic]


おわりに

AIによってできることは増えており、今後も随時更新します。ぼくとしては、不動産・建設業界に特化したAIエージェントを開発しており、上記のような汎用的なAIで将来的にも対応が困難である部分に注力して研究開発を進めたいと思っております。