AIの概要
Apache Dorisは、テキスト検索、ベクトル検索、AI機能、MCPベースのインテリジェント・インタラクションを深く統合した高性能リアルタイム分析データベースです。データストレージ、検索、分析をカバーする完全なAIデータスタックを構築し、AIアプリケーションに統一されたデータインフラストラクチャを提供します。
以下の表は、一般的なAIシナリオとDorisが提供する対応する機能を示し、適切なソリューションを迅速に特定するのに役立ちます。
| 実現したいこと | シナリオ | 中核機能 |
|---|---|---|
| AI Agentにビジネスデータをリアルタイムでクエリさせる | Agent Facing Analytics | MPPアーキテクチャ、ミリ秒レベルクエリ、MCP Server |
| 同一データでキーワード検索、ベクトル検索、集約を実行する | ハイブリッド検索・分析 | 転置インデックス + ベクトルインデックス + SQL |
| AI訓練データの準備と特徴エンジニアリングを加速する | Lakehouse for AI | Lakehouseアーキテクチャ、オープンテーブルフォーマット、高速SQL |
| 企業知識ベースとインテリジェント・カスタマーサービスを構築する | RAGアプリケーション | 高同時実行ベクトル検索、ハイブリッド検索 |
| モデル訓練と推論サービスを監視する | AI Observability | 高スループット取り込み、転置インデックス、低ストレージコスト |
| 検索にユーザーの意図を理解させる | セマンティック検索 | HNSW/IVF、量子化、マルチモーダル拡張 |
Agent Facing Analytics
AI Agent技術が注目を集める中、より多くの分析的決定がAIによって自動的に行われるようになり、これにはデータプラットフォームが極限のリアルタイム性能と高同時実行性を提供することが求められます。従来の「人間による分析」とは異なり、Agent Facing Analyticsでは、データクエリと意思決定をミリ秒以内に完了し、大量のAgentからの同時アクセスをサポートする必要があります。典型的なシナリオには、リアルタイム不正検知、インテリジェント広告配信、パーソナライズドレコメンデーションが含まれます。
高性能MPPアーキテクチャを活用して、DorisはAgent対応分析シナリオにおいて以下の利点を提供します:
| 機能 | 指標 | 値 |
|---|---|---|
| データレイテンシ | サブ秒 | リアルタイム取り込みと更新により、Agentの決定が最新データに基づくことを保証 |
| クエリレスポンス | 平均 < 100 ms | Agentのリアルタイム決定ニーズを満たす |
| 同時実行 | 10,000+ QPS | 大量のAgentからの同時クエリを容易に処理 |
| 統合 | ネイティブMCP Server | AI Agentとシームレスに統合し、開発を簡素化 |
Hybrid Search and Analytics Processing

半構造化・非構造化データがデータ分析において第一級の存在となっています。顧客レビュー、チャットログ、生産ログ、車両テレメトリ信号は今やビジネス意思決定に深く統合されています。従来の構造化分析ソリューションは、全文検索とベクトル検索機能を組み合わせる必要があり、単一プラットフォーム上でセマンティック検索と集約を伴う多次元分析の両方をサポートします。典型的なシナリオには以下が含まれます:
- 顧客インサイト: レビューテキスト検索とユーザー行動分析を組み合わせて、顧客ニーズと満足度トレンドを精密に特定。
- スマート製造: 生産ログの全文検索、設備画像認識、IoTメトリック分析を組み合わせて、故障予測と品質最適化を実現。
- コネクテッドビークル: 車両テレメトリ分析、ユーザーフィードバックテキストマイニング、運転行動ベクトル検索を組み合わせて、スマートコックピット体験を向上。
Doris上でハイブリッド検索・分析アプリケーションを構築する利点:
- 統一アーキテクチャ: データ移行や異種システム統合なしに、単一プラットフォーム上で構造化分析、全文検索、ベクトル検索を処理。
- ハイブリッドクエリ性能: 単一SQL文でベクトル類似性検索、キーワードフィルタリング、集約を実行し、優れたクエリ性能を実現。
- 柔軟なスキーマサポート: VARIANT型が動的JSON構造をネイティブサポートし、Light Schema Changeによりフィールドとインデックスの変更を秒単位で実現。
- フルスタック最適化: 転置インデックス・ベクトルインデックスからMPP実行エンジンまでのエンドツーエンド最適化により、検索精度と分析効率のバランスを取る。
Lakehouse for AI
AIモデルとアプリケーションの開発には、大規模データセットから訓練セットを準備し、特徴エンジニアリングを実行し、データ品質を評価することが必要です。従来のアーキテクチャでは、データレイクと分析エンジン間での頻繁なデータ移行が必要になることが多いです。Lakehouseアーキテクチャは、データレイクのオープンストレージとリアルタイム分析エンジンを深く統合し、統一プラットフォーム上でデータ準備、特徴エンジニアリング、モデル評価の全ワークフローをサポートします。これにより、データサイロを排除し、AI開発の反復を加速します。
アーキテクチャ特性:
- Lakehouse統合: オープンレークテーブルフォーマット(IcebergやPaimonなど)とCatalogに基づくオープンlakehouseを構築し、分析データとAIデータを統一管理。
- 高速SQLエンジン: Dorisがリアルタイム分析エンジンとして機能し、対話型クエリと軽量ETLをサポートし、データ準備と特徴エンジニアリングに効率的なSQL計算を提供。
- シームレスなデータフロー: データ移動なしにデータレイクから直接読み取り・書き込み。ストレージレイヤーは統一管理され、コンピュートレイヤーは柔軟な高速化を提供。
AIワークフロー全体での高速化:
- 大規模データ準備: PBスケールデータレイクからデータを効率的にフィルタリング、サンプリング、クリーニングし、高品質な訓練データセットを迅速に構築。
- リアルタイム特徴エンジニアリング: オンライン特徴抽出、変換、集約を実行し、モデル訓練と推論にリアルタイム特徴サービスを提供。
- 品質評価: テストセットと本番データに対して多次元高速分析を実行し、モデル性能とデータドリフトを継続監視。
RAG (Retrieval-Augmented Generation)
RAGは外部知識ベースから関連情報を検索して大規模言語モデルにコンテキストを提供し、モデルの幻覚と知識の適時性の問題に効果的に対処します。ベクトルエンジンはRAGシステムの中核コンポーネントです。大規模知識ベースから最も関連性の高い文書断片を迅速にリコールし、同時に高同時実行ユーザークエリリクエストをサポートして、レスポンシブなアプリケーション体験を保証する必要があります。
典型的なアプリケーション:
- 企業知識ベース: 内部文書とマニュアルに基づくインテリジェントQ&Aシステムを構築し、従業員が自然言語で迅速に正確な回答を取得。
- インテリジェント・カスタマーサービス・アシスタント: 製品知識ベースと履歴ケースを組み合わせて、カスタマーサービス担当者やチャットボットに精密な返答提案を提供。
- インテリジェント・ドキュメント・アシスタント: 大規模文書コレクション内の関連コンテンツを迅速に特定し、研究、執筆、意思決定をサポート。
Doris上でRAGを構築する利点:
- 高同時実行性能: 分散アーキテクチャが高同時実行ベクトル検索をサポートし、大規模同時ユーザーアクセスを容易に処理。
- ハイブリッド検索機能: 単一SQL文でベクトル類似性検索とキーワードフィルタリングを実行し、セマンティックリコールと完全マッチングのバランスを取る。
- エラスティックスケーリング: クラスターの成長に伴って検索性能が線形にスケールし、数百万から数百億ベクトルへスムーズに移行。
- 統一ソリューション: ベクトルデータ、生文書、ビジネスデータを統一管理し、RAGアプリケーションのデータアーキテクチャを簡素化。
AI Observability
AIモデル訓練の反復とアプリケーション実行時には、大量のログ、メトリック、トレースデータが生成されます。問題を正確に特定し、性能を継続的に最適化するために、可観測性システムはAIインフラストラクチャの重要な部分となっています。ビジネス規模の拡大に伴い、可観測性プラットフォームはPBスケールデータの高スループット取り込み、ミリ秒レベル検索レスポンス、コスト制御の複合的な課題に直面しています。
典型的な使用例:
- モデル訓練監視: 訓練メトリックとリソース消費をリアルタイムで追跡し、訓練異常と性能ボトルネックを迅速に特定。
- 推論サービストレーシング: 各推論リクエストの完全なコールチェーンを記録し、レイテンシ源とエラーパターンを分析。
- AIアプリケーション・ログ解析: 大量のアプリケーションログに対して全文検索と集約を実行し、トラブルシューティングと行動インサイトをサポート。
Doris上でAI Observabilityを構築する利点:
| 次元 | 機能メトリック |
|---|---|
| 取り込み性能 | PB/日(10 GB/s)の持続取り込みをサポート、転置インデックスがログ検索を高速化し秒レベルレスポンスを実現 |
| ストレージコスト | 5:1から10:1の圧縮率により、ストレージコストを50%-80%削減、コールドデータには低コストストレージを使用 |
| スキーマ柔軟性 | Light Schema Changeによりフィールド変更を秒単位で実現、VARIANT型が動的JSONをネイティブサポート |
| エコシステム互換性 | OpenTelemetryとELKエコシステムに対応、GrafanaやKibanaなどの可視化ツールと統合 |
Semantic Search
セマンティック検索はベクトル化を使用してテキストの深い意味を捉え、クエリ用語が文書で使用されている表現と異なる場合でも、意味的に関連するコンテンツをリコールします。これは言語横断検索、同義語認識、意図理解、類似シナリオにとって重要であり、検索リコールとユーザー体験を大幅に改善します。
典型的な使用例:
- 企業文書検索: 従業員が自然言語で質問を記述すると、システムが意図を理解し、大量の文書リポジトリから意味的に関連するポリシー、プロセス、知識をリコール。
- Eコマース製品検索: ユーザーが「夏に適した通気性の良い靴」と入力すると、システムがニーズを理解し、キーワードのみの一致ではなく関連製品をリコール。
- コンテンツ推奨プラットフォーム: 記事や動画のセマンティック類似性に基づいてインテリジェント推奨を行い、ユーザーが興味を持つ可能性があるが異なる表現を使用するコンテンツを表示。
Doris上でセマンティック検索を構築する利点:
- 高性能ベクトル検索: HNSWとIVFアルゴリズムをサポートし、億スケールベクトルでサブ秒レスポンスを実現、大規模セマンティック検索ニーズを容易に処理。
- ハイブリッド検索強化: 単一SQL文でセマンティック検索とキーワードフィルタリングを組み合わせ、必要なキーワードの一致を確保しながら意味的に関連するコンテンツをリコール。
- マルチモーダル拡張: テキストだけでなく、画像や音声などのマルチモーダルコンテンツのセマンティック検索もサポート。
- 柔軟な量子化最適化: SQ/PQ量子化技術により、検索精度を保持しながらストレージと計算コストを大幅に削減。