Skip to content

SyncCrawl™: Webクローリング&RAGナレッジ構築プラットフォーム

SyncCrawl™は、データ収集、自然言語処理(NLP)、Playwright MCPによるブラウザ自動化、そしてRAG(検索拡張生成)ナレッジパイプラインを連携したエンタープライズ向けWeb収集プラットフォームです。

対象WebサイトのUIやDOM構造が変更された場合でも文脈を分析してセレクターを再構成(Self-Healing)し、収集した非構造化Webデータをクレンジング・埋め込み処理して社内ベクトル知識ベースへ変換します。


主な機能と構成

従来のクローラーにおける運用保守の課題を軽減し、データ収集からベクトルインデックス化までの工程を一元化します。

1. 適応型クローリング (Self-Healing Crawling)

  • 自然言語指示の解釈: 「主要機関のお知らせ最新10件と本文内容を収集」といった業務言語でジョブを登録します。
  • 適応型セレクター復旧: サイト改編でCSS/XPathセレクターが変更されても、DOM構造とテキスト文脈を分析して対象データを再探索します。

2. RAGナレッジパイプライン (Knowledge Base)

  • 文脈保持チャンキング: HTML構造を解析し、文脈を保ったままセマンティックチャンクに分割します。
  • 多言語埋め込み対応: 日本語および業務ドメイン用語の処理に適した埋め込みモデルをサポートします。
  • ベクトルデータベース連携: PGVector、Milvus、Qdrant、Weaviate等の主要Vector DBと連携し、リアルタイム同期を行います。

3. 分散ランタイムとセキュリティ設計 (Production Architecture)

  • 4つの独立コンテナ: ServerAgentScenario-AgentConsoleの4つの分散イメージにより柔軟なスケールアウトが可能です。
  • SSRF防御機構: 内部ネットワークアクセスおよび不正リダイレクトを検証するURL検証モジュール(BrowserNavigateUrlValidator)を搭載しています。
  • 閉域網(Air-Gapped)対応: 外部インターネットと隔離されたオンプレミス環境でも、社内Private LLM(vLLM、Ollama)と連携して動作します。

技術仕様概要

区分サポート技術および仕様
コアバックエンドJava 21, Spring Boot 3.5, LangChain4j, Flyway
ブラウザ自動化Playwright MCP, Headless Chromium, 分散Worker
ストレージ&キャッシュPostgreSQL, Redis, MinIO / S3 オブジェクトストレージ
ベクトルデータベースPGVector, Milvus, Qdrant, Weaviate
運用コンソールVue 3, Vite, TypeScript, Quasar Design System
デプロイインフラDocker Multi-Arch (amd64/arm64), Kubernetes(AKS), Air-Gapped Runner

ドキュメント一覧

Last updated: