GroupDocs.Parser の概要

Node.js アプリケーションで高精度のドキュメント解析を実行するための Document Parser SDK

Illustration parser

ドキュメントからデータを抽出

GroupDocs.Parser for Node.js via Java API を使用すると、Office 文書、メール、添付ファイル、アーカイブなど、幅広いファイル形式からテキスト、メタデータ、画像を取得できます。この強力なツールは、データ分析、検索エンジンのインデックス作成、コンテンツ管理システムなどのさまざまなアプリケーションで、ファイルに含まれる貴重な情報へ効率的にアクセスし、処理するのに役立ちます。

ドキュメントを解析

PDF フォームからハイパーリンク、表、QR コード、バーコード、データなどさまざまな要素を抽出します。また、カスタムテンプレートを使用してドキュメントから任意の情報を解析できます。

結果のカスタマイズ

Node.js API を使用すると、RAW、構造化、HTML、Markdown などのさまざまな形式でデータを取得できます。また、ドキュメントテキスト内で特定の単語やフレーズを検索する機能も提供します。

プラットフォームに依存しない

GroupDocs.Parser for Node.js via Java は以下のオペレーティングシステム、フレームワーク、パッケージマネージャーをサポートします

Windows
macOS
Linux
NPM
Amazon
Docker
Azure
VS Code
IntelliJ

サポートされているファイル形式

GroupDocs.Parser for Node.js via Java は以下の ファイル形式 に対応しています。

Microsoft Office 形式

  • Word: DOCX, DOC, DOCM, DOT, DOTX, DOTM, RTF
  • Excel: XLSX, XLS, XLSM, XLSB, XLTM, XLT, XLTM, XLTX, XLAM, SXC, SpreadsheetML
  • PowerPoint: PPT, PPTX, PPS, PPSX, PPSM, POT, POTM, POTX, PPTM

画像 & その他の形式

  • ポータブル: PDF
  • 画像: JPG, BMP, PNG, TIFF, GIF
  • その他のオフィス形式: ODT, OTT, OTS, ODS, ODP, OTP, ODG

その他の形式

  • Web: HTML, MHTML
  • アーカイブ: ZIP, TAR, 7Z
  • 電子書籍: CHM, EPUB, FB2, MOBI

GroupDocs.Parser for Node.js via Java の機能

Node.js 用 Document Parser SDK を使用して、PDF、Office 文書、画像、その他の形式からデータを迅速かつ正確に抽出します。

Feature icon

テキスト抽出

Office 文書、PDF ファイル、画像などさまざまなファイル形式からテキスト情報を抽出し、読みやすく分析しやすくします。

Feature icon

画像抽出

Office 文書や PDF ファイルなど多様なソースからビジュアルコンテンツを取得し、便利に利用できます。

Feature icon

QR コードのスキャン

Office 文書、PDF ファイル、ビジュアルコンテンツ内にある QR コードを検出・デコードし、効率的に情報を取得します。

Feature icon

メール添付ファイルおよびアーカイブからデータを抽出

メールメッセージ、ファイル添付、圧縮データソースから有用な情報を収集し、効果的に分析・活用できます。

Feature icon

表の抽出

PDF ドキュメントから表形式データを識別し抽出して、整理された分析や利用に活かします。

Feature icon

ハイパーリンク抽出

Office 文書や PDF ファイル内のハイパーリンクやメールアドレスを検索・抽出し、効率的にアクセスできます。

Feature icon

PDF フォームを解析

PDF フォームは、ユーザーが入力できるフィールドを備えたデジタル文書で、情報を電子的に入力できます。Node.js API を利用して、これらのフォームからデータを抽出し、効率的に処理できます。

Feature icon

テンプレートでデータを解析

カスタムテンプレートを作成し、Node.js API と組み合わせて PDF ファイルから特定の情報を解析し、データ抽出プロセスを簡素化します。

Feature icon

文書内のテキスト検索

文書内の特定の単語やパターンを迅速に見つけます。

コードサンプル

基本的なテキスト抽出に加えて、テキスト、画像、メタデータの高速抽出に最も一般的なユースケースを紹介します。

文書内のテキスト検索

この例では、PDF 文書内の単語を検索し、すべての一致箇所のページ番号と位置を出力する方法を示します。

JavaScript で文書内のテキスト検索

const groupdocs = require('@groupdocs/groupdocs.parser');

// 文書をロード
const parser = new groupdocs.Parser("sample.pdf");

// ページ単位で単語を検索
const options = new groupdocs.SearchOptions(false, false, false, true);
const results = parser.search("Lorem", options);

// 一致ごとのページインデックス、位置、テキストを出力
const it = results.iterator();
while (it.hasNext()) {
    const result = it.next();
    console.log(`Page ${result.getPageIndex()}, position ${result.getPosition()}: ${result.getText()}`);
}

parser.close();

文書から画像を抽出

この例では、PDF 文書から画像を抽出し、PNG ファイルとして保存する方法を示します。

JavaScript で文書から画像を抽出

const groupdocs = require('@groupdocs/groupdocs.parser');

// 文書をロード
const parser = new groupdocs.Parser("images.pdf");

// 文書から画像を抽出
const images = parser.getImages();

// 画像を PNG ファイルとして保存
const options = new groupdocs.ImageOptions(groupdocs.ImageFormat.Png);
let index = 1;
const it = images.iterator();
while (it.hasNext()) {
    it.next().save(`image_${index++}.png`, options);
}

parser.close();

文書からメタデータを抽出

この例では、PDF 文書からメタデータを抽出し、出力する方法を示します。

JavaScript で文書からメタデータを抽出

const groupdocs = require('@groupdocs/groupdocs.parser');

// 文書をロード
const parser = new groupdocs.Parser("sample.pdf");

// 文書からメタデータを抽出
const metadata = parser.getMetadata();

// メタデータを出力
const it = metadata.iterator();
while (it.hasNext()) {
    const item = it.next();
    console.log(`${item.getName()}: ${item.getValue()}`);
}

parser.close();

始める準備はできていますか?

GroupDocs.Parser を無料でダウンロードするか、フルアクセス用の試用版ライセンスを取得してください。

有用なリソース

ドキュメント、コードサンプル、コミュニティサポートを調べて、体験を向上させます。

一時ライセンスのヒント

1
職場の電子メールで登録してください。フリー メール サービスは使用できません。
2
2 番目のステップで [一時ライセンスを取得] ボタンを使用します。
✕
 日本