GroupDocs.Parser на перший погляд

SDK парсера документів для високоточних операцій парсингу документів у застосунках Node.js

Illustration parser

Витягти дані з документів

GroupDocs.Parser for Node.js via Java API дозволяє отримувати текст, метадані та зображення з широкого спектру форматів файлів, таких як офісні документи, електронні листи, вкладення та архіви. Цей потужний інструмент допомагає ефективно отримувати доступ і опрацювати цінну інформацію, що міститься у цих файлах, для різних застосувань, таких як аналіз даних, індексація пошукових систем або системи управління контентом.

Парсити документи

Витягайте різноманітні елементи, такі як гіперпосилання, таблиці, QR‑коди, штрих‑коди та дані з PDF‑форм. Також парсити будь‑яку потрібну інформацію з документів за допомогою кастомних шаблонів.

Налаштування результатів

Node.js API дозволяє отримувати дані у різних форматах, таких як необроблені, структуровані, HTML або Markdown. Крім того, API пропонує функціональність пошуку для знаходження конкретних слів або фраз у тексті документів.

Платформна незалежність

GroupDocs.Parser for Node.js via Java підтримує наступні операційні системи, фреймворки та менеджери пакетів

Windows
macOS
Linux
NPM
Amazon
Docker
Azure
VS Code
IntelliJ

Підтримувані формати файлів

GroupDocs.Parser for Node.js via Java підтримує роботу з такими форматами файлів.

Формати Microsoft Office

  • Word: DOCX, DOC, DOCM, DOT, DOTX, DOTM, RTF
  • Excel: XLSX, XLS, XLSM, XLSB, XLTM, XLT, XLTM, XLTX, XLAM, SXC, SpreadsheetML
  • PowerPoint: PPT, PPTX, PPS, PPSX, PPSM, POT, POTM, POTX, PPTM

Зображення та інші формати

  • Портативний: PDF
  • Зображення: JPG, BMP, PNG, TIFF, GIF
  • Інші офісні формати: ODT, OTT, OTS, ODS, ODP, OTP, ODG

Інші формати

  • Веб: HTML, MHTML
  • Архіви: ZIP, TAR, 7Z
  • Електронні книги: CHM, EPUB, FB2, MOBI

GroupDocs.Parser for Node.js via Java функції

Витягайте дані з PDF, офісних документів, зображень та інших форматів швидко та точно за допомогою нашого Node.js SDK парсера документів

Feature icon

Витягти текст

Витягайте текстову інформацію з різних форматів файлів, таких як офісні документи, PDF‑файли та зображення, для зручного читання та аналізу.

Feature icon

Витягти зображення

Отримуйте візуальний контент з різноманітних джерел, таких як офісні документи, PDF‑файли, для зручного доступу та використання.

Feature icon

Сканувати QR‑коди

Виявляйте та декодуйте QR‑коди, що містяться в офісних документах, PDF‑файлах або візуальному контенті, для ефективного отримання інформації.

Feature icon

Витягти дані з вкладень електронної пошти та архівів

Збирайте цінну інформацію з електронних листів, вкладень файлів та стиснених джерел даних для ефективного аналізу та використання.

Feature icon

Витягти таблиці

Визначайте та витягайте табличні дані з PDF‑документів для упорядкованого аналізу та використання.

Feature icon

Витягти гіперпосилання

Знаходьте та витягайте гіперпосилання та електронні адреси в офісних документах або PDF‑файлах для зручного доступу.

Feature icon

Парсити PDF-форми

PDF‑форми – це цифрові документи з заповнюваними полями для взаємодії користувачів, що дозволяє їм вводити інформацію електронно. Node.js API можна використати для витягнення даних з цих форм для ефективної обробки.

Feature icon

Парсити дані за шаблонами

Створіть власні шаблони та використайте їх разом з Node.js API для парсингу конкретної інформації з PDF‑файлів, спрощуючи процеси витягнення даних.

Feature icon

Пошук тексту в документах

Швидко знаходьте конкретні слова або шаблони в документах.

Зразки коду

Окрім базового витягнення тексту, ось найпоширеніші випадки використання для швидкого витягнення тексту, зображень та метаданих.

Пошук тексту в документі

Цей приклад демонструє, як шукати слово у PDF‑документі та вивести номер сторінки і позицію кожного збігу.

Пошук тексту в документі на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Завантажте документ
const parser = new groupdocs.Parser("sample.pdf");

// Шукайте слово по сторінках
const options = new groupdocs.SearchOptions(false, false, false, true);
const results = parser.search("Lorem", options);

// Виведіть індекс сторінки, позицію та текст кожного збігу
const it = results.iterator();
while (it.hasNext()) {
    const result = it.next();
    console.log(`Page ${result.getPageIndex()}, position ${result.getPosition()}: ${result.getText()}`);
}

parser.close();

Витягнути зображення з документа

Цей приклад демонструє, як витягти зображення з PDF‑документу та зберегти їх у вигляді PNG‑файлів.

Витягнути зображення з документа на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Завантажте документ
const parser = new groupdocs.Parser("images.pdf");

// Витягніть зображення з документа
const images = parser.getImages();

// Збережіть зображення у вигляді PNG‑файлів
const options = new groupdocs.ImageOptions(groupdocs.ImageFormat.Png);
let index = 1;
const it = images.iterator();
while (it.hasNext()) {
    it.next().save(`image_${index++}.png`, options);
}

parser.close();

Витягнути метадані з документа

Цей приклад демонструє, як витягти метадані з PDF‑документу та вивести їх.

Витягнути метадані з документа на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Завантажте документ
const parser = new groupdocs.Parser("sample.pdf");

// Витягніть метадані з документа
const metadata = parser.getMetadata();

// Виведіть метадані
const it = metadata.iterator();
while (it.hasNext()) {
    const item = it.next();
    console.log(`${item.getName()}: ${item.getValue()}`);
}

parser.close();

Готові почати?

Завантажте GroupDocs.Parser безкоштовно або отримайте пробну ліцензію для повного доступу!

Корисні ресурси

Вивчіть документацію, зразки коду та підтримку спільноти для покращення вашого досвіду.

Поради щодо тимчасової ліцензії

1
Зареєструйтеся за допомогою вашої робочої e-mail. Безкоштовні поштові служби заборонені.
2
Скористайтеся кнопкою Отримати тимчасову ліцензію на другому кроці.
✕
 Українська