GroupDocs.Parser в двух словах

Document Parser SDK для выполнения высокоточного разбора документов в приложениях Node.js

Illustration parser

Извлечение данных из документов

GroupDocs.Parser for Node.js via Java API позволяет получать текст, метаданные и изображения из широкого спектра форматов файлов, таких как офисные документы, электронные письма, вложения и архивы. Этот мощный инструмент помогает эффективно получать доступ к ценным сведениям, содержащимся в этих файлах, и обрабатывать их для различных задач, таких как анализ данных, индексация поисковых систем или системы управления контентом.

Разбор документов

Извлекайте различные элементы, такие как гиперссылки, таблицы, QR‑коды, штрих‑коды и данные из PDF‑форм. Также разбирайте любую требуемую информацию из документов с помощью пользовательских шаблонов.

Настройка результатов

Node.js API позволяет получать данные в различных форматах, таких как необработанный, структурированный, HTML или Markdown. Кроме того, API предоставляет функцию поиска для нахождения конкретных слов или фраз в тексте документов.

Независимость от платформы

GroupDocs.Parser for Node.js via Java поддерживает следующие операционные системы, фреймворки и менеджеры пакетов

Windows
macOS
Linux
NPM
Amazon
Docker
Azure
VS Code
IntelliJ

Поддерживаемые форматы файлов

GroupDocs.Parser for Node.js via Java поддерживает работу со следующими форматами файлов.

Форматы Microsoft Office

  • Word: DOCX, DOC, DOCM, DOT, DOTX, DOTM, RTF
  • Excel: XLSX, XLS, XLSM, XLSB, XLTM, XLT, XLTM, XLTX, XLAM, SXC, SpreadsheetML
  • PowerPoint: PPT, PPTX, PPS, PPSX, PPSM, POT, POTM, POTX, PPTM

Изображения и другие форматы

  • Переносимый: PDF
  • Изображения: JPG, BMP, PNG, TIFF, GIF
  • Другие офисные форматы: ODT, OTT, OTS, ODS, ODP, OTP, ODG

Другие форматы

  • Веб: HTML, MHTML
  • Архивы: ZIP, TAR, 7Z
  • Электронные книги: CHM, EPUB, FB2, MOBI

GroupDocs.Parser for Node.js via Java особенности

Извлекайте данные из PDF, офисных документов, изображений и других форматов быстро и точно с помощью нашего Node.js Document Parser SDK

Feature icon

Извлечение текста

Извлекайте текстовую информацию из различных форматов файлов, таких как офисные документы, PDF‑файлы и изображения, для удобного чтения и анализа.

Feature icon

Извлечение изображений

Получайте визуальное содержимое из разных источников, таких как офисные документы и PDF‑файлы, для удобного доступа и использования.

Feature icon

Сканирование QR‑кодов

Обнаруживайте и декодируйте QR‑коды, присутствующие в офисных документах, PDF‑файлах или визуальном контенте, для эффективного получения информации.

Feature icon

Извлечение данных из вложений электронной почты и архивов

Собирайте ценную информацию из электронных сообщений, вложений файлов и сжатых источников данных для эффективного анализа и использования.

Feature icon

Извлечение таблиц

Определяйте и извлекайте табличные данные из PDF‑документов для организованного анализа и использования.

Feature icon

Извлечение гиперссылок

Находите и извлекайте гиперссылки и адреса электронной почты в офисных документах или PDF‑файлах для удобного доступа.

Feature icon

Разбор PDF-форм

PDF-формы — это цифровые документы с заполняемыми полями для взаимодействия пользователя, позволяющие вводить информацию в электронном виде. API Node.js можно использовать для извлечения данных из этих форм для эффективной обработки.

Feature icon

Разбор данных с помощью шаблонов

Создайте пользовательские шаблоны и используйте их с API Node.js для разбора конкретной информации из PDF‑файлов, упрощая процессы извлечения данных.

Feature icon

Поиск текста в документах

Быстро находите конкретные слова или шаблоны в документах.

Примеры кода

Помимо базового извлечения текста, представлены наиболее распространённые сценарии быстрого извлечения текста, изображений и метаданных.

Поиск текста в документе

В этом примере показано, как искать слово в PDF‑документе и выводить страницу и позицию каждого найденного совпадения.

Поиск текста в документе на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Загрузить документ
const parser = new groupdocs.Parser("sample.pdf");

// Искать слово постранично
const options = new groupdocs.SearchOptions(false, false, false, true);
const results = parser.search("Lorem", options);

// Вывести номер страницы, позицию и текст каждого совпадения
const it = results.iterator();
while (it.hasNext()) {
    const result = it.next();
    console.log(`Page ${result.getPageIndex()}, position ${result.getPosition()}: ${result.getText()}`);
}

parser.close();

Извлечение изображений из документа

В этом примере показано, как извлекать изображения из PDF‑документа и сохранять их в виде файлов PNG.

Извлечение изображений из документа на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Загрузить документ
const parser = new groupdocs.Parser("images.pdf");

// Извлечь изображения из документа
const images = parser.getImages();

// Сохранить изображения как файлы PNG
const options = new groupdocs.ImageOptions(groupdocs.ImageFormat.Png);
let index = 1;
const it = images.iterator();
while (it.hasNext()) {
    it.next().save(`image_${index++}.png`, options);
}

parser.close();

Извлечение метаданных из документа

В этом примере показано, как извлекать метаданные из PDF‑документа и выводить их.

Извлечение метаданных из документа на JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// Загрузить документ
const parser = new groupdocs.Parser("sample.pdf");

// Извлечь метаданные из документа
const metadata = parser.getMetadata();

// Вывести метаданные
const it = metadata.iterator();
while (it.hasNext()) {
    const item = it.next();
    console.log(`${item.getName()}: ${item.getValue()}`);
}

parser.close();

Готовы начать?

Загрузите GroupDocs.Parser бесплатно или получите пробную лицензию для полного доступа!

Полезные ресурсы

Изучите документацию, примеры кода и раздел поддержки, чтобы улучшить ваш опыт.

Советы по временной лицензии

1
Зарегистрируйтесь, используя ваш рабочий e-mail адрес. Бесплатные почтовые сервисы запрещены.
2
Используйте кнопку Получить временную лицензию на втором шаге.
✕
 Русский