GroupDocs.Parser อย่างคร่าวๆ

Document Parser SDK สำหรับการแยกเอกสารความแม่นยำสูงในแอปพลิเคชัน Node.js

Illustration parser

ดึงข้อมูลจากเอกสาร

GroupDocs.Parser for Node.js via Java API ช่วยให้คุณดึงข้อความ, metadata และรูปภาพจากหลายรูปแบบไฟล์ เช่น เอกสาร Office, อีเมล, ไฟล์แนบและไฟล์เก็บข้อมูล. เครื่องมือที่มีประสิทธิภาพนี้ช่วยให้คุณเข้าถึงและประมวลผลข้อมูลสำคัญที่อยู่ในไฟล์เหล่านี้ได้อย่างมีประสิทธิภาพสำหรับการประยุกต์ใช้งานต่างๆ เช่น การวิเคราะห์ข้อมูล, การทำดัชนีเครื่องมือค้นหา หรือระบบจัดการเนื้อหา.

แยกเอกสาร

ดึงองค์ประกอบต่างๆ เช่น ลิงก์, ตาราง, QR โค้ด, บาร์โค้ด และข้อมูลจากแบบฟอร์ม PDF. นอกจากนี้ยังสามารถแยกข้อมูลที่ต้องการจากเอกสารโดยใช้เทมเพลตที่กำหนดเอง.

ปรับแต่งผลลัพธ์

Node.js API ช่วยให้คุณดึงข้อมูลในรูปแบบต่างๆ เช่น raw, structured, HTML หรือ Markdown. นอกจากนี้ API ยังมีฟังก์ชันการค้นหาเพื่อหาคำหรือวลีเฉพาะในข้อความของเอกสาร.

ความเป็นอิสระของแพลตฟอร์ม

GroupDocs.Parser for Node.js via Java รองรับระบบปฏิบัติการ, เฟรมเวิร์กและผู้จัดการแพคเกจต่อไปนี้

Windows
macOS
Linux
NPM
Amazon
Docker
Azure
VS Code
IntelliJ

รูปแบบไฟล์ที่รองรับ

GroupDocs.Parser for Node.js via Java รองรับการทำงานกับ รูปแบบไฟล์ ต่อไปนี้

รูปแบบ Microsoft Office

  • Word: DOCX, DOC, DOCM, DOT, DOTX, DOTM, RTF
  • Excel: XLSX, XLS, XLSM, XLSB, XLTM, XLT, XLTM, XLTX, XLAM, SXC, SpreadsheetML
  • PowerPoint: PPT, PPTX, PPS, PPSX, PPSM, POT, POTM, POTX, PPTM

รูปภาพและรูปแบบอื่น ๆ

  • พกพา: PDF
  • รูปภาพ: JPG, BMP, PNG, TIFF, GIF
  • รูปแบบ Office อื่น ๆ: ODT, OTT, OTS, ODS, ODP, OTP, ODG

รูปแบบอื่น ๆ

  • เว็บ: HTML, MHTML
  • ไฟล์เก็บข้อมูล: ZIP, TAR, 7Z
  • อีบุ๊ค: CHM, EPUB, FB2, MOBI

คุณสมบัติของ GroupDocs.Parser for Node.js via Java

ดึงข้อมูลจาก PDF, เอกสาร Office, รูปภาพและรูปแบบอื่นๆ อย่างรวดเร็วและแม่นยำด้วย Node.js Document Parser SDK ของเรา

Feature icon

ดึงข้อความ

ดึงข้อมูลข้อความจากไฟล์รูปแบบต่างๆ เช่น เอกสาร Office, ไฟล์ PDF และรูปภาพ เพื่อการอ่านและวิเคราะห์ที่ง่ายขึ้น.

Feature icon

ดึงรูปภาพ

ดึงเนื้อหาภาพจากแหล่งต่างๆ เช่น เอกสาร Office, ไฟล์ PDF เพื่อการเข้าถึงและใช้งานที่สะดวก.

Feature icon

สแกน QR Code

ตรวจจับและถอดรหัส QR Code ที่อยู่ในเอกสาร Office, ไฟล์ PDF หรือเนื้อหาภาพสำหรับการดึงข้อมูลอย่างมีประสิทธิภาพ.

Feature icon

ดึงข้อมูลจากไฟล์แนบอีเมลและไฟล์บีบอัด

รวบรวมข้อมูลที่มีคุณค่าจากอีเมล, ไฟล์แนบและแหล่งข้อมูลที่บีบอัดเพื่อการวิเคราะห์และใช้งานที่มีประสิทธิภาพ.

Feature icon

ดึงตาราง

ระบุและดึงข้อมูลตารางจากเอกสาร PDF เพื่อการวิเคราะห์และใช้งานที่เป็นระเบียบ.

Feature icon

ดึงลิงก์

ค้นหาและดึงลิงก์และอีเมลล์ในเอกสาร Office หรือไฟล์ PDF เพื่อการเข้าถึงที่มีประสิทธิภาพ.

Feature icon

แยกแบบฟอร์ม PDF

แบบฟอร์ม PDF คือเอกสารดิจิทัลที่มีฟิลด์ให้กรอกสำหรับการโต้ตอบของผู้ใช้ ทำให้ผู้ใช้สามารถป้อนข้อมูลได้แบบอิเล็กทรอนิกส์ สามารถใช้ Node.js API เพื่อดึงข้อมูลจากแบบฟอร์มเหล่านี้เพื่อการประมวลผลที่มีประสิทธิภาพ

Feature icon

แยกข้อมูลด้วยเทมเพลต

สร้างเทมเพลตแบบกำหนดเองและใช้กับ Node.js API เพื่อแยกข้อมูลเฉพาะจากไฟล์ PDF ทำให้กระบวนการดึงข้อมูลง่ายขึ้น

Feature icon

ค้นหาข้อความในเอกสาร

ค้นหาคำหรือรูปแบบที่ต้องการในเอกสารได้อย่างรวดเร็ว

ตัวอย่างโค้ด

นอกเหนือจากการแยกข้อความพื้นฐาน ต่อไปนี้คือกรณีการใช้งานที่พบบ่อยสำหรับการแยกข้อความ, รูปภาพและเมตาดาต้าอย่างรวดเร็ว

ค้นหาข้อความในเอกสาร

ตัวอย่างนี้แสดงวิธีการค้นหาคำในเอกสาร PDF และพิมพ์หมายเลขหน้าและตำแหน่งของแต่ละผลลัพธ์

ค้นหาข้อความในเอกสารด้วย JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// โหลดเอกสาร
const parser = new groupdocs.Parser("sample.pdf");

// ค้นหาคำทีละหน้า
const options = new groupdocs.SearchOptions(false, false, false, true);
const results = parser.search("Lorem", options);

// พิมพ์ดัชนีหน้า, ตำแหน่งและข้อความของแต่ละผลลัพธ์
const it = results.iterator();
while (it.hasNext()) {
    const result = it.next();
    console.log(`Page ${result.getPageIndex()}, position ${result.getPosition()}: ${result.getText()}`);
}

parser.close();

แยกรูปภาพจากเอกสาร

ตัวอย่างนี้แสดงวิธีการแยกรูปภาพจากเอกสาร PDF และบันทึกเป็นไฟล์ PNG

แยกรูปภาพจากเอกสารด้วย JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// โหลดเอกสาร
const parser = new groupdocs.Parser("images.pdf");

// แยกรูปภาพจากเอกสาร
const images = parser.getImages();

// บันทึกรูปเป็นไฟล์ PNG
const options = new groupdocs.ImageOptions(groupdocs.ImageFormat.Png);
let index = 1;
const it = images.iterator();
while (it.hasNext()) {
    it.next().save(`image_${index++}.png`, options);
}

parser.close();

แยกเมตาดาต้าจากเอกสาร

ตัวอย่างนี้แสดงวิธีการแยกเมตาดาต้าจากเอกสาร PDF และพิมพ์ข้อมูลออก

แยกเมตาดาต้าจากเอกสารด้วย JavaScript

const groupdocs = require('@groupdocs/groupdocs.parser');

// โหลดเอกสาร
const parser = new groupdocs.Parser("sample.pdf");

// แยกเมตาดาต้าจากเอกสาร
const metadata = parser.getMetadata();

// พิมพ์เมตาดาต้า
const it = metadata.iterator();
while (it.hasNext()) {
    const item = it.next();
    console.log(`${item.getName()}: ${item.getValue()}`);
}

parser.close();

พร้อมที่จะเริ่มต้นหรือยัง?

ดาวน์โหลด GroupDocs.Parser ฟรีหรือรับสิทธิ์การใช้งานแบบทดลองใช้เพื่อการเข้าถึงแบบเต็ม!

ทรัพยากรที่มีประโยชน์

สำรวจเอกสารตัวอย่างรหัสและการสนับสนุนชุมชนเพื่อปรับปรุงประสบการณ์ของคุณ

เคล็ดลับใบอนุญาตชั่วคราว

1
ลงทะเบียนด้วยอีเมลที่ทำงานของคุณ ไม่อนุญาตให้ใช้บริการอีเมลฟรี
2
ใช้ปุ่ม รับใบอนุญาตชั่วคราว ในขั้นตอนที่ 2
✕
 ไทย