ARTIKEL•PERBANDINGAN SOFTWARE 2+

Marker vs AnyDoc, Dua Pendekatan Berbeda untuk Konversi Dokumen ke Markdown

11 September 2026•
Image for Marker vs AnyDoc, Dua Pendekatan Berbeda untuk Konversi Dokumen ke Markdown

Konversi dokumen ke Markdown kini menjadi fondasi penting untuk RAG, agen AI, dan pencarian semantik. Dua tool open source yang paling sering dibahas untuk kebutuhan ini adalah Marker dari Datalab dan AnyDoc dari Firecrawl. Keduanya gratis dan sama-sama menghasilkan Markdown yang bersih, namun lahir dari filosofi yang jauh berbeda.

Marker adalah pipeline Python berbasis Vision-Language Model atau VLM yang fokus pada PDF dengan layout kompleks dan akurasi tinggi. AnyDoc adalah library Rust tanpa model AI sama sekali yang dibuat untuk kecepatan ekstrem dan cakupan format yang luas. Jadi pilihannya tergantung jenis dokumen Anda.

Ringkasan Cepat

AspekMarkerAnyDoc
Bahasa intiPythonRust dengan binding Node.js, Python, dan WASM
PendekatanVLM Surya plus heuristik CPUParser murni tanpa ML
Format didukungPDF, gambar, PPTX, DOCX, XLSX, HTML, dan EPUBDOC, DOCX, PPT, PPTX, XLS, XLSX, ODT, ODS, ODP, RTF, EPUB, CSV, dan PDF
KecepatanSekitar 2,9 halaman per detik pada mode balanced di GPU B200Median sekitar 4,4 milidetik per dokumen
Kebutuhan GPUDirekomendasikan untuk mode akurasi tinggiTidak perlu sama sekali
OCR untuk PDF hasil scanYa lewat VLM SuryaTidak secara lokal, hanya PDF berbasis teks
LisensiApache 2.0 untuk kode dan Open RAIL-M untuk modelMIT

Angka di atas berasal dari README masing-masing repositori per September 2026. Masing-masing proyek menjalankan benchmarknya sendiri, jadi angka-angka ini ada bias framingnya. Marker diukur dengan olmocr-bench pihak ketiga, sedangkan AnyDoc diukur dengan benchmark internal berbasis penilaian LLM terhadap 100 dokumen nyata.

Pendekatan dan Cara Kerja

Marker dibangun di atas Surya, yaitu VLM untuk dokumen yang dijalankan lewat server inferensi lokal. Alurnya dimulai dengan ekstraksi teks memakai pdftext sesuai urutan baca PDF, lalu deteksi layout halaman, kemudian penentuan apakah teks yang tertanam masih layak pakai atau harus di-OCR ulang. Pada mode balanced, deteksi layout memakai VLM sehingga hasilnya lebih teliti namun butuh GPU. Pada mode fast, deteksi layout memakai model ringan rf-detr di CPU dan VLM hanya dipanggil untuk persamaan, blok yang rusak, atau halaman yang terdeteksi sebagai hasil scan. Tabel direkonstruksi dari lapisan teks PDF dengan heuristik CPU, lalu fallback ke VLM jika tingkat kepercayaannya rendah.

AnyDoc menempuh jalan yang berlawanan. Setiap format punya parser sendiri yang memetakan dokumen ke satu model dokumen bersama, lalu satu serializer menrender semuanya menjadi GitHub-Flavored Markdown. Tabel, heading, footnote, daftar bernomor, dan escaping pun berperilaku sama walau inputnya beda, mulai dari file .doc lama sampai .pptx baru. Untuk PDF, AnyDoc memakai pdf-inspector secara lokal tanpa layanan eksternal, dan persamaan OMML dari Word dan PowerPoint serta MathML dari OpenDocument dan EPUB diubah menjadi LaTeX memakai $ inline dan $$ blok. Pendekatan selektif Marker membuatnya lebih cepat dibanding VLM full-page, namun tetap jauh lebih berat dibanding parser non-AI seperti AnyDoc.

Akurasi dan Kualitas Output

Untuk PDF sulit, Marker dirancang khusus menangani tabel, rumus matematika, layout multi-kolom, dan dokumen hasil scan. Pada olmocr-bench dengan 1.403 PDF, mode balanced mencetak skor keseluruhan 76,0 persen dan 83,5 persen untuk PDF born-digital, mengungguli MinerU dan Docling pada perbandingan pipeline yang setara.

AnyDoc diukur dengan cara yang berbeda. Benchmark internalnya memakai 100 dokumen nyata, dengan Claude Sonnet 5 sebagai penilai yang membandingkan output terhadap render LibreOffice. AnyDoc meraih skor 81 dan unggul di setiap format dibanding LibreOffice, Unstructured, MarkItDown, Pandoc, Docling, dan Mammoth, dengan skor per format di kisaran 72 sampai 88. Kedua angka ini tidak bisa dibandingkan langsung karena mengukur hal yang berbeda, satu untuk PDF ilmiah yang berat dan satu untuk dokumen kantor campuran.

Marker lebih fleksibel untuk RAG karena selain Markdown ia menghasilkan JSON berupa pohon struktur lengkap dengan bounding box, HTML, dan format chunks yang datar. Gambar, tabel, persamaan LaTeX, blok kode, footnote, dan daftar isi ikut terbawa. Flag --use_llm menyambungkan Marker ke model seperti Gemini, Claude, OpenAI, atau model lokal lewat Ollama sehingga tabel lintas halaman tergabung, rumus inline menjadi rapi, dan nilai form ikut terekstrak. AnyDoc tidak punya jalur semacam itu. Semua konversinya deterministik berdasarkan parser, sehingga tabel rusak atau rumus yang hilang tidak bisa diperbaiki seperti mode hybrid Marker. Untuk multi-kolom rumit, rumus matematika inline di PDF, dan form bersarang, AnyDoc kalah dari pendekatan visual Marker.

Kecepatan dan Kebutuhan Komputasi

AnyDoc murni Rust tanpa model ML atau layanan eksternal sehingga median waktu konversinya di bawah 5 milidetik per dokumen. Pipeline yang memproses ribuan file kantor setiap hari cocok memakai jalur ini. Marker pada satu host B200 hanya mencapai throughput steady-state sekitar 2,9 halaman per detik pada mode balanced dan sekitar 7,4 halaman per detik pada mode fast, sedangkan mode tanpa OCR mencapai sekitar 23,7 halaman per detik tanpa kemampuan membaca persamaan dan hasil scan.

Mode akurasi terbaik Marker idealnya butuh GPU NVIDIA dengan Docker dan NVIDIA Container Toolkit, sedangkan di CPU atau Apple Silicon server inferensi berjalan lewat llama-server dari llama.cpp sehingga kecepatannya turun drastis. Kebutuhan minimalnya Python 3.10 plus PyTorch, backend vLLM atau llama.cpp, serta variabel seperti SURYA_INFERENCE_URL dan SURYA_INFERENCE_BACKEND jika memakai server yang sudah berjalan. AnyDoc sebaliknya berjalan tanpa GPU dan tanpa server Python, konversi di Node.js berjalan di thread pool libuv sehingga event loop tidak tersumbat, dan versi WASM memungkinkan konversi langsung di perangkat pengguna.

Cakupan Format dan Deteksi File

AnyDoc menjadi satu-satunya tool dalam benchmark internalnya yang mencakup 14 dari 14 format yang diuji, meliputi Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, dan PDF, termasuk varian lama seperti .doc, .ppt, dan .xls serta varian modern seperti .xlsb dan .docm. Deteksi format dibaca dari isi file, bukan dari ekstensi, mulai dari header PDF, grup pembuka RTF, nama stream OLE, sampai mimetype paket ZIP. Hanya CSV yang butuh nama eksplisit karena memang tidak punya penanda biner, sehingga arsip dengan penamaan berantakan tetap terbaca.

Marker mendukung PDF, gambar, PPTX, DOCX, XLSX, HTML, dan EPUB, namun fokus pengembangannya tetap PDF. Untuk volume besar dokumen kantor campuran, cakupannya tidak seluas AnyDoc.

Kemampuan Membaca Dokumen Hasil Scan

Marker punya jalur OCR penuh lewat VLM Surya sehingga PDF hasil scan, foto dokumen, dan arsip lama tetap bisa diproses. Skornya bertahan pada kategori arsip lama dalam olmocr-bench, sementara mode tanpa OCR anjlok ke nol pada kategori matematika hasil scan.

AnyDoc tidak bisa melakukan ini karena hanya mengandalkan lapisan teks PDF. PDF hasil scan atau halaman berbasis gambar gagal dengan error NeedsOcr. Opsi --ocr hosted mengirim dokumen ke Firecrawl Parse berbayar, sehingga data keluar dari mesin lokal. Untuk arsip born-digital, keterbatasan ini tidak terasa. Untuk tumpukan scan, inilah penentu pilihan.

Instalasi Distribusi dan Lisensi

Standarnya memakai pip install marker-pdf dengan perintah marker_single untuk satu file atau marker untuk satu folder. Datalab mendukungnya dengan API terkelola, layanan batch yang diklaim memproses lebih dari 1 miliar halaman per minggu, serta opsi on-prem untuk kebutuhan privasi. Model Chandra yang terkelola diposisikan sebagai tingkat akurasi di atas Marker.

Tersedia sebagai CLI lewat npx @firecrawl/anydoc, library Rust, binding Node.js dan Python, bahkan WebAssembly yang jalan langsung di browser. Ada halaman demo yang memproses file secara lokal sehingga file tidak perlu dikirim ke server. Cukup jalankan npx skills add firecrawl/anydoc agar agen coding seperti Claude Code dan Cursor bisa membaca dokumen apa pun yang ditemui, dan karena itu AnyDoc cepat populer di alur kerja agen AI.

Soal lisensi, kode Marker berlisensi Apache 2.0 yang bebas untuk komersial, tetapi bobot model memakai lisensi Open RAIL-M yang membatasi pemakaian komersial di atas ambang pendanaan atau pendapatan 5 juta dolar AS. Tim komersial besar perlu membaca halaman pricing Datalab dengan teliti. AnyDoc berlisensi MIT tanpa ambang pendapatan, beda dengan lisensi model Marker yang ada batasnya.

Mana yang Sebaiknya Dipilih

Keduanya optimal untuk skenario yang berbeda.

Pilih Marker jika kondisi Anda seperti berikut.

  • Dokumen Anda banyak berupa PDF hasil scan, foto, atau arsip lama
  • Anda memproses jurnal ilmiah dengan rumus matematika dan tabel kompleks lintas halaman
  • Anda butuh output JSON dengan bounding box atau chunks siap RAG
  • Anda bersedia menyediakan GPU dan setup Python yang lebih rumit demi akurasi maksimal

Pilih AnyDoc jika kondisi Anda seperti berikut.

  • Anda memproses volume besar dokumen kantor seperti Word, Excel, PowerPoint, ODF, RTF, dan CSV
  • Dokumen Anda sebagian besar born-digital dan berbasis teks
  • Anda butuh kecepatan sangat tinggi tanpa server GPU
  • Anda ingin konversi di browser atau edge tanpa mengirim file ke server
  • Anda butuh solusi ringan untuk pipeline agen tanpa ketergantungan model AI

Banyak tim memakai keduanya secara komplementer. AnyDoc dipakai sebagai jalur cepat default untuk dokumen office dan PDF sederhana, sedangkan Marker dipakai sebagai fallback khusus untuk PDF hasil scan atau berlayout rumit.

Kesimpulan

Untuk arsip campuran, mulailah dari AnyDoc karena murah dan cepat. Arahkan file yang gagal atau hasilnya buruk ke Marker. File mudah beres dalam milidetik, file sulit tetap terbaca.