AI

Baidu Rilis Unlimited-OCR, Model OCR Satu Kali Baca 40 Halaman

Baidu merilis Unlimited-OCR, model open-source yang mampu memproses dokumen 40 halaman dalam satu kali baca dengan akurasi 93%.

Oleh Tim Editorial

Baidu Rilis Unlimited-OCR, Model OCR Satu Kali Baca 40 Halaman
images.indianexpress.com

Baidu baru saja merilis Unlimited OCR, sebuah model optical character recognition (OCR) open source yang mampu membaca dokumen hingga 40 halaman dalam satu kali proses. Model ini memiliki 3 miliar parameter, namun hanya 500 juta yang aktif saat inferensi, dan berjalan sepenuhnya secara lokal di perangkat pengguna. Menurut repositori GitHub resmi Baidu, Unlimited OCR dirancang untuk mengatasi masalah utama OCR tradisional yang memotong dokumen halaman per halaman. Akibat pemotongan tersebut, tabel yang membentang dua halaman sering rusak, urutan bacaan hilang, dan konteks antar halaman tidak tersambung. Unlimited OCR memproses seluruh dokumen sekaligus dengan jendela konteks 32K, sehingga teks, formula, tabel, dan urutan bacaan tetap terjaga lintas halaman. Akun X @VaibhavSisinty melaporkan bahwa model ini mencapai akurasi 93% pada tolok ukur standar, unggul 6 poin persentase dibandingkan baseline.

Tingkat kesalahan tetap di bawah 0,11 bahkan setelah 40 halaman. Model ini juga mendukung multibahasa secara bawaan. Output yang dihasilkan berupa Markdown terstruktur yang bersih. Di platform Hugging Face, Unlimited OCR telah diunduh 2,12 juta kali dalam sebulan terakhir, menurut data dari akun X @VaibhavSisinty. Sementara itu, repositori GitHub Baidu untuk proyek ini telah mengumpulkan 14.600 bintang. Angka ini menunjukkan minat yang signifikan dari komunitas pengembang terhadap model OCR open source ini. Perbandingan dengan layanan OCR komersial menunjukkan keunggulan biaya yang jelas. Amazon Textract, Google Cloud Vision, dan Azure Document Intelligence semuanya mengenakan biaya per halaman. Unlimited OCR, sebaliknya, berjalan secara lokal dan gratis. Ini menjadikannya alternatif yang menarik bagi perusahaan atau individu yang memproses dokumen dalam volume besar.

Repositori GitHub Baidu untuk Unlimited OCR menyebut proyek ini sebagai "Unlimited OCR Works: Welcome the Era of One shot Long horizon Parsing." Frasa ini menekankan kemampuan model untuk melakukan parsing dokumen panjang dalam satu langkah, sebuah pendekatan yang berbeda dari metode sekuensial tradisional. Model ini dilisensikan di bawah MIT, yang berarti pengguna dapat dengan bebas menggunakan, memodifikasi, dan mendistribusikannya. Lisensi ini memudahkan adopsi oleh pengembang dan perusahaan yang ingin mengintegrasikan OCR ke dalam aplikasi mereka tanpa khawatir tentang biaya lisensi. Dari sisi teknis, kemampuan Unlimited OCR untuk memproses dokumen 40 halaman dalam satu kali baca didukung oleh jendela konteks 32K. Ini memungkinkan model untuk mempertahankan konteks antar halaman, sesuatu yang sulit dicapai oleh model OCR tradisional yang memproses halaman satu per satu.

Meskipun klaim tentang parameter dan akurasi berasal dari akun X @VaibhavSisinty, repositori GitHub resmi Baidu mengonfirmasi keberadaan model dan kemampuannya untuk parsing dokumen panjang. Namun, detail spesifik seperti jumlah parameter dan skor akurasi belum dikonfirmasi secara independen oleh Baidu melalui rilis pers resmi. Unlimited OCR menawarkan potensi besar untuk berbagai aplikasi, termasuk digitalisasi dokumen, pengarsipan, analisis kontrak, dan pemrosesan formulir. Dengan kemampuan berjalan secara lokal, model ini juga memberikan keuntungan dalam hal privasi data, karena dokumen tidak perlu dikirim ke server eksternal untuk diproses. Ke depannya, adopsi Unlimited OCR akan bergantung pada kemudahan penggunaan, dokumentasi, dan dukungan komunitas. Dengan lisensi MIT dan popularitas awal yang tinggi di Hugging Face dan GitHub, model ini memiliki fondasi yang kuat untuk berkembang.

Namun, validasi independen terhadap klaim kinerja masih diperlukan untuk meyakinkan pengguna korporat.

Sumber dan referensi