پایگاه دادهی تحلیل چیدمان سند
پایگاه دادهی تشخیص نواحی و ساختار اسناد فارسی.

این پایگاه داده برای تحلیل چیدمان و درک ساختار اسناد فارسی طراحی شده و شامل ۵۵۹۸ تصویر از اسناد فارسی است که از منابع گوناگون گردآوری و برچسبگذاری شدهاند. در این مجموعه، نواحی مختلف هر سند مشخص شدهاند تا اجزای اصلی صفحه بهصورت مجزا قابل شناسایی باشند. این اجزا در شش دسته شامل متن، شکل، جدول، لوگو، رابطه ریاضی و سرصفحه برچسبگذاری شدهاند. بنابراین، کاربرد اصلی این پایگاه داده در ناحیهبندی صفحات، شناسایی عناصر سند، تحلیل ساختار ظاهری اسناد و پژوهشهای مرتبط با Document Layout Analysis و Document Understanding است.
معرفی یک مجموعه داده برای کاربردهای درک و ناحیه بندی تصاویر اسناد فارسی
امین فرجی، مسعود سعید، حسین نظام آبادی پور
دوره 10، شماره 2، تابستان 1402، صفحه 31-46 · 1402
به این دادهها علاقه دارید؟
برای همکاری پژوهشی یا دسترسی به جزئیات بیشتر با تیم بهنثر تماس بگیرید.
تماس با ما