نرمال‌سازی پژوهشی متن فارسی و عربی

IDHR-native / not paper reproduction

وضعیت بازتولیدپذیری

این ابزار یک ابزار بومی یا کمکی IDHR است و ادعای بازسازی کامل یک مقاله مشخص را ندارد.

پیاده‌سازی شده

  • NFKC
  • پروفایل‌های orthographic اعلام‌شده
  • ممیزی codepoint
  • Research Manifest

پیاده‌سازی نشده / محدودیت

  • هیچ normalization ویرایشیِ تاریخیِ منتشرنشده حدس زده نمی‌شود

مشاهده ممیزی بازتولیدپذیری همه ابزارها و روش‌ها

این ابزار متن‌های فارسی و عربی را بر پایه پروفایل انتخابی پژوهشگر یکدست می‌کند و نسخه نرمال‌شده، ممیزی نویسه‌ها و Research Manifest را تحویل می‌دهد.
۱. فایل‌ها

محدودیت پژوهشی برای تعداد فایل وجود ندارد؛ حداکثر مجموع منابع: 100 مگابایت.

۲. متن‌های پیست‌شده

برای هر متن یک نام بنویسید؛ این نام در فایل خروجی استفاده می‌شود.

۳. پروفایل یکسان‌سازی نویسه

پروفایل ایمن، ي/ی و ك/ک را یکسان می‌کند و presentation formهای عربی را با NFKC به نویسه‌های پایه برمی‌گرداند. پروفایل «فارسی کلاسیک / خروجی نرم‌افزارهای نور» علاوه بر این موارد، ى را نیز به «ی» معیار داخلی تبدیل می‌کند. در پروفایل ایمن، ى حفظ می‌شود زیرا در عربی می‌تواند الف مقصوره واقعی باشد.

این ابزار هر نگاشت را جدا از Unicode normalization ثبت می‌کند و نویسه‌های Private Use یا گونه‌های ناشناخته را بدون قاعده مستند به‌صورت خودکار تبدیل نمی‌کند.

۴. پردازش واو عطف
۵. حذف شماره صفحه و سرصفحه

خطوط مستقل مانند ص: 45، صفحه: 87 و صورت‌های عربی حذف می‌شوند. همچنین سرصفحه‌های تکراری مانند نام کتاب — ص: 45 یا نام کتابی که کنار خط شماره صفحه تکرار شده باشد، شناسایی و حذف می‌شود.

برای جلوگیری از حذف اشتباه ارجاعات، خطی که هم نام و هم شماره صفحه دارد فقط وقتی خودکار حذف می‌شود که همان عنوان در چند صفحه تکرار شده باشد.

بررسی واوهای متصل در Microsoft Word

  1. فایل DOCX نرمال‌شده را باز کنید.
  2. کلیدهای Ctrl + H را بزنید.
  3. روی More کلیک و گزینه Use wildcards را فعال کنید.
  4. عبارت زیر را در قسمت Find what وارد کنید:
<و[! ]@>

برای بررسی موردبه‌مورد از Find Next و برای مشخص‌کردن همه موارد از Reading Highlight → Highlight All استفاده کنید.

«وقال» ممکن است نیازمند جداسازی باشد، اما «واحد»، «وارث» و «واقع» نباید جدا شوند. تصمیم نهایی با بررسی انسانی است.

پس از اصلاح انسانی، فایل باید به‌صورت TXT با UTF-8 ذخیره شود و می‌تواند در صفحه مشابهت‌یابی استفاده شود.

نرمال‌سازی متن برای پژوهش‌های علوم انسانی

در پژوهش‌های متن‌محور، تفاوت‌های ناشی از دیجیتالی‌سازی مانند «ي/ی»، «ك/ک»، presentation formهای عربی، اعراب، فاصله‌های نامرئی و سرصفحه‌های تکراری می‌توانند مقایسه ماشینی را منحرف کنند. این نرمال‌ساز تفاوت‌های انتخاب‌شده را با قواعد ثبت‌شده یکسان می‌کند تا مرحله‌های بعدی تحلیل قابل مقایسه‌تر باشند.

خروجی نرمال‌سازی جایگزین نسخه اصلی منبع نیست. برای پژوهش قابل بازتولید، پژوهشگر باید نسخه اصلی فایل را نگه دارد و در صورت استفاده از خروجی نرمال‌شده در مقاله، روش نرمال‌سازی و شماره نسخه IDHR را ثبت کند.

چه زمانی جداسازی واو مناسب است؟

این گزینه برای بعضی متون عربی یا OCRشده مفید است، اما در فارسی ممکن است واژه‌های واقعیِ آغازشده با «و» را اشتباه بشکند. به همین دلیل پیش‌فرض خاموش است و فهرست استثناها قابل ویرایش باقی می‌ماند.

آیا برای مشابهت‌یابی باید از همین نرمال‌ساز استفاده کرد؟

الزام فنی نیست، ولی استفاده از یک روش نرمال‌سازی واحد برای همه فایل‌های مقایسه‌ای باعث می‌شود اختلافات املایی و قالبی کمتر به‌عنوان اختلاف محتوایی دیده شوند.