نرمالسازی پژوهشی متن فارسی و عربی
وضعیت بازتولیدپذیری
این ابزار یک ابزار بومی یا کمکی IDHR است و ادعای بازسازی کامل یک مقاله مشخص را ندارد.
پیادهسازی شده
- NFKC
- پروفایلهای orthographic اعلامشده
- ممیزی codepoint
- Research Manifest
پیادهسازی نشده / محدودیت
- هیچ normalization ویرایشیِ تاریخیِ منتشرنشده حدس زده نمیشود
بررسی واوهای متصل در Microsoft Word
- فایل DOCX نرمالشده را باز کنید.
- کلیدهای Ctrl + H را بزنید.
- روی More کلیک و گزینه Use wildcards را فعال کنید.
- عبارت زیر را در قسمت Find what وارد کنید:
<و[! ]@>
برای بررسی موردبهمورد از Find Next و برای مشخصکردن همه موارد از Reading Highlight → Highlight All استفاده کنید.
«وقال» ممکن است نیازمند جداسازی باشد، اما «واحد»، «وارث» و «واقع» نباید جدا شوند. تصمیم نهایی با بررسی انسانی است.
پس از اصلاح انسانی، فایل باید بهصورت TXT با UTF-8 ذخیره شود و میتواند در صفحه مشابهتیابی استفاده شود.
نرمالسازی متن برای پژوهشهای علوم انسانی
در پژوهشهای متنمحور، تفاوتهای ناشی از دیجیتالیسازی مانند «ي/ی»، «ك/ک»، presentation formهای عربی، اعراب، فاصلههای نامرئی و سرصفحههای تکراری میتوانند مقایسه ماشینی را منحرف کنند. این نرمالساز تفاوتهای انتخابشده را با قواعد ثبتشده یکسان میکند تا مرحلههای بعدی تحلیل قابل مقایسهتر باشند.
خروجی نرمالسازی جایگزین نسخه اصلی منبع نیست. برای پژوهش قابل بازتولید، پژوهشگر باید نسخه اصلی فایل را نگه دارد و در صورت استفاده از خروجی نرمالشده در مقاله، روش نرمالسازی و شماره نسخه IDHR را ثبت کند.
چه زمانی جداسازی واو مناسب است؟
این گزینه برای بعضی متون عربی یا OCRشده مفید است، اما در فارسی ممکن است واژههای واقعیِ آغازشده با «و» را اشتباه بشکند. به همین دلیل پیشفرض خاموش است و فهرست استثناها قابل ویرایش باقی میماند.
آیا برای مشابهتیابی باید از همین نرمالساز استفاده کرد؟
الزام فنی نیست، ولی استفاده از یک روش نرمالسازی واحد برای همه فایلهای مقایسهای باعث میشود اختلافات املایی و قالبی کمتر بهعنوان اختلاف محتوایی دیده شوند.