استایلومتری و انتساب مؤلف · FA-AA-02-HCA

حالت پایه Source-complete subset Beta

واژه‌های دستوری فارسی گلشائی — خوشه‌بندی Delta — Beta

0 اجرای موفق ثبت‌شده در آمار دائمی

این ابزار زیرروش تک‌نگاشتیِ منبع‌محور پژوهش گلشائی را اجرا می‌کند: ۲۰ واژه دستوری منتشرشده، فراوانی نسبی و Delta کلاسیک. مقاله نوع linkage را صریحاً مشخص نمی‌کند؛ اجرای IDHR پیش‌فرض مستند stylo یعنی Ward.D را به‌صورت شفاف pin و در Manifest ثبت می‌کند. هر فایل ورودی یک نمونه مستقل است و نتیجه به‌تنهایی انتساب مؤلف را اثبات نمی‌کند.

این خروجی چه می‌گوید؟

سنجه، طبقه‌بندی یا کنترل کیفیت تعریف‌شدهٔ همین روش را روی داده‌های واردشده گزارش می‌کند.

چه چیزی را به‌تنهایی ثابت نمی‌کند؟

دامنه ادعا از نوع ابزار، corpus و کنترل‌های روش‌شناختی فراتر نمی‌رود؛ نتیجه باید همراه محدودیت‌های زیر تفسیر شود.

توضیح علمی، محدودیت‌ها و جایگاه توسعه
این ابزار زیرروش تک‌نگاشتیِ منبع‌محور پژوهش گلشائی را اجرا می‌کند: ۲۰ واژه دستوری منتشرشده، فراوانی نسبی و Delta کلاسیک. مقاله نوع linkage را صریحاً مشخص نمی‌کند؛ اجرای IDHR پیش‌فرض مستند stylo یعنی Ward.D را به‌صورت شفاف pin و در Manifest ثبت می‌کند. هر فایل ورودی یک نمونه مستقل است و نتیجه به‌تنهایی انتساب مؤلف را اثبات نمی‌کند.
توضیح علمی: IDHR executes the source-grounded monogram subset. The paper does not pin the historical stylo version; for HCA it also does not state linkage. IDHR pins a current documented engine configuration transparently and does not silently reconstruct manual/Vafa preprocessing or manual bigram/trigram filtering.
محدودیت‌ها: الگوریتم تصحیح املایی Vafa برای بازسازی کامل به اندازه کافی توصیف نشده است تمام تصمیم‌های پاک‌سازی دستی corpus به شکل الگوریتم منتشر نشده‌اند شاخه‌های bigram/trigram که دستی پالایش شده‌اند بازسازی نشده‌اند sweep خودکار نمونه‌گیری paper-faithful نیست چون سیاست کامل sampling pin نشده است نسخه تاریخی R/stylo و linkage مقاله برای HCA منتشر نشده‌اند
مقاله/مرجع: Golshaie, Ramin. (2019). Function Words as Idiolect Markers: A Corpus-based Approach to Authorship Attribution in Farsi. Language Related Research, 10(3), 293–317.

سطح بازتولیدپذیری: Source-complete subset

روش و منبع: Golshaie, Ramin. (2019). Function Words as Idiolect Markers: A Corpus-based Approach to Authorship Attribution in Farsi. Language Related Research, 10(3), 293–317.

وضعیت بازتولیدپذیری

فقط بخشی از روش مقاله اجرا می‌شود که جزئیات آن بدون حدس کامل است؛ بخش‌های دیگر مقاله عمداً اجرا نشده‌اند.

پیاده‌سازی شده

  • ۲۰ واژه دستوری تک‌واژه‌ای منتشرشده
  • فراوانی‌های نسبی
  • Delta کلاسیک
  • HCA با Ward.D که صریحاً engine-derived/stylo-default برچسب می‌خورد

پیاده‌سازی نشده / محدودیت

  • الگوریتم تصحیح املایی Vafa برای بازسازی کامل به اندازه کافی توصیف نشده است
  • تمام تصمیم‌های پاک‌سازی دستی corpus به شکل الگوریتم منتشر نشده‌اند
  • شاخه‌های bigram/trigram که دستی پالایش شده‌اند بازسازی نشده‌اند
  • sweep خودکار نمونه‌گیری paper-faithful نیست چون سیاست کامل sampling pin نشده است
  • نسخه تاریخی R/stylo و linkage مقاله برای HCA منتشر نشده‌اند

مرحله دستی یا ورودی پژوهشگر

  1. پیش از بارگذاری نام نویسنده، paratext/مواد غیرنویسنده و بخش‌های دارای نقل‌قول سنگین را با یک سیاست پژوهشی صریح پاک کنید.
  2. اگر برای replication تصحیح املایی لازم است، آن را خارج از IDHR انجام و مستند کنید؛ IDHR workflow منتشرنشده Vafa را جعل نمی‌کند.
  3. هر نمونه آماده‌شده را یک فایل TXT جدا بدهید؛ IDHR از همان نمونه‌های آماده پژوهشگر ادامه می‌دهد.

پس از انجام این مرحله، فایل/خروجی خواسته‌شده را در فرم زیر بدهید تا IDHR عملیات خودکار را ادامه دهد.

مشاهده ممیزی بازتولیدپذیری همه روش‌ها

دامنه بازسازی: این ابزار شاخه تک‌واژه‌ایِ قابل‌بازتولید پژوهش Golshaie را اجرا می‌کند. فهرست ویژگی‌ها ثابت و شامل ۲۰ واژه دستوری منتشرشده است؛ IDHR فهرست را از corpus تازه استخراج یا با واژه‌های دیگری جایگزین نمی‌کند.

این ابزار دست‌کم ۲ فایل TXT با UTF-8 می‌پذیرد، محدودیت پژوهشی برای تعداد فایل ندارد و هر فایل را یک نمونه مستقل در نظر می‌گیرد. حداکثر مجموع فایل‌ها 100 مگابایت است.

۲۰ واژه ثابت: و، به، در، از، که، را، این، با، آن، خود، یا، برای، یک، هم، بر، اما، نیز، هر، تا، دیگر.

پیش‌پردازش ثابت این روش: NFKC و یکسان‌سازی اختلاف‌های دیجیتالی ی/ک و یِ legacy انجام می‌شود؛ «آ/أ/إ» حفظ می‌شوند. این پروفایل برای جلوگیری از تبدیل ناخواسته واژه‌ای مانند «آن» از پروفایل عمومی فارسی/نور جدا شده است.

پژوهش اصلی پاک‌سازی دستی و استانداردسازی/غلط‌یابی با Vafa را گزارش می‌کند. IDHR غلط‌یابی املایی یا فهرست دستی bigram/trigram را که در مقاله به‌صورت الگوریتم کامل منتشر نشده است حدس نمی‌زند. اندازه‌های نمونه گزارش‌شده در مقاله نیز آستانه عمومی برای فارسی کلاسیک محسوب نمی‌شوند؛ بنابراین این صفحه قطعه‌بندی خودکار انجام نمی‌دهد.

corpus پژوهش اصلی معاصر است. این ابزار روش منتشرشده را بازسازی می‌کند، اما اعتبار آن برای فارسی کلاسیک باید جداگانه روی corpus کلاسیک سنجیده شود.

شفافیت بازتولید: مقاله نوع linkage خوشه‌بندی و نسخه تاریخی stylo را pin نکرده است. IDHR برای اجرای HCA از پیش‌فرض مستند stylo یعنی Ward.D استفاده می‌کند و این پارامتر را با منشأ engine-derived / stylo-default در Research Manifest ثبت می‌کند؛ این اجرا ادعای بازتولید bitwise نسخه تاریخی مقاله ندارد.

پس از ثبت Job می‌توانید مرورگر را ببندید؛ پردازش روی سرور ادامه می‌یابد. پس از پایان، 168 ساعت فرصت دانلود دارید. پایان موفق یا شکست تحلیل همراه با لینک امن ایمیل می‌شود و خطای ایمیل وضعیت تحلیل را تغییر نمی‌دهد.

نحوه تفسیر

این ابزار نتیجه را همراه پارامترها، نسخه موتور علمیِ همان روش، نرمال‌سازی نویسه‌ای و SHA-256 ورودی‌ها در Research Manifest ثبت می‌کند. تغییر پارامترها باید به‌عنوان اجرای پژوهشی جداگانه در نظر گرفته شود.