استایلومتری و انتساب مؤلف · LI-XTOPIC-01

حالت پایه Full paper/method-faithful

Text Distortion برای کاهش اثر موضوع

0 اجرای موفق ثبت‌شده در آمار دائمی

این ابزار الگوریتم‌های DV-MA و DV-SA را مطابق روش Stamatatos روی متن اجرا می‌کند تا بخش بزرگی از واژگان محتوایی پوشانده شود و اثر موضوع در تحلیل مؤلف کاهش یابد. این ابزار خودش انتساب مؤلف انجام نمی‌دهد و برای ساخت Wk به فهرست بسامدیِ مستقلِ زبان نیاز دارد.

این خروجی چه می‌گوید؟

سنجه، طبقه‌بندی یا کنترل کیفیت تعریف‌شدهٔ همین روش را روی داده‌های واردشده گزارش می‌کند.

چه چیزی را به‌تنهایی ثابت نمی‌کند؟

دامنه ادعا از نوع ابزار، corpus و کنترل‌های روش‌شناختی فراتر نمی‌رود؛ نتیجه باید همراه محدودیت‌های زیر تفسیر شود.

توضیح علمی، محدودیت‌ها و جایگاه توسعه
این ابزار الگوریتم‌های DV-MA و DV-SA را مطابق روش Stamatatos روی متن اجرا می‌کند تا بخش بزرگی از واژگان محتوایی پوشانده شود و اثر موضوع در تحلیل مؤلف کاهش یابد. این ابزار خودش انتساب مؤلف انجام نمی‌دهد و برای ساخت Wk به فهرست بسامدیِ مستقلِ زبان نیاز دارد.
توضیح علمی: IDHR requires a researcher-supplied ranked language-frequency list instead of deriving Wk from the case corpus; the publication defines Wk as the k most frequent words of the language.
محدودیت‌ها: IDHR فهرست Wk زبان را از corpus مورد مناقشه استخراج نمی‌کند این ابزار پیش‌پردازش هیچ امتیاز downstream انتساب مؤلف اختراع نمی‌کند
مقاله/مرجع: Stamatatos, Efstathios. (2017). Authorship Attribution Using Text Distortion. Proceedings of EACL 2017, 1138–1149.

سطح بازتولیدپذیری: Full paper/method-faithful

روش و منبع: Stamatatos, Efstathios. (2017). Authorship Attribution Using Text Distortion. Proceedings of EACL 2017, 1138–1149. · DOI: 10.18653/v1/E17-1107

وضعیت بازتولیدپذیری

اجزای مؤثر روش که برای اجرای علمی لازم‌اند از منبع منتشرشده پیاده شده‌اند؛ این برچسب لزوماً به معنی بازسازی بیت‌به‌بیت محیط تاریخی نرم‌افزار نیست.

پیاده‌سازی شده

  • تبدیل‌های منتشرشده DV-MA و DV-SA
  • شبکه k منتشرشده
  • فهرست بسامدی مستقل و رتبه‌بندی‌شده زبان Wk که پژوهشگر می‌دهد

پیاده‌سازی نشده / محدودیت

  • IDHR فهرست Wk زبان را از corpus مورد مناقشه استخراج نمی‌کند
  • این ابزار پیش‌پردازش هیچ امتیاز downstream انتساب مؤلف اختراع نمی‌کند

مرحله دستی یا ورودی پژوهشگر

  1. یک فهرست بسامدی مستقل برای زبان مربوط تهیه کنید؛ هر خط یک واژه و ترتیب از پرتکرار به کم‌تکرار باشد.
  2. فهرست بسامدی را همراه متن‌ها بدهید؛ IDHR با DV-MA/DV-SA ادامه می‌دهد.

پس از انجام این مرحله، فایل/خروجی خواسته‌شده را در فرم زیر بدهید تا IDHR عملیات خودکار را ادامه دهد.

مشاهده ممیزی بازتولیدپذیری همه روش‌ها

کار این ابزار: Text Distortion بخشی از اطلاعات موضوعی را می‌پوشاند. خروجی آن متنِ تبدیل‌شده است و خودش نتیجه انتساب مؤلف تولید نمی‌کند.

فهرست باید مستقل از corpus مورد مناقشه و به‌ترتیب بسامد باشد؛ هر خط فقط یک واژه. IDHR از خود متون پرونده Wk نمی‌سازد.

مقادیر k از شبکه اصلی گزارش‌شده در مقاله گرفته شده‌اند و هیچ‌یک «آستانه بهینه عمومی» نیستند. برای مقایسه حساسیت به موضوع، اجراهای k مختلف باید جداگانه حفظ و تفسیر شوند.

پس از ثبت Job می‌توانید مرورگر را ببندید؛ پردازش روی سرور ادامه می‌یابد. پس از پایان، 168 ساعت فرصت دانلود دارید. پایان موفق یا شکست تحلیل همراه با لینک امن ایمیل می‌شود و خطای ایمیل وضعیت تحلیل را تغییر نمی‌دهد.

نحوه تفسیر

این ابزار نتیجه را همراه پارامترها، نسخه موتور علمیِ همان روش، نرمال‌سازی نویسه‌ای و SHA-256 ورودی‌ها در Research Manifest ثبت می‌کند. تغییر پارامترها باید به‌عنوان اجرای پژوهشی جداگانه در نظر گرفته شود.