استایلومتری و انتساب مؤلف · AR-AA-05

حالت پایه Full paper/method-faithful

انتساب مؤلف عربی با واژه‌های دستوری Shaker–Corne

6 اجرای موفق ثبت‌شده در آمار دائمی

این ابزار حالت پایه Full paper/method-faithful شیکر–کورن را جدا و دست‌نخورده نگه می‌دارد: فراوانی نسبی واژه‌های دستوری عربی در chunkهای کامل، انتخاب زیرمجموعه ویژگی با الگوریتم تکاملی، و GLM لجستیک با regularization و LOO. در بخش جداگانه IDHR Extension، Replicated cases، Multi-book pooling و Balanced exhaustive subsets برای اتوماسیون/robustness عرضه می‌شوند و هیچ‌کدام به‌عنوان جزء روش منتشرشده معرفی نمی‌شوند. نتیجه به‌تنهایی اثبات تاریخی انتساب مؤلف نیست.

این خروجی چه می‌گوید؟

سنجه، طبقه‌بندی یا کنترل کیفیت تعریف‌شدهٔ همین روش را روی داده‌های واردشده گزارش می‌کند.

چه چیزی را به‌تنهایی ثابت نمی‌کند؟

دامنه ادعا از نوع ابزار، corpus و کنترل‌های روش‌شناختی فراتر نمی‌رود؛ نتیجه باید همراه محدودیت‌های زیر تفسیر شود.

توضیح علمی، محدودیت‌ها و جایگاه توسعه
این ابزار حالت پایه Full paper/method-faithful شیکر–کورن را جدا و دست‌نخورده نگه می‌دارد: فراوانی نسبی واژه‌های دستوری عربی در chunkهای کامل، انتخاب زیرمجموعه ویژگی با الگوریتم تکاملی، و GLM لجستیک با regularization و LOO. در بخش جداگانه IDHR Extension، Replicated cases، Multi-book pooling و Balanced exhaustive subsets برای اتوماسیون/robustness عرضه می‌شوند و هیچ‌کدام به‌عنوان جزء روش منتشرشده معرفی نمی‌شوند. نتیجه به‌تنهایی اثبات تاریخی انتساب مؤلف نیست.
توضیح علمی: Shaker, Kareem. (2012). Investigating features and techniques for Arabic authorship attribution. PhD thesis, Heriot-Watt University.
محدودیت‌ها: state مولد تصادفی MATLAB تاریخی منتشر نشده است؛ IDHR seedهای خود را صریح ثبت می‌کند و ادعای bitwise historical reproduction ندارد
مقاله/مرجع: Shaker, Kareem; Corne, David. (2010). Authorship Attribution in Arabic using a Hybrid of Evolutionary Search and Linear Discriminant Analysis. UKCI 2010.

سطح بازتولیدپذیری: Full paper/method-faithful

Beta / IDHR Extension: Replicated cases: همه جفت‌های کتابی A×B به‌صورت caseهای مستقل برای سنجش حساسیت به انتخاب کتاب آموزشی Multi-book pooling: هر کتاب جداگانه chunk می‌شود و chunkهای یک نویسنده با حفظ provenance در یک کلاس آموزشی pool می‌شوند Author-stream pooling: متون آموزشی هر نویسنده با ترتیب ثبت‌شده در یک جریان توکنی provenance-aware تجمیع و سپس chunk می‌شوند؛ مناسب برای مجموعه آثار کوتاه و صریحاً توسعه IDHR Balanced exhaustive subsets: کلاس کوچک‌تر کامل نگه داشته می‌شود و همه زیرمجموعه‌های هم‌اندازه از کلاس بزرگ‌تر به‌صورت case مستقل آزموده می‌شوند؛ خروجی فقط robustness توصیفی است نه confidence Preserve remainder: فقط در حالت توسعه/حساسیت‌سنجی و با برچسب صریح IDHR؛ حالت پایه remainder را discard می‌کند

روش و منبع: Shaker, Kareem; Corne, David. (2010). Authorship Attribution in Arabic using a Hybrid of Evolutionary Search and Linear Discriminant Analysis. UKCI 2010. · DOI: 10.1109/UKCI.2010.5625580

وضعیت بازتولیدپذیری

اجزای مؤثر روش که برای اجرای علمی لازم‌اند از منبع منتشرشده پیاده شده‌اند؛ این برچسب لزوماً به معنی بازسازی بیت‌به‌بیت محیط تاریخی نرم‌افزار نیست.

پیاده‌سازی شده

  • مجموعه‌های واژه دستوری منتشرشده AFW65/AFW54
  • قطعه‌بندی ۱۰۰۰/۲۰۰۰/۳۰۰۰ واژه‌ای در حالت پایه با نگه‌داشتن فقط chunkهای کامل و ثبت remainder حذف‌شده
  • جست‌وجوی تکاملی ویژگی و GLM لجستیک regularized با انتخاب LOO
  • دو preset تکرار منتشرشده: ۵ trial در مقاله UKCI 2010 و ۱۰ اجرای مستقل در رساله ۲۰۱۲
  • طراحی پایه یک کتاب آموزشی از هر نامزد و تصمیم کتاب با رأی اکثریت

پیاده‌سازی نشده / محدودیت

  • state مولد تصادفی MATLAB تاریخی منتشر نشده است؛ IDHR seedهای خود را صریح ثبت می‌کند و ادعای bitwise historical reproduction ندارد

توسعه‌ها و ابزارهای کمکی IDHR — خارج از حالت پایه مقاله

  • Replicated cases: همه جفت‌های کتابی A×B به‌صورت caseهای مستقل برای سنجش حساسیت به انتخاب کتاب آموزشی
  • Multi-book pooling: هر کتاب جداگانه chunk می‌شود و chunkهای یک نویسنده با حفظ provenance در یک کلاس آموزشی pool می‌شوند
  • Author-stream pooling: متون آموزشی هر نویسنده با ترتیب ثبت‌شده در یک جریان توکنی provenance-aware تجمیع و سپس chunk می‌شوند؛ مناسب برای مجموعه آثار کوتاه و صریحاً توسعه IDHR
  • Balanced exhaustive subsets: کلاس کوچک‌تر کامل نگه داشته می‌شود و همه زیرمجموعه‌های هم‌اندازه از کلاس بزرگ‌تر به‌صورت case مستقل آزموده می‌شوند؛ خروجی فقط robustness توصیفی است نه confidence
  • Preserve remainder: فقط در حالت توسعه/حساسیت‌سنجی و با برچسب صریح IDHR؛ حالت پایه remainder را discard می‌کند

این موارد صریحاً با برچسب IDHR Extension/Assistive/Experimental اجرا می‌شوند و نباید به‌عنوان جزء روش منتشرشده گزارش شوند.

مشاهده ممیزی بازتولیدپذیری همه روش‌ها

حالت پایه منتشرشده — Full paper/method-faithful

این بخش باید بدون توسعه‌های IDHR، منطبق با پروتکل منتشرشده باقی بماند. توسعه‌ها در گروه جداگانه زیر برچسب می‌خورند و با حالت پایه ادغام نمی‌شوند.

طراحی پایه: یک کتاب معلوم‌الانتساب از هر نویسنده در training. فقط chunkهای کامل وارد مدل می‌شوند و remainder کوتاه انتهای کتاب کنار گذاشته و در گزارش ثبت می‌شود.

فایل‌ها باید TXT با UTF-8 باشند. IDHR تعداد chunkهای آموزشی هر نامزد را در training-cases.csv گزارش می‌کند و هیچ آستانه اختراعی برای «توازن کافی» اعمال نمی‌کند.

فایل‌های کوتاه و پیش‌بررسی پیش از صف: قبل از ورود به صفحه Progress، سرور با همان tokenization روش تعداد واژه و chunkهای قابل استفاده را بررسی می‌کند. در حالت‌های چندکتابی، اگر بعضی کتاب‌های آموزشی حتی یک chunk لازم را نسازند، IDHR نام و اندازه آن‌ها را نشان می‌دهد و از پژوهشگر می‌پرسد: «با بقیه کتاب‌ها ادامه می‌دهید یا به تنظیمات برمی‌گردید؟» کنارگذاری فقط با تأیید صریح پژوهشگر انجام و در Research Manifest ثبت می‌شود. در Full paper/method-faithful کتاب پایه بی‌اطلاع حذف نمی‌شود. Author-stream pooling و Preserve remainder نیز همچنان توسعه‌های جداگانه IDHR هستند.

در مطالعه، AFW54 عموماً عملکرد بهتری داشت، اما برتری کلی آن نسبت به AFW65 از نظر آماری قطعی گزارش نشده است؛ هر دو مجموعه منتشرشده‌اند.

تفاوت دو preset منتشرشده: مقاله عربی UKCI 2010 نتایج را به‌صورت میانگین ۵ trial گزارش می‌کند؛ رساله ۲۰۱۲ در فصل پنجم هر case را ۱۰ بار مستقل بازاجرا می‌کند. IDHR هر دو را جدا و با provenance روشن ارائه می‌دهد.

پیش‌پردازش ثابت این روش: NFKC و یکسان‌سازی ی/کِ ناشی از دیجیتالی‌سازی انجام می‌شود، اما «أ/إ/آ» به «ا» تبدیل نمی‌شود؛ زیرا خود فهرست واژه‌های دستوری مقاله میان شکل‌های دارای همزه تمایز می‌گذارد. اعراب نیز حذف نمی‌شود.

در حالت Full paper/method-faithful فقط chunkهای کامل وارد مدل می‌شوند و remainder کنار گذاشته می‌شود. در حالت‌های IDHR Extension پژوهشگر می‌تواند به‌صورت صریح و برچسب‌خورده حفظ remainder را برای sensitivity انتخاب کند. تصمیم هر trial برای کتاب آزمون از رأی اکثریت chunkها گزارش می‌شود؛ در تساوی، نتیجه نامشخص می‌ماند.

پس از ثبت Job می‌توانید مرورگر را ببندید؛ پردازش روی سرور ادامه می‌یابد. پس از پایان، 168 ساعت فرصت دانلود دارید. پایان موفق یا شکست تحلیل همراه با لینک امن ایمیل می‌شود و خطای ایمیل وضعیت تحلیل را تغییر نمی‌دهد.

نحوه تفسیر

این ابزار نتیجه را همراه پارامترها، نسخه موتور علمیِ همان روش، نرمال‌سازی نویسه‌ای و SHA-256 ورودی‌ها در Research Manifest ثبت می‌کند. تغییر پارامترها باید به‌عنوان اجرای پژوهشی جداگانه در نظر گرفته شود.