استایلومتری و انتساب مؤلف · AA-DELTA-04

حالت پایه Full paper/method-faithful

Delta اِدِر (Eder’s Delta)

8 اجرای موفق ثبت‌شده در آمار دائمی

این ابزار Eder’s Delta را با پیاده‌سازی مرجع stylo محاسبه می‌کند؛ این گونه از Delta برای ویژگی‌های کم‌بسامدتر وزن کمتری در نظر می‌گیرد. خروجی یک سنجه فاصله است و به‌تنهایی احتمال یا اثبات انتساب مؤلف محسوب نمی‌شود.

این خروجی چه می‌گوید؟

در حالت نقش‌محور، متن مجهول را فقط میان نامزدهایی که شما وارد کرده‌اید رتبه‌بندی می‌کند و نشان می‌دهد بر پایه ویژگی‌ها و پارامترهای همین اجرا به سبک کدام نامزد نزدیک‌تر است. بنابراین برای پرسش «از میان این نامزدهای مشخص، کدام گزینه بهتر است؟» ابزار مرتبط و قابل استفاده است.

چه چیزی را به‌تنهایی ثابت نمی‌کند؟

نزدیک‌ترین نامزد لزوماً مؤلف تاریخی واقعی نیست: ممکن است مؤلف واقعی بیرون مجموعه باشد یا تفاوت ژانر، دوره، تصحیح، ترجمه و اندازه متن نتیجه را جابه‌جا کند. عبارت «اثبات انتساب نیست» یعنی نتیجه باید شاهد مقایسه‌ای در یک مجموعه بسته تلقی شود، نه اینکه ابزار برای یافتن نامزد بهتر بی‌فایده باشد.

توضیح علمی، محدودیت‌ها و جایگاه توسعه
این ابزار Eder’s Delta را با پیاده‌سازی مرجع stylo محاسبه می‌کند؛ این گونه از Delta برای ویژگی‌های کم‌بسامدتر وزن کمتری در نظر می‌گیرد. خروجی یک سنجه فاصله است و به‌تنهایی احتمال یا اثبات انتساب مؤلف محسوب نمی‌شود.
محدودیت‌ها: ادعای بازسازی bit-for-bit یک اجرای تاریخی خاص مطرح نمی‌شود
مقاله/مرجع: Eder, Maciej (2015). Taking stylometry to the limits: benchmark study on 5,281 texts from Patrologia Latina. Digital Humanities 2015: Conference Abstracts.

سطح بازتولیدپذیری: Full paper/method-faithful

روش و منبع: Eder, Maciej (2015). Taking stylometry to the limits: benchmark study on 5,281 texts from Patrologia Latina. Digital Humanities 2015: Conference Abstracts. · DOI: 10.1093/llc/fqx023

وضعیت بازتولیدپذیری

اجزای مؤثر روش که برای اجرای علمی لازم‌اند از منبع منتشرشده پیاده شده‌اند؛ این برچسب لزوماً به معنی بازسازی بیت‌به‌بیت محیط تاریخی نرم‌افزار نیست.

پیاده‌سازی شده

  • Eder’s Delta با پیاده‌سازی مرجع stylo pin‌شده
  • MFW و culling اعلام‌شده توسط پژوهشگر
  • Research Manifest

پیاده‌سازی نشده / محدودیت

  • ادعای بازسازی bit-for-bit یک اجرای تاریخی خاص مطرح نمی‌شود

مشاهده ممیزی بازتولیدپذیری همه روش‌ها

ابزار کمکی آماده‌سازی corpus — توسعه IDHR

این لایه جزئی از مقاله یا تعریف اصلی Delta اِدِر (Eder’s Delta) نیست. روش فاصله، MFW، Culling و citation هسته تغییر نمی‌کنند؛ آماده‌سازی و قطعه‌بندی جداگانه در Research Manifest ثبت می‌شود.

نام فایل‌ها را چگونه بنویسم؟

قرارداد ساده سازگار با R/stylo: AuthorID_WorkID.txt. بخش پیش از نخستین زیرخط، شناسه مؤلف/کلاس است؛ در نام چندبخشی مؤلف از خط تیره استفاده کنید.

Farabi_Al-Siyasa.txt
Farabi_Al-Milla.txt
Yahya-Ibn-Adi_Tahdhib-Al-Akhlaq.txt
Unknown_Al-Jam-Bayn-Rayai-Al-Hakimayn.txt
قواعد کامل و خطاهای رایج نام‌گذاری
  • Yahya-Ibn-Adi_... درست است؛ Yahya_Ibn_Adi_... در stylo فقط کلاس Yahya می‌سازد.
  • شناسه یک مؤلف در همه آثار دقیقاً یکسان و نام فایل در هر Job یکتا باشد.
  • فایل TXT با UTF-8 باشد؛ برای اجزای اثر به‌جای فاصله، slash یا colon از خط تیره استفاده کنید.
  • در حالت نقش‌محور، جدول صریح زیر مرجع نهایی است و IDHR نام امن R را می‌سازد؛ لازم نیست فایل را دستی تغییر نام دهید.

Leave-one-work-out (LOWO): هر بار یک اثر کاملِ دارای مؤلف معلوم کنار گذاشته می‌شود. همهٔ قطعات آن اثر فقط آزمون‌اند و هیچ‌یک در آموزش همان fold حضور ندارد؛ بنابراین نشت قطعات یک کتاب میان آموزش و آزمون رخ نمی‌دهد.

اعتبارسنجی leave-one-work-out چیست؟

مثال: فارابی ۳ کتاب و یحیی بن عدی ۳ کتاب معلوم دارند. مرحله ۱ کتاب اول فارابی را آزمون می‌گیرد و ۵ کتاب دیگر آموزش‌اند؛ این روند تا مرحله ۶ ادامه پیدا می‌کند. هر نامزد باید دست‌کم دو اثر مستقل داشته باشد.

در هر fold، رتبه‌بندی ویژگی‌ها، Culling، حذف ویژگی ثابت و استانداردسازی فقط با داده‌های آموزشی برازش می‌شوند. سپس هر قطعهٔ اثر کنارگذاشته‌شده با قاعدهٔ نزدیک‌ترین همسایه (۱-NN) به نزدیک‌ترین نمونهٔ آموزشی نسبت داده می‌شود. رأی اکثریت قطعات، نتیجهٔ trial و در طرح اثرمتوازن رأی اکثریت trialها، نتیجهٔ آن اثر است. تساوی‌ها حل‌نشده ثبت می‌شوند و میانگین فاصله‌ها فقط تشخیصی است، نه قاعدهٔ تصمیم.

طرح اثرمتوازن در هر trial از هر نامزد تعداد برابر اثر مستقل و از هر اثر آموزشی دقیقاً یک قطعه می‌گیرد. گردش قطعات قطعی و پوشش‌محور است. این تجمیعِ قطعه←trial←اثر، توسعهٔ کمکی و صریح IDHR است؛ خود روش‌های Delta و کاربرد نزدیک‌ترین همسایه بر سنت روش و پیاده‌سازی مرجع stylo تکیه دارند.

منابع: Eder, Rybicki & Kestemont (2016)، بستهٔ stylo؛ مستند رسمی stylo و crossv؛ و برای خطر نمونه‌های کوتاه Eder (2015)، Does size matter?.

تفسیر: accuracy، balanced accuracy، macro-F1 و confusion matrix عملکرد جداسازی آثار معلوم در همین corpus را می‌سنجند، نه احتمال مؤلف‌بودن متن مجهول. برای طول نمونه حد جهانی وجود ندارد؛ اگر قطعات کوتاه‌اند، MFW و اندازهٔ قطعه باید در اجراهای حساسیت جداگانه تغییر کنند.

۱. ساختار corpus

حالت نقش‌محور: یک متن مجهول و آثار معلومِ دست‌کم دو نامزد را صریح ثبت می‌کنید؛ خروجی می‌تواند نامزدها را در همین مجموعه بسته رتبه‌بندی کند.

برای هر فایل در جدول زیر شناسه نامزد و اثر را صریح تأیید کنید. یک کتاب که به چند قطعه شکسته شود همچنان یک اثر مستقل است.

۲. قطعه‌بندی کمکی متن مجهول
آیا قطعه‌قطعه‌کردن از نظر علمی معنادار است؟
  • تقسیم متن مجهول می‌تواند ثبات سبک در طول اثر را نشان دهد، اما قطعات آن شاهدهای مستقل نیستند.
  • تقسیم فقط متن مجهول مجاز ولی اکتشافی است؛ تعداد نمونه، MFW، Culling و z-score به ترکیب corpus حساس‌اند.
  • برای کنترل طول، اجرای مکمل با قاعده یکسان روی مجهول و هر اثر نامزد ترجیح دارد؛ مرز دو کتاب هرگز یکی نمی‌شود.
  • Whole-text baseline را نگه دارید و اجراهای ۱۰۰۰/۲۰۰۰/۵۰۰۰ واژه‌ای را sensitivity runهای جدا بدانید؛ IDHR از آن‌ها رأی یا میانگین ابتکاری نمی‌سازد.
  • مقایسه زبان، ژانر، دوره و وضعیت تصحیح از برابری مکانیکی تعداد واژه مهم‌تر است.

پژوهش Eder (2015)، DOI 10.1093/llc/fqt066، در corpusهای خود حدود ۲۵۰۰ تا ۵۰۰۰ واژه را گزارش می‌کند؛ این اعداد cutoff اعتبار برای فارسی یا عربی نیستند.

نسبت آثار و حجم نامزدها چگونه باشد؟

قاعده عددی جهان‌شمولی وجود ندارد. ترجیح عملی این است که نامزدها از نظر تعداد اثر مستقل، تعداد قطعه و مجموع واژه تا حد امکان قابل‌مقایسه باشند و زبان، ژانر، دوره و وضعیت تصحیح نیز هم‌خوان باشد. زیادکردن قطعات یک کتاب جای کمبود اثر مستقل را نمی‌گیرد.

preflight نسبت بزرگ‌ترین به کوچک‌ترین نامزد را جداگانه برای اثر، قطعه و واژه نشان می‌دهد و چیزی را پنهانی حذف یا downsample نمی‌کند. اگر عدم‌توازن زیاد است، اجرای اصلی را همراه sensitivity runهای جدا و LOWO—در صورت داشتن حداقل دو اثر برای هر نامزد—تفسیر کنید؛ IDHR یک نسبت دلخواه را به آستانه «معناداری» تبدیل نمی‌کند.

۳. پارامترهای همان Delta اصلی

حالت پایه word unigram است: واحد «واژه» و n=1. هر انتخاب دیگر در Manifest و runtime ثبت می‌شود.

Culling دقیقاً به چه معناست؟

Culling ویژگی‌هایی را حذف می‌کند که در درصد کافی از نمونه‌های corpus حضور ندارند؛ حذف واژه‌های کم‌بسامد در هر متن یا حذف درصدی از کل واژه‌ها نیست.

  • ۰٪: حذف نشدن ویژگی به علت پراکندگی؛
  • ۲۰٪: حضور در دست‌کم ۲۰٪ نمونه‌ها؛
  • ۱۰۰٪: حضور در همه نمونه‌ها.

آستانه مطلق و تعداد ویژگی‌های پیش و پس از Culling با خود stylo 0.7.71 در preflight نشان داده می‌شود.

در هر fold یک اثر کامل کنار گذاشته می‌شود؛ در هر trial تعداد آثار دو نامزد برابر و سهم هر اثر آموزشی دقیقاً یک قطعه است. انتخاب‌ها قطعی و چرخه‌ای‌اند.

۴. آزمون متوازن مشترک سه Delta — توسعهٔ کمکی IDHR

این گزینه exhaustive یا تصادفی نیست. آثار با پنجره‌های چرخشی و قطعات هر اثر به نوبت انتخاب می‌شوند؛ تمام انتخاب‌ها در delta-balanced-trial-plan.csv ثبت می‌شود.

اجرای متوازن از LOWO مستقل است؛ با فعال‌شدن این گزینه LOWO خاموش می‌شود و در Manifest نیز خاموش ثبت خواهد شد.

محدودیت پژوهشی برای تعداد فایل وجود ندارد؛ حداکثر مجموع فایل‌های اولیه: 100 مگابایت. Passim در صفحه مشابهت‌یابی محدودیت مستقل خود را حفظ می‌کند.

پس از ثبت Job می‌توانید مرورگر را ببندید؛ پردازش روی سرور ادامه می‌یابد. پس از پایان، 168 ساعت فرصت دانلود دارید. پایان موفق یا شکست تحلیل همراه با لینک امن ایمیل می‌شود و خطای ایمیل وضعیت تحلیل را تغییر نمی‌دهد.

نحوه تفسیر

این ابزار نتیجه را همراه پارامترها، نسخه موتور علمیِ همان روش، نرمال‌سازی نویسه‌ای و SHA-256 ورودی‌ها در Research Manifest ثبت می‌کند. تغییر پارامترها باید به‌عنوان اجرای پژوهشی جداگانه در نظر گرفته شود.