مشابهت‌یابی و کشف بازاستفاده متنی

Engine-derived reconstruction

وضعیت بازتولیدپذیری

روش با پیاده‌سازی/پیش‌فرض مستند موتور مرجع امروزی اجرا می‌شود و منشأ پارامترهای engine-derived صریح ثبت می‌شود.

پیاده‌سازی شده

  • اجرای Passim pin‌شده با پارامترهای اعلام‌شده
  • بازسازی alignment و نتایج
  • Research Manifest

پیاده‌سازی نشده / محدودیت

  • ابزار مشابهت‌یابی متن‌های منبع را پنهانی normalize نمی‌کند

مرحله دستی یا ورودی پژوهشگر

  1. پیش از مقایسه، همه متن‌ها را با یک سیاست normalization یکسان آماده کنید.

این مرحله را انجام دهید و سپس فایل/متن آماده را در همین ابزار بدهید تا IDHR عملیات خودکار را ادامه دهد.

مشاهده ممیزی بازتولیدپذیری همه ابزارها و روش‌ها

این ابزار یک متن مبنا را با سایر متون یا همه فایل‌ها را با یکدیگر مقایسه می‌کند و قطعات هم‌تراز، ماتریس شباهت و خروجی‌های قابل استناد می‌سازد. این ابزار بین ۲ تا 4 ورودی TXT یا متن پیست‌شده را می‌پذیرد. مجموع حجم ورودی‌ها حداکثر 40 مگابایت است. هر ورودی یک متن مستقل است.

پیش از مقایسه، همهٔ متن‌ها را با یک روش یکسان نرمال‌سازی کنید. متن پیست‌شده و فایل دقیقاً به همان شکلِ ارسالی وارد Passim می‌شوند؛ نرمال‌سازی خودکار در این صفحه انجام نمی‌شود.

پیست متن

برای هر متن عنوان جداگانه وارد کنید؛ می‌توانید فایل و متن پیست‌شده را با هم مقایسه کنید.

نوع مقایسه

پس از افزودن دو ورودی، متن مبنا را مشخص کنید.

تنظیمات پیشرفته Passim

Passim به‌طور پیش‌فرض قطعاتی را بررسی می‌کند که دست‌کم پنج n-gram نویسه‌ای ۲۵حرفی مشترک داشته باشند. تطابق‌های کوتاه‌تر از ۵۰ نویسه حذف می‌شوند. کاهش این مقادیر نتایج بیشتری تولید می‌کند، اما احتمال نتایج نامرتبط را نیز افزایش می‌دهد.

يبحث Passim افتراضياً عن المقاطع التي تشترك في خمسة مقاطع حرفية على الأقل، طول كل منها 25 حرفاً. ويستبعد المحاذاة الأقصر من 50 حرفاً. يؤدي خفض هذه القيم إلى زيادة النتائج، مع احتمال زيادة النتائج غير الدقيقة.

درصد شباهت پس از پایان Passim محاسبه می‌شود. برای عیب‌یابی، بازه ۰ تا ۱۰۰ را انتخاب کنید تا هیچ نتیجه‌ای در این مرحله حذف نشود.

پس از ثبت Job می‌توانید مرورگر را ببندید؛ پردازش روی سرور ادامه می‌یابد. پس از پایان، 168 ساعت فرصت دانلود دارید. پایان موفق یا شکست تحلیل همراه با لینک امن ایمیل می‌شود و خطای ایمیل وضعیت تحلیل را تغییر نمی‌دهد.

کشف بازاستفاده متنی چیست؟

بازاستفاده متنی به حضور قطعات مشترک یا نزدیک در دو یا چند متن اشاره دارد؛ از نقل مستقیم و عبارت‌های قالبی تا بازنویسی‌های نزدیک. این ابزار برای جایگزینی داوری پژوهشگر طراحی نشده است: Passim نامزدهای هم‌تراز را پیدا می‌کند و IDHR آن‌ها را برای بررسی انسانی، درصد شباهت، موقعیت در متن، نمودار و ماتریس سازمان‌دهی می‌کند.

حالت «فایل مبنا با سایر فایل‌ها» برای بررسی یک اثر در برابر مجموعه‌ای از منابع مناسب است. حالت «همه با همه» برای مطالعه شبکه‌ای یک مجموعه متنی و ماتریس کلی کاربرد بیشتری دارد. تنظیمات کوتاه‌تر و حساس‌تر recall را بالا می‌برند، اما می‌توانند عبارت‌های عمومی بیشتری تولید کنند.

آیا درصد شباهت به معنی سرقت ادبی است؟

خیر. نتیجه صرفاً شباهت محاسباتی در قطعه هم‌تراز است. تشخیص نقل، اقتباس، عبارت رایج، بینامتنیت یا تخلف پژوهشی نیازمند زمینه تاریخی و قضاوت انسانی است.

برای مقاله علمی چه اطلاعاتی باید ثبت شود؟

پژوهشگر باید نسخه IDHR، حالت مقایسه، preset یا مقادیر n-gram، min-match، min-align، gap و floating n-grams را ثبت کند. فایل Research Manifest نیز باید همراه خروجی پژوهش نگهداری شود.