از شعر تا دادهاطلس تعاملی شعر فارسیورود به اطلس تعاملی
شفافیت پژوهش

از داده خام تا نتیجه قابل دفاع

این صفحه توضیح می‌دهد هر عدد چگونه ساخته شده، کجا قابل اعتماد است و کجا باید با احتیاط خوانده شود.

۱. واحد تحلیل و پیکره

هر ردیف فایل اصلی یک متن یا شعر کامل است و ستون‌های شاعر، سده، کتاب، عنوان و متن را دارد. پیکره شامل ۵۴٬۵۲۴ متن، ۶۹۹٬۹۹۹ بیت و ۹٬۷۲۵٬۶۵۲ واژه از ۶۷ شاعر است. بیت با جفت‌کردن مصراع‌های جداشده در متن منبع و گردکردن واحد پایانیِ فرد در سطح هر رکورد شمارش شده است. برچسب سده، دوره زندگی شاعر را نشان می‌دهد و تاریخ دقیق سرایش نیست.

۲. کنترل عدم‌توازن

حجم آثار شاعران بسیار متفاوت است. برای جلوگیری از سلطه شاعران پرحجم، تحلیل‌های تاریخی از نمونه‌گیری سقف‌دار، میانگین برابر شاعران یا وزن‌دهی در سطح شاعر استفاده می‌کنند. شمار خام فقط در بخش توصیفی نمایش داده می‌شود.

۳. مدل‌های محاسباتی

پرسش‌های واژه‌محور

شمارش فرهنگ‌های کوچک، نرخ شاعرمتوازن و پنجرهٔ هشت‌واژه‌ای؛ برای پاسخ توصیفی، نه داوری معنایی قطعی.

مدل موضوعی

کشف هم‌رخدادی واژه‌ها و تفسیر یازده محور موضوعی.

رانش معنایی

مقایسه همسایگان واژگانی استعاره‌ها در دوره‌های مختلف.

شبکهٔ پیوند متنی

ترکیب عبارت‌های نادر، TF–IDF و شباهت موضوعی؛ نام تخصصی این حوزه بینامتنیت است.

سبک‌سنجی

ویژگی‌های نویسه‌ای و واژگانی برای شناسایی امضای شاعر.

جغرافیای ادبی

مقایسه خاستگاه، کانون فعالیت و مسیر تقریبی با دوره، سبک و شبکه.

چرخه عمر واژه

فراوانی متوازن شاعر، اوج، افت تا نصف و سانسور راست در پایان پیکره.

۴. زیبایی‌شناسی محاسباتی

مدل GPT-5.6-sol برای هر واحد دو‌سطری هشت شاخص صفر تا صد تولید کرده است: نمادپردازی، تصویرسازی، زبان مجازی، موسیقی، فشردگی معنا، عمق عاطفی، ساختار و تازگی بیان. امتیاز نهایی از جمع وزن‌دار این هشت خروجی ساخته می‌شود و برای هر شاعر ده واحد دارای بالاترین امتیاز منتشر شده است.

مرز روش: این فرایند ارزیابی انسانی نیست. خروجی مدل برای اولویت‌بندی خوانش نزدیک مناسب است، اما معیار جهان‌شمول زیبایی، ارزش ادبی یا برتری شاعر نیست.

۵. معناداری و اندازه اثر

p-value به‌تنهایی گزارش نمی‌شود. آزمون‌های جایگشتی، اصلاح چندآزمونی، اندازه اثر، بازه اطمینان و تحلیل حساسیت در کنار تفسیر کیفی استفاده شده‌اند. در شبکه، QAP وابستگی میان یال‌ها را بهتر از آزمون‌های مستقل کنترل می‌کند.

۶. بازتولید و ممیزی

خروجی‌های ماشین‌خوان، فرهنگ فیلدها و تعریف شمارش در صفحه داده در دسترس‌اند. فایل‌های CITATION.cff و codemeta.json نیز هویت و نسخه پروژه را ثبت می‌کنند.

اصل احتیاط

مدل‌ها ابزار کشف الگو و تولید فرضیه‌اند. نتیجه محاسباتی باید با خوانش نزدیک متن، تاریخ ادبیات، نسخه‌شناسی و داوری متخصص ترکیب شود.

استناد پیشنهادی

چگونه به این صفحه استناد کنیم؟

کریمی، حسین. (۲۰۲۶). «روش‌شناسی تحلیل داده‌های شعر فارسی». از شعر تا داده: اطلس تعاملی تحلیل داده‌های شعر فارسی. https://frompoetrytodata.vercel.app/methodology/