از داده خام تا نتیجه قابل دفاع
این صفحه توضیح میدهد هر عدد چگونه ساخته شده، کجا قابل اعتماد است و کجا باید با احتیاط خوانده شود.
۱. واحد تحلیل و پیکره
هر ردیف فایل اصلی یک متن یا شعر کامل است و ستونهای شاعر، سده، کتاب، عنوان و متن را دارد. پیکره شامل ۵۴٬۵۲۴ متن، ۶۹۹٬۹۹۹ بیت و ۹٬۷۲۵٬۶۵۲ واژه از ۶۷ شاعر است. بیت با جفتکردن مصراعهای جداشده در متن منبع و گردکردن واحد پایانیِ فرد در سطح هر رکورد شمارش شده است. برچسب سده، دوره زندگی شاعر را نشان میدهد و تاریخ دقیق سرایش نیست.
۲. کنترل عدمتوازن
حجم آثار شاعران بسیار متفاوت است. برای جلوگیری از سلطه شاعران پرحجم، تحلیلهای تاریخی از نمونهگیری سقفدار، میانگین برابر شاعران یا وزندهی در سطح شاعر استفاده میکنند. شمار خام فقط در بخش توصیفی نمایش داده میشود.
۳. مدلهای محاسباتی
شمارش فرهنگهای کوچک، نرخ شاعرمتوازن و پنجرهٔ هشتواژهای؛ برای پاسخ توصیفی، نه داوری معنایی قطعی.
کشف همرخدادی واژهها و تفسیر یازده محور موضوعی.
مقایسه همسایگان واژگانی استعارهها در دورههای مختلف.
ترکیب عبارتهای نادر، TF–IDF و شباهت موضوعی؛ نام تخصصی این حوزه بینامتنیت است.
ویژگیهای نویسهای و واژگانی برای شناسایی امضای شاعر.
مقایسه خاستگاه، کانون فعالیت و مسیر تقریبی با دوره، سبک و شبکه.
فراوانی متوازن شاعر، اوج، افت تا نصف و سانسور راست در پایان پیکره.
۴. زیباییشناسی محاسباتی
مدل GPT-5.6-sol برای هر واحد دوسطری هشت شاخص صفر تا صد تولید کرده است: نمادپردازی، تصویرسازی، زبان مجازی، موسیقی، فشردگی معنا، عمق عاطفی، ساختار و تازگی بیان. امتیاز نهایی از جمع وزندار این هشت خروجی ساخته میشود و برای هر شاعر ده واحد دارای بالاترین امتیاز منتشر شده است.
مرز روش: این فرایند ارزیابی انسانی نیست. خروجی مدل برای اولویتبندی خوانش نزدیک مناسب است، اما معیار جهانشمول زیبایی، ارزش ادبی یا برتری شاعر نیست.
۵. معناداری و اندازه اثر
p-value بهتنهایی گزارش نمیشود. آزمونهای جایگشتی، اصلاح چندآزمونی، اندازه اثر، بازه اطمینان و تحلیل حساسیت در کنار تفسیر کیفی استفاده شدهاند. در شبکه، QAP وابستگی میان یالها را بهتر از آزمونهای مستقل کنترل میکند.
۶. بازتولید و ممیزی
خروجیهای ماشینخوان، فرهنگ فیلدها و تعریف شمارش در صفحه داده در دسترساند. فایلهای CITATION.cff و codemeta.json نیز هویت و نسخه پروژه را ثبت میکنند.
اصل احتیاط
مدلها ابزار کشف الگو و تولید فرضیهاند. نتیجه محاسباتی باید با خوانش نزدیک متن، تاریخ ادبیات، نسخهشناسی و داوری متخصص ترکیب شود.
چگونه به این صفحه استناد کنیم؟
کریمی، حسین. (۲۰۲۶). «روششناسی تحلیل دادههای شعر فارسی». از شعر تا داده: اطلس تعاملی تحلیل دادههای شعر فارسی. https://frompoetrytodata.vercel.app/methodology/