در این مقاله ، من مختصراً از چندین معیار استفاده شده برای ارزیابی عملکرد مدل هایی که شبیه سازی برخی از رفتارها است ، ارائه می دهم. این معیارها خروجی شبیه سازی شده را با برخی از حقیقت های زمینی مقایسه می کنند.
مقایسه توزیع
واگرایی جنسن شانون
Jensen-Shaon Divergence (JSD) شباهت بین دو توزیع (یعنی حقیقت زمین و شبیه سازی) را اندازه گیری می کند. راه دیگر برای توصیف این معیارها میزان واگرایی بین دو توزیع است. JSD یک نسخه متقارن و صاف از واگرایی Kullback-Liebler یا D (P ، Q) است ، که توصیف واگرایی بین توزیع احتمال P و Q است. نکته مهمی که باید به آن توجه داشت این است که D متقارن نیست ، به این دلیل که D (P ، Q) برابر D (Q ، P) نیست.
تصور کنید که ما یک نمونه X داریم و می خواهیم اندازه گیری کنیم که احتمال X در توزیع حقیقت زمین P بر خلاف توزیع شبیه سازی q وجود دارد. نسبت به نسبت (LR) این را اندازه گیری می کند:
LR>1 نشان می دهد که P (x) به احتمال زیاد در حالی که LRQ (X) محتمل تر است. اکنون برای به دست آوردن نسبت کلی برای مجموعه داده X ، محصول را برای هر نمونه می گیریم:
ما نسبت ورود به سیستم را برای بهبود محاسبه می گیریم:
Where log(LR) values> 0 indicate that p(x) better fits while values>0 نشان می دهد که q (x) بهتر از داده ها متناسب است. با استفاده از این مقدار ، ما می توانیم با پاسخ دادن به میزان متوسط هر نمونه به طور متوسط چقدر بهتر از مدل دیگر باشد ، نشان می دهد که p (x) در صورت نمونه گیری از p (x) داده ها را بهتر از q (x) توصیف می کند. بشربه این قدرت پیش بینی کننده آن نیز گفته می شود.
اگر فرض کنید که n به بی نهایت نزدیک می شود ، ما مقدار مورد انتظار را دریافت می کنیم:
JSD این را متقارن و صاف می کند:
تست Kolmogorov-Smiov
آزمون Kolmogorov-Smiov (آزمون KS) یک تست غیر پارامتری برابری دو توزیع احتمال مداوم و یک بعدی با یک آمار آزمون است که فاصله بین دو توزیع را تعیین می کند. اگر آمار KS زیاد باشد یا مقدار p پایین باشد ، از این فرضیه پشتیبانی می کند که این دو توزیع یکسان هستند.
مرحله اول مرتب سازی مقادیر اندازه گیری شده در نمونه و سپس محاسبه احتمال تجمعی S (x) ، کسری از تمام اندازه گیری هایی است که مقادیر آنها کمتر از x است. در این حالت ، S (x1) = 0 و S (xn) = 1. آمار Kolmogoro v-Smiov برای یک تابع توزیع تجمعی خاص S (X) حداکثر تفاوت مطلق بین دو احتمال تجمعی است:
اگر نمونه از S (x) حاصل شود ، هنگامی که n به بی نهایت می رود ، DN به 0 همگرا می شود. یکی از آمار محاسبه می شود ، شما به جدول Kolmogorov-Smiov مناسب و بر اساس اندازه نمونه خود مراجعه می کنید تا مقدار بحرانی را پیدا کنید که در آن اگر D بیشتر از مقدار بحرانی باشد ، فرضیه تهی رد می شود.
تست های غیر پارامتری در مقابل پارامتری
تست های غیر پارامتری فرض نمی کنند که مجموعه داده از توزیع خاص پیروی می کند در حالی که تست های پارامتری به فرضیات خاصی نیاز دارند. با این حال ، تست های غیر پارامتری نیاز دارند که گروه های مختلف در مجموعه داده دارای تنوع/پراکندگی یکسان باشند. تست های پارامتری در موارد زیر عملکرد خوبی دارند:
- هنگامی که توزیع ها کمرنگ و غیر عادی هستند.
- وقتی گسترش هر گروه متفاوت است.
- وقتی قدرت آماری بیشتری می خواهید.
تست های غیر پارامتری وقتی می خواهید میانگین را ارزیابی کنید ، عملکرد خوبی دارند. تست های پارامتری می توانند تغییرات در میانگین در توزیع های چسبان را به دلیل تغییر در دم تشخیص دهند. تجزیه و تحلیل غیر پارامتری بر میانه متمرکز است که نسبت به تغییرات در دم نسبتاً بی تأثیر است.
مقایسه های یک به یک
خطای مربع میانگین ریشه
میانگین خطای مربع ریشه (RMSE) اندازه گیری تفاوت بین یک مقدار پیش بینی شده از یک شبیه سازی و یک مقدار حقیقت زمینی است. استفاده اصلی برای رگرسیون ، برای مقادیر مقیاس است. اولین قدم برای محاسبه RMSE با محاسبه باقیمانده با کم کردن مقدار پیش بینی شده توسط مقدار واقعی است. مرحله بعدی میانگین مربع آن باقیمانده ها و سپس ریشه دار کردن مربع آن به طور متوسط است. هدف مربع و سپس ریشه مربع حذف مقادیر منفی است.
ضریب تعیین (R-Squared)
ضریب تعیین (R-Squared) تعیین می کند که چگونه شبیه سازی خوب با یک مدل پایه مقایسه می شود و دارای متغیرهای مستقل نیست که همیشه مقدار مورد انتظار Y را پیش بینی می کند. به طور عمده در رگرسیون استفاده می شود ، مقایسه یک به یک بین ارزش پیش بینی شده و ارزش حقیقت زمین.
R-Squared هر مقدار بین 0 تا 1 است ، جایی که مقادیر نزدیک به 1 نشان دهنده بخش بیشتری از واریانس است که توسط مدل حساب می شود. می توان یک $ $ منفی را برای معادلات دریافت کرد که حاوی یک اصطلاح ثابت نیستند ، نشان می دهد که تناسب در واقع بدتر از فقط مناسب بودن یک خط افقی است. اگر مقدار زیر 0 باشد ، نمی توان آن را به عنوان مربع یک همبستگی تعبیر کرد و نشانه خوبی از این است که اصطلاح ثابت باید به مدل اضافه شود.
نمونه ای از این مورد در کاربرد این است که فرض کنیم R-Squared = 93 ٪ از 93 ٪ از تغییرات در داده های حقیقت زمین با شبیه سازی ما توضیح داده می شود.
مقایسه توالی
پیچ و تاب زمان پویا
Warping Time Dynamic (DTW) [2] معیاری است که چگونه دو توالی زمانی مشابه در یک تجزیه و تحلیل سری زمانی وجود دارد. DTW به دنبال تراز بهینه بین این دو سریال در مقایسه با نگاه به فاصله اقلیدسی بین دو نقطه در هر سری زمانی است. ما ابتدا یک ماتریس فاصله را بین سری زمانی 1 (a) و سری 2 (b) محاسبه می کنیم. ماتریس دارای نقاط ترسیم شده برای یک سری زمانی در محور عمودی و دیگری در افقی است. ما سپس فاصله را بر اساس این مقادیر و یک متریک فاصله انتخاب شده D (معمولاً اقلیدسی) محاسبه می کنیم:
پس از محاسبه ماتریس مسافت ، شما مسیر Warp یا مسیر Warp W = (W_1 ، W_2 ، ... ، W_N) را با استفاده از عقب نشینی و یک جستجوی حریص برای به حداقل رساندن فاصله می سازید. با استفاده از مسیر Warp ، با جمع بندی مسافت ها در مسیر ، مقدار فاصله را دریافت می کنید:
هرچه فاصله کوچکتر باشد ، دنباله زمانی مشابه تر است.
با هم همپوشانی
همپوشانی رده بندی شده با تعصب (RBO) [3] شباهت بین لیست های رتبه بندی شده نامتناهی را اندازه گیری می کند که ممکن است با محاسبه همپوشانی در اعماق مختلف ، موارد مشابهی را شامل نشود و با استفاده از یک سری هندسی ، میانگین همپوشانی آن عمق ، نوعی سری همگرا را محدود کند. بشرRBO در محدوده 0 تا 1 سقوط می کند که 0 به معنای حداکثر جدا شدن و 1 به معنای یکسان است. می توان نشان داد که مجموع نامحدود یک سری هندسی محدود است و توسط:
یک سری هندسی مجموعه ای از اصطلاحات است که در آن یک نسبت ثابت بین اصطلاحات پی در پی وجود دارد. یک مثال:
استفاده از یک سری هندسی به ما این امکان را می دهد تا به صراحت رفتار کاربر را مدل کنیم زیرا مقادیر موجود در یک سری هندسی با افزایش عمق کاهش می یابد و به شما امکان می دهد احتمال رفتن از یک موقعیت رتبه معین را به I تا I 1+ مدل کنید.
منابع
[1] Regina J. Meszlenyi ، Petra Herma ، Krisztian Buza ، Viktor GAL و Zoltan Vidnyanszky. تجزیه و تحلیل اتصال عملکردی حالت FMRI با استفاده از پیچ و تاب زمان پویا. مرزها در علوم اعصاب ، 11 (فوریه): 1
[2] استن سالوادور و فیلیپ چان. FastDTW: به سمت پیچ و تاب دقیق زمان پویا در زمان و مکان خطی. تجزیه و تحلیل داده های هوشمند ، 11: 561
[3] ویلیام وببر ، آلیستر MO AT ، و جاستین زوبل. یک اندازه گیری شباهت برای رتبه بندی Inde Nite. معاملات ACM در سیستم های اطلاعاتی ، 28 (4): 1
پرسش و پاسخ بورس...
ما را در سایت پرسش و پاسخ بورس دنبال می کنید
برچسب :
نویسنده : ماندانا اصلانی
بازدید : <-PostHit->
تاريخ : پنجشنبه
19 مرداد
1402 ساعت: 20:34