عوامل مؤثر بر پیش بینی سهام مبتنی بر استخراج متن: نمایش ویژگی های متن ، مدل های یادگیری ماشین و سیستم عامل های خبری

ساخت وبلاگ

تکنیک های معدنکاری متن اثربخشی خود را برای پیش بینی بازار سهام و رویکردهای مختلف بازنمایی ویژگی های متن نشان داده اند ، (به عنوان مثال ، T F-IDF و تعبیه کلمه) ، برای استخراج اطلاعات متنی از منابع خبری مالی سازگار شده اند. علاوه بر این ، تکنیک های مختلف یادگیری ماشین از جمله یادگیری عمیق برای ساخت مدل های پیش بینی استفاده شده است. ترکیب های مختلفی از نمایش های ویژگی های متن و مدل های یادگیری برای پیش بینی سهام اعمال شده است ، اما ناشناخته است که بهترین عملکرد را انجام می دهد یا کدام یک را می توان به عنوان خط مقدماتی برای تحقیقات آینده در نظر گرفت. علاوه بر این ، از آنجا که محتوای متنی در مقالات خبری مالی منتشر شده بر روی سیستم عامل های مختلف خبری تا حدودی متفاوت است ، تأثیر استفاده از سیستم عامل های خبری مختلف ممکن است در عملکرد پیش بینی تأثیر داشته باشد ، بنابراین این در آزمایشات با مقایسه هشت ترکیب مختلف شامل دو زمینه نیز مورد بررسی قرار می گیردنمایشگاه ویژگی های متن متنی و دو متنی ، یعنی T F-IDF ، Word2VEC ، ELMO و BERT و سه روش یادگیری ، یعنی SVM ، CNN و LSTM. نتایج تجربی نشان می دهد که CNN+WORD2VEC و CNN+BERT بهترین عملکرد را دارند. مطالب متنی از سه بستر خبری عمومی از جمله رویترز ، CNBC و Motley Fool گرفته شده است. ما دریافتیم که مدل های یادگیری ساخته شده و سیستم عامل های خبری مورد استفاده مطمئناً می توانند بر پیش بینی قیمت سهام بین شرکت های مختلف تأثیر بگذارند.

معرفی

پیش بینی سهام مدتهاست که به عنوان یک مشکل تحقیقاتی بسیار جالب و مهم در امور مالی ، اقتصادی ، فناوری اطلاعات و غیره در نظر گرفته شده است. یکی از اهداف اصلی تهیه مدلهای پیش بینی مؤثر است ، که می تواند به درستی پیش بینی کند که آیا قیمت سهام آینده افزایش می یابد یا سقوط می کند [1][2] ، [3].

برای دستیابی به این هدف ، بسته به ویژگی های ورودی مورد استفاده برای توسعه مدل های پیش بینی ، سه نوع روش وجود دارد. اولین روش ، اولین روش ، مبتنی بر استخراج شاخص های مرتبط از طریق تجزیه و تحلیل اساسی و فنی با سابق است که مربوط به این شرکت است که سهام را بر خلاف سهام واقعی و دومی با تمرکز بر پیش بینی قیمت آینده می فروشد. از قیمت سهام گذشته و حال [4]. نوع دوم روش مبتنی بر کاربرد تکنیک های استخراج متن برای استخراج ویژگی های متنی از اخبار مالی یا توییت است. به طور خاص ، از تکنیک های پردازش زبان طبیعی برای تجزیه و تحلیل معنایی ، احساسات و/یا رویداد شرح داده شده در متون استفاده می شود [5] ، [6]. نوع سوم روش بر تولید نمودارهای شمعدانی برای استخراج ویژگی های تصویر (سطح پایین یا بصری) برای تسهیل پیش بینی حرکات سهام [7] ، [8] ، [9] متمرکز شده است.

در این مقاله ، ما بر روی نوع دوم روش بر اساس استفاده از اخبار مالی تمرکز می کنیم. در ادبیات ، استخراج ویژگی های متنی از اخبار مالی یا توییت ها معمولاً از طریق تکنیک فرکانس فرکانس - فرکانس سند (T F-IDF) تکنیک انجام می شود. این تعداد دفعاتی را که یک اصطلاح در یک سند رخ می دهد محاسبه می کند و بین وزن اصطلاحاتی که اغلب در مجموعه سند اتفاق می افتد و وزن اصطلاحاتی که به ندرت رخ می دهد ، متمایز می شود [10]. رویکرد دیگر مبتنی بر مدل کیسه های کلمه (کمان) است ، جایی که یک سند به عنوان کیسه کلمات نشان داده می شود ، که در آن فرکانس وقوع هر کلمه برای کیف محاسبه می شود [11]. رویکردهای بازنمایی ویژگی T F-IDF و Bow Text به طور گسترده ای برای ساخت مدل های پیش بینی قیمت سهام در ترکیب با دستگاه بردار پشتیبانی (SVM) یا با یادگیری چندین هسته (MKL) [12] ، [13] ، [14] ، [[14] ، [14] ، [14] ، [14] ، [14] ، [14] ، [14]15] ، [16] ، [17] ، [18] ، [19] ، [20].

متفاوت از تکنیک های یادگیری ماشین "سنتی" ، مانند SVM ، تکنیک های یادگیری عمیق ، مانند شبکه های عصبی Convolutional (CNN) ، شبکه های عصبی مکرر (RNN) و حافظه کوتاه مدت طولانی (LSTM) نیز برای پیش بینی استفاده شده استقیمت سهام در سالهای اخیر (دینگ و همکاران 2015 ؛ [13] ، [15] ، [16] ، [21] ، [22] ، [23] ، [24] ، [25] ، [26] ، [27] ، [28] ، [29]). به طور خاص ، بازنمایی ویژگی های متن برای ساخت مدل های یادگیری عمیق بر اساس برخی از روش های جاسازی متن مانند کلمه ، جمله و تعبیه رویداد است که هدف آنها ترجمه یک بردار با ابعاد بالا به یک فضای کم بعدی است. یعنی یک جاسازی با قرار دادن ورودی های معنایی مشابه در نزدیکی در فضای تعبیه ، معناشناسی خاصی از ورودی را ضبط می کند [30].

بنابراین ، بسته به روش های نمایش ویژگی متن مورد استفاده ، مدل های یادگیری ساخته شده می توانند متفاوت باشند. این چندین سؤال بی پاسخ را ایجاد می کند که هرگز به طور کامل مورد بررسی قرار نگرفته است. اول ، از آنجا که تعدادی از روشهای مختلف نمایش ویژگی های متن متن وجود دارد که باید برای پردازش ورودی ها ، چه برای یادگیری ماشین سنتی یا تکنیک های یادگیری عمیق ، استفاده شود ، اولین سؤال این است: کدام روش نمایش ویژگی خاص متن همراه با یک مدل یادگیریاز نظر پیش بینی سهام بهترین است؟

دوم ، از آنجا که نتایج نمایندگی از ویژگی های متن کاملاً به محتوای متنی مقالات خبری وابسته است ، و سیستم عامل های خبری مختلف ممکن است از زبان مختلفی برای توصیف همان مسئله برای همان شرکت در همان روز استفاده کنند (C. F. شکل 10)، همان ترکیبی از نمایش های ویژگی های متن و مدل های یادگیری ممکن است در هنگام استفاده از مقالات خبری جمع آوری شده از سیستم عامل های مختلف ، متفاوت عمل کند. بنابراین ، سؤال دوم که در این مطالعه مورد توجه قرار گرفته است این است: آیا مقالات خبری جمع آوری شده از سیستم عامل های مختلف بر عملکرد مدل های پیش بینی سهام تأثیر می گذارد؟

برای پاسخ به این دو سؤال ، چهار بازنمایی ویژگی های مختلف متن مقایسه شده است ، که عبارتند از TF-IDF ، WORD2VEC ، ELMO و BERT ، دو روش اول روش بازنمایی بدون متن و دو روش دوم روشهای بازنمایی متنی هستند (C. F. بخش 2. 1). برای مدل های یادگیری ، یک تکنیک یادگیری ماشین سنتی ، SVM و دو روش یادگیری عمیق محبوب ، CNN و LSTM ، به کار می رود. سرانجام ، مقالات خبری از رویترز ، CNBC و ، Motley Fool برای مقایسه عملکرد جمع آوری می شود. به طور خاص ، ما مقالات خبری مربوط به چهار شرکت را انتخاب کردیم ، یعنی اپل ، تویوتا ، شورون و بانک آمریکا ، متعلق به فناوری اطلاعات ، صنایع اختیاری ، انرژی و مالی مصرف کننده به ترتیب در نظر گرفته شده است.

بقیه این مقاله به شرح زیر سازماندهی شده است. بخش 2 مروری بر روشهای نمایش ویژگی متن و تکنیک های یادگیری مورد استفاده در این مقاله ارائه می دهد. علاوه بر این ، مقایسه آثار مرتبط از نظر ویژگی های متنی استخراج شده ، مدل های یادگیری ساخته شده ، سیستم عامل های خبری منتخب و غیره ارائه شده است. بخش 3 روشهای تجربی را برای پاسخ به دو سؤال تحقیق توصیف می کند. بخش 4 نتایج تجربی را ارائه می دهد و بخش 5 مقاله را نتیجه می گیرد.

قطعه قطعه

تعظیم

مدل کمان یک رویکرد نمایشی گسترده برای طبقه بندی اسناد است که در آن یک متن به عنوان کیسه ای از کلمات نشان داده می شود. از اقدامات مختلفی می توان برای توصیف و تبدیل متن استفاده کرد ، که متداول ترین آنها بر اساس فرکانس هر کلمه است ، یعنی تعداد دفعاتی که یک اصطلاح در متن ظاهر می شود [31].

از آنجا که مدل کمان ترتیب اصطلاحات را در نظر نمی گیرد ، از مدل های N-Gram اغلب برای نشان دادن اطلاعات مکانی استفاده می شود ، با مدل Bigram که معمولاً برای تجزیه و تحلیل استفاده می شود

روش پیش بینی سهام مبتنی بر استخراج متن

به طور کلی ، سه مرحله برای ساخت یک مدل پیش بینی سهام مبتنی بر استخراج متن وجود دارد. مورد اول بازیابی و جمع آوری داده ها است که بر جمع آوری اخبار مالی هدف از سیستم عامل های خبری خاص و همچنین قیمت سهام مربوط به آنها متمرکز است. مورد دوم ، مرحله پیش پردازش داده ها با تکنیک های مرتبط NLP است. یعنی ، اطلاعات مهم متنی از اخبار مالی جمع آوری شده برای نمایندگی ویژگی خاص متن استخراج می شود. مؤلفه نهایی این است که

مطالعه I: ترکیبی از نمایش های ویژگی های متن و مدل های یادگیری

شکل 5 ، شکل 6 ، شکل 7. CNN + BERT ، LSTM + WORD2VEC ، LSTM + ELMO و LSTM + BERT برای اپل ، تویوتا ، شورون و بانک آمریکا.

برای SVM ، T F-IDF یک روش بازنمایی ویژگی بهتر از Word2VEC است. از طرف دیگر ، برای تکنیک های یادگیری عمیق ، مهم نیست که از روش نمایش ویژگی متن استفاده شده است ، CNN

نتیجه

در این مقاله ، ترکیبی از روشهای مختلف نمایش ویژگی های متن با مدل های مختلف یادگیری به منظور یافتن بهترین ترکیب برای پیش بینی سهام مبتنی بر معدن متن مقایسه می شود. به طور خاص ، دو روش نمایش ویژگی های متن متن و دو متنی ، یعنی TF-IDF ، Word2VEC ، ELMO و BERT ، برای تولید ورودی برای یادگیری ماشین سنتی و مدلهای یادگیری عمیق ، یعنی SVM ، CNN و LSTM استفاده می شود.، که منجر به هشت ترکیب مختلف می شود

بیانیه مشارکت در نویسندگی اعتباری

Wei-Chao Lin: مفهوم سازی ، روش شناسی ، نوشتن-پیش نویس اصلی ، نوشتن-بررسی و ویرایش ، کسب بودجه. Chih-fong Tsai: مفهوم سازی ، روش شناسی ، نوشتن-پیش نویس اصلی ، نوشتن-بررسی و ویرایش. Hsuan Chen: نرم افزار ، اعتبار سنجی ، منابع ، درمان داده ها.

اعلام علاقه رقیب

نویسندگان اعلام می كنند كه آنها هیچ منافع مالی رقیب یا روابط شخصی را كه به نظر می رسد بر اثر گزارش شده در این مقاله تأثیر می گذارد ، ندارند.

تصدیق

این مطالعه تا حدودی توسط وزارت علوم و فناوری تایوان تحت گرانت بیشترین 109-2410-H-182-012 و بخشی از بیمارستان یادبود چانگ گونگ در Linkou ، تحت Grant BMRPH13 و CMRPG3J0732 پشتیبانی شده است.

پرسش و پاسخ بورس...
ما را در سایت پرسش و پاسخ بورس دنبال می کنید

برچسب : نویسنده : ماندانا اصلانی بازدید : <-PostHit-> تاريخ : پنجشنبه 19 مرداد 1402 ساعت: 20:32