چکیده
1- مقدمه
2- کار مرتبط
3- بهره برداری از Kمیانگین با استفاده از MapReduce
4- آزمایشات و نتایج
5- نتیجه گیری
منابع
چکیده
تحلیل خوشه بندی یکی از رایج ترین الگوریتم های پردازش داده استفاده شده می باشد. بیش از نیم قرن، K میانگین به دلیل سادگی رایج ترین الگوریتم خوشه بندی باقی مانده است. اخیرا، با افزایش حجم داده ها، برخی محققان به MapReduce برای دستیابی به عملکرد بالا گرایش پیدا کرده اند. اما، MapReduce برای الگوریتم های تکراری مربوط به زمان های تکراری بازشروع کارها، خوانش داده های بزرگ و برهم زدن آن ها مناسب نیست. در این مقاله، ما مشکلات پردازش داده های مقیاس بزرگ را با استفاده از الگوریتم خوشه بندی K میانگین حل می کنیم و یک مدل پردازش جدید را در MapReduce برای حذف وابستگی تکراری و به دست آوردن عملکرد بالا ارائه می کنیم. ما ایده های خودمان را تحلیل و پیاده سازی می کنیم. آزمایشات گسترده در خوشه ما نشان می دهند که روش های پیشنهادی ما موثر، پویا و مقیاس پذیر هستند.
بهره برداری از K میانگین با استفاده از MapReduce
مسائل تحقیقاتی اصلی برای خوشه بندی داده های بزرگ با MapReduce عبارتند از: (a) چگونه کمینه کردن هزینه I/O؛ (b) چگونه کمینه کردن هزینه شبکه میان گره های پردازشی. در این بخش، ما پیاده سازی بهینه-سازی Kمیانگین خودمان را با استفاده از MapReduce ارائه می کنیم، که می تواند هزینه I/O و هزینه شبکه را کاهش دهد.
آزمایشات و نتایج
به منظور ارزیابی عملکرد الگوریتم خودمان در عمل، ما ستاپ تجربی را برای ارزیابی ارائه می کنیم. ما خوشه ای از 16 ماشین PC سرور را راه اندازی می کنیم، هر کدام از آن ها یک CPU 2 گیگاهرتز AMD دو هسته ای، یک هارد درایو 73 گیگابایتی، کنترلر اینترنت Mbps اینتر 82551 10/100، حافظه 2 گیگابایتی و سرور OS اوبونتو 10.10 دارند. تمام گره ها به یک سوییچ اینترنت 100 Mbps متصل می شوند. ما از یک هادوپ کلودرا 0.20.2 استفاده کرده و کدهای منبع تحت JDK 1.6.0-24 در ECLIPSE 3.6.2را کامپایل می کنیم. یک پشت برنامه TaskTracker و DataNode در هر برده اجرا می شوند. یک NameNode و JobTracker در ارباب اجرا می شوند.