蜕变中的巨量数据分析平台与应用实务
巨量数据虽然是一座宝山,但并非有数据,就能产生价值。大同世界科技业务营运中心技术工程处处长张文祥指出,巨量数据的分析与应用,必须透过很多生态系统搭配组合,才能产生用户所需要的信息。
事实上,国际顾问研究机构Gartner在2015年所提出的十大策略性技术与趋势,其中「无所不在隐于无形进阶数据分析」(Pervasive ad Invisible Analytics;Advanced)高居第四名,就可看出巨量数据分析的重要性。
但张文祥也指出,任何新创技术的成熟度都非一蹴可及,而是要经历科技诞生的促动期、过高期望的尖峰期、泡沬化的谷底期、稳健成长的光明期及实质生产的高峰期,许多新创技术在促动期就可能失败,尖峰期则是发展的临界点,如果能够熬过谷底期,才能步入光明期及高峰期,而数据分析技术,目前正是已经步入谷底期及光明期的临界点。
要掌握巨量数据分析的发展趋势,张文祥认为,首先要先了解巨量数据的核心,也就是「数据」的本质,如那些数据有助于解决特定的问题;如何、多久及何处取得数据;数据保存的型态及时间;数据要如何萃取;数据要如何藉由视觉化图表或整合式数据予以呈现等。
了解何谓「数据」后,接下来就得了解巨量数据的三大特性,思考其应用特性。包括数据量的规模(Volume):通常是以TB、PB等级的数据量为基本单位;数据异动的速度(Velocity):数据的时效性一旦错过,可能就不具任何价值,在金融交易领域尤其明显;多样性(Variety):数据可能有各种型式,包括文字、影音、图像、网页、串流。
巨量数据的分析应用与传统的关联式数据库结构化数据分析相较,超大量的半结构化?非结构化数据的储存及分析,很容易造成其效能瓶颈。但若能根据数据特性,建构使用合适的数据分析平台及分析工具,将能以最佳的性价比提供最具深度的数据分析,以洞悉信息发挥其最大的价值。
巨量数据时代之所以到来,其与物联网(Internet of Things;IoT)及云端运算的推波助澜有相当密切的关系。张文祥引述Gartner的数据指出,不包含PC、平板及智能手机在内的物联网装置用户数,将于2020年成长至260亿台,物联网产品与服务供应商将创造逾3,000亿美元的边际收益,且绝大部分在服务领域,其各类终端市场的销售业绩,将为全球带来1.9万亿美元的经济附加价值。
结合云端运算无远弗界、随取随用的服务特性以及搭配巨量数据的探勘、分析与整合技术,让业者得以大规模蒐集、传递、储存及分析数据,以延伸更多深入应用,进而迅速扩大物联网的规模及应用。但在此同时,其也间接深化推动云端运算与巨量数据分析的应用发展,3者共生共荣,缺一不可。
张文祥指出,根据国外针对巨量数据解决方案所形成的生态系统的分析结果观察,单单在数据架构平台(Infrastructure)、分析管理工具(Analytics)、跨数据平台?分析工具(Cross Infra/Analytics)、数据应用软件(Application)、数据来源(Data Source)、开放技术(Open Source)等几大类,就至少超过350家相关业者。
正由于巨量数据扮演如此重要角色,因此如何针对应用信息服务并掌握其中核心技术,对于企业而言,将会是改变未来的关键力量。
张文祥认为,新一代企业数据中心必须在兼具成本优势,且快速满足对RPO与RTO需求的前提下,能充分因应云端服务伴随而来的巨量数据成长挑战。考量数据应用于不同情境下,成长量、效能、服务等级及成本效益需求各有不同,其实很难用单一架构来满足所有的数据储存的需求。因此采用混合式数据储存(Hybrid Storage)将会是其中的关键应用。
至于新一代企业储存架构平台该采用何种储存技术,张文祥认为,融合式数据储存(Converged Storage)、云端储存(Cloud Storage)及水平扩充式储存(Scale-out Storage)相当值得关注。
它们的共同点是藉由无远弗届的网络力量,打破数据处理与储存的樊篱,采用分散式架构,支持上千个节点及Petabyte等级的数据量,并可搭配开放原始码软件框架(Framework),不但拥有储存与处理大量数据的能力,还可藉由平行分散档案的处理,得到快速的回应,充分满足大量数据分散式储存与分析应用之需求。
其实传统储存系统、融合储存、云端储存及水平扩充储存各有擅长,企业若能善用混合数据储存技术及平台特性,透过软件定义架构(Software-Defined Architecture),消弭不同应用平台间的差异,将可提升快速回应与增加数据中心弹性,大幅缩小部署时间,并可藉由ITaaS(IT as a Service)及随选服务(On-demand Service),将可大幅提升使用弹性,成为企业可靠的数据储存平台。
张文祥指出,企业若能针对商业智能应用,善用前述技术建立新一代数据中心分析平台,就能打通巨量数据分析的任督二脉,轻松驾驭巨量数据分析,细致打造高效率企业数据中心数据平台。