moea_joint
106年
[統計資訊] 統計學、巨量資料概論
第 41 題
有關巨量資料分析的平台環境建置之敘述,下列何者正確?
- A 傳統的關聯式資料庫管理系統無法處理巨量資料
- B NoSQL 資料庫系統已逐漸取代傳統的關聯式資料庫系統
- C Apache Hadoop 可用來建構資料湖(Data Lake)
- D Apache Spark 不適合用來處理串流(Streaming) 資料
思路引導 VIP
如果我們每天要儲存數百萬筆包含影片、文字等格式混亂的資料,你覺得要求嚴格表格格式的「傳統資料庫」會遇到什麼困難?相對地,專門為此設計的大資料平台應該具備哪些特性來收容這些資料呢?
🤖
AI 詳解
AI 專屬家教
恭喜你精準判斷出正確選項!這是一道評估巨量資料(Big Data)平台生態系熟悉度的好題,具備不錯的鑑別度。 需要特別注意的是,這題是官方公告的爭議題,(A) 與 (C) 皆給分。你選的 (A) 點出了大數據技術發展的動機:面對大容量與高度非結構化特性的巨量資料時,傳統關聯式資料庫管理系統(RDBMS)的確難以有效處理。同時,選項 (C) 也是正確的,因為 Apache Hadoop 憑藉其分散式檔案系統,正是業界建構**資料湖(Data Lake)**的底層主流技術。 另外兩個選項則有明顯的觀念錯誤:(B) 錯在 NoSQL 與傳統 RDBMS 在實務上是互補關係,並非完全取代;(D) 錯在 Apache Spark 具備專屬的串流模組(Spark Streaming),其實非常擅長處理串流資料。能釐清這些工具的各自定位,對未來的資料分析實務會非常有幫助喔!