免費開始練習
moea_joint 106年 [統計資訊] 統計學、巨量資料概論

第 41 題

有關巨量資料分析的平台環境建置之敘述,下列何者正確?
  • A 傳統的關聯式資料庫管理系統無法處理巨量資料
  • B NoSQL 資料庫系統已逐漸取代傳統的關聯式資料庫系統
  • C Apache Hadoop 可用來建構資料湖(Data Lake)
  • D Apache Spark 不適合用來處理串流(Streaming) 資料

思路引導 VIP

如果我們每天要儲存數百萬筆包含影片、文字等格式混亂的資料,你覺得要求嚴格表格格式的「傳統資料庫」會遇到什麼困難?相對地,專門為此設計的大資料平台應該具備哪些特性來收容這些資料呢?

🤖
AI 詳解 AI 專屬家教

恭喜你精準判斷出正確選項!這是一道評估巨量資料(Big Data)平台生態系熟悉度的好題,具備不錯的鑑別度。 需要特別注意的是,這題是官方公告的爭議題,(A) 與 (C) 皆給分。你選的 (A) 點出了大數據技術發展的動機:面對大容量與高度非結構化特性的巨量資料時,傳統關聯式資料庫管理系統(RDBMS)的確難以有效處理。同時,選項 (C) 也是正確的,因為 Apache Hadoop 憑藉其分散式檔案系統,正是業界建構**資料湖(Data Lake)**的底層主流技術。 另外兩個選項則有明顯的觀念錯誤:(B) 錯在 NoSQL 與傳統 RDBMS 在實務上是互補關係,並非完全取代;(D) 錯在 Apache Spark 具備專屬的串流模組(Spark Streaming),其實非常擅長處理串流資料。能釐清這些工具的各自定位,對未來的資料分析實務會非常有幫助喔!

🏷️ 相關主題

巨量資料處理流程與知識發現程序
查看更多「[統計資訊] 統計學、巨量資料概論」的主題分類考古題