moea_joint
108年
[統計資訊] 統計學、巨量資料概論
第 49 題
關於巨量資料中之資料庫,下列何者有誤?
- A HBase 技術提供非關聯式資料庫(NoSQL)之儲存環境
- B HBase 技術支援隨機存取功能
- C 無法直接透過SQL 來查詢 Hadoop 儲存之資料
- D Apache Hive 就是把 SQL 編譯成 Map Reduce,從而讀取和操作 Hadoop 上之資料
思路引導 VIP
我們都知道 Hadoop 主要是用來儲存與批次處理巨量資料的系統。如果你習慣使用傳統關聯式資料庫的查詢語法,有哪些 Hadoop 生態系工具能幫你轉換或達成類似的查詢功能呢?另外,HBase 的出現,又是為了解決 Hadoop 基礎檔案系統在「資料讀寫」上的什麼限制呢?
🤖
AI 詳解
AI 專屬家教
太棒了,你成功判斷出選項 (B)!這題考驗對巨量資料生態系的深入了解,具有很高的鑑別度。官方最終公告此題 (B) 或 (C) 皆給分,我們來為你釐清這題的命題瑕疵與爭議所在。 本題要求選出「有誤」的敘述。關於你選的選項 (B),HBase 雖然在應用層面提供了隨機讀寫的介面,但其底層架構 HDFS(Hadoop Distributed File System)本質上是為了「批次處理與循序讀寫」而設計的,並不擅長隨機存取。命題者可能基於底層機制的嚴格限制,將「支援隨機存取」視為錯誤敘述,因而給分。 至於選項 (C) 也是正確答案,因為隨著大數據技術的演進,現今已有 Apache Hive 或 Impala 等工具,允許使用者直接透過 SQL 語法查詢 Hadoop 上的資料。因此「無法直接透過 SQL 查詢」的說法已與現況不符,同樣屬於錯誤敘述。
▼ 還有更多解析內容