Excel 案例
30|Titanic-Logistic/Decision Tree 分類與模型比較
一、案例定位
以 Titanic 類型的 400 筆教材模擬乘客資料,比較 Logistic Regression 的機率分類與可解釋 Decision Tree 規則,重點不是歷史重現,而是模型選擇與評估。
二、學習目標
理解二元分類機率與 0.5 門檻。
比較 Logistic 與 Decision Tree 的分類思維。
使用 Accuracy、Precision、Recall 評估模型。
理解模型績效與可解釋性的 trade-off。
讓 AI 解釋模型,而不是把模型輸出當作事實。
三、案例情境
分析團隊要用艙等、性別、年齡、票價與是否獨行預測二元結果,並向非技術主管說明:哪個模型比較準、哪個比較容易解釋、門檻改變會發生什麼。
Excel 核心表格(Word 完整閱讀版)
下列內容直接整理自本案例對應的 Excel 工作簿。Word 版保留理解案例所需的核心輸入、計算結果與管理輸出;若原始資料筆數很大,正文列示代表性樣本,而模型結果與管理摘要則完整呈現。學生可先只閱讀 Word 完成案例理解,再到 Excel 修改參數與資料進行情境重算。
Excel表 30-1|乘客資料與分類代表性樣本
ID |
實際 |
機率 |
預測 |
正確? |
Female |
年齡 |
票價 |
獨行 |
說明 |
P001 |
0 |
58.85% |
1 |
N |
1 |
46 |
31.10 |
0 |
機率>=0.5 → 預測生存 |
P002 |
1 |
72.52% |
1 |
Y |
1 |
32 |
19.60 |
1 |
機率>=0.5 → 預測生存 |
P003 |
0 |
85.49% |
1 |
N |
1 |
19 |
95.40 |
0 |
機率>=0.5 → 預測生存 |
P004 |
0 |
39.86% |
0 |
Y |
0 |
15 |
104.80 |
1 |
機率>=0.5 → 預測生存 |
P005 |
1 |
77.22% |
1 |
Y |
1 |
44 |
75.30 |
0 |
機率>=0.5 → 預測生存 |
P006 |
1 |
89.78% |
1 |
Y |
1 |
1 |
68.30 |
0 |
機率>=0.5 → 預測生存 |
P007 |
1 |
66.59% |
1 |
Y |
1 |
31 |
25.90 |
0 |
機率>=0.5 → 預測生存 |
P008 |
1 |
71.11% |
1 |
Y |
1 |
40 |
23.50 |
0 |
機率>=0.5 → 預測生存 |
P009 |
1 |
84.12% |
1 |
Y |
1 |
19 |
71.80 |
1 |
機率>=0.5 → 預測生存 |
P010 |
0 |
77.03% |
1 |
N |
1 |
26 |
38.40 |
0 |
機率>=0.5 → 預測生存 |
註:此表列示代表性資料樣本,用來理解欄位與模型邏輯;完整資料保留於 Excel 工作簿供深入分析與 What-if 重算。
Excel表 30-2|Decision Tree 分類代表性樣本
ID |
性別 |
艙等 |
年齡 |
實際 |
預測 |
正確? |
命中規則 |
P001 |
Female |
3 |
46 |
0 |
0 |
Y |
預測不生存 |
P002 |
Female |
2 |
32 |
1 |
1 |
Y |
女性且艙等1-2 |
P003 |
Female |
1 |
19 |
0 |
1 |
N |
女性且艙等1-2 |
P004 |
Male |
1 |
15 |
0 |
1 |
N |
男性、1等艙且<18 |
P005 |
Female |
1 |
44 |
1 |
1 |
Y |
女性且艙等1-2 |
P006 |
Female |
1 |
1 |
1 |
1 |
Y |
女性且艙等1-2 |
P007 |
Female |
3 |
31 |
1 |
1 |
Y |
女性且年齡<35 |
P008 |
Female |
2 |
40 |
1 |
1 |
Y |
女性且艙等1-2 |
P009 |
Female |
1 |
19 |
1 |
1 |
Y |
女性且艙等1-2 |
P010 |
Female |
2 |
26 |
0 |
1 |
N |
女性且艙等1-2 |
註:此表列示代表性資料樣本,用來理解欄位與模型邏輯;完整資料保留於 Excel 工作簿供深入分析與 What-if 重算。
Excel表 30-3|Logistic 與 Decision Tree 模型比較
模型 |
Accuracy |
Precision |
Recall |
可解釋性 |
管理用途 |
Logistic |
0.74 |
74.64% |
75.73% |
中:可看係數與機率 |
風險排序、機率門檻 |
Decision Tree |
0.73 |
74.75% |
73.30% |
高:規則可直接閱讀 |
規則溝通、快速分類 |
Logistic係數(標準化) |
艙等 |
Female |
年齡 |
票價 |
|
係數 |
-0.326 |
216.62% |
-32.11% |
-0.001 |
四、主要結果
Logistic:Accuracy 74.2%、Precision 74.6%、Recall 75.7%。
Decision Tree:Accuracy 73.5%、Precision 74.8%、Recall 73.3%。
Excel 保留每筆 Logistic 機率與 Tree 命中規則,因此學生可直接比較『機率模型』與『規則模型』的可解釋性。
五、Excel 分析方法
Logistic 把特徵轉成 0–1 機率,再用門檻分類。
Decision Tree 用可閱讀條件逐步切分樣本。
模型比較不只看 Accuracy,也比較 Precision、Recall 與可解釋性。
六、主要結果與管理解讀
模型績效差距很小時,可解釋性與實際使用成本可能比單一 Accuracy 更重要。
若 false negative 成本較高,可以降低 Logistic 門檻提高 Recall,但通常會犧牲 Precision。
歷史資料中的關係可能包含制度與情境偏差,模型不能脫離資料生成背景解讀。
七、What-if 練習
把 Logistic 門檻由 0.5 改為 0.4 或 0.6;修改 Tree 規則,重新比較 Accuracy、Precision、Recall。
八、AI 分析 Prompt
你是分類模型解讀助理。根據 Logistic 與 Decision Tree 的 Accuracy、Precision、Recall、機率與規則,說明兩模型的優缺點與門檻 trade-off。不得把模型關係描述成生存原因,也不得把教材模擬資料當成真實 Titanic 統計。
九、Excel 與 AI 的分工
Excel:分類、機率、規則與績效指標。
AI:模型比較、錯誤成本、門檻與可解釋性。
十、課堂討論題
準確率高 1% 值得犧牲可解釋性嗎?
何時 Recall 比 Precision 重要?
分類模型中的歷史偏差會如何影響使用?
十一、資料說明
本案例為 Titanic-inspired 教材模擬資料,不是原始 Titanic dataset。