30|Titanic-Logistic/Decision Tree 分類與模型比較

一、案例定位

以 Titanic 類型的 400 筆教材模擬乘客資料,比較 Logistic Regression 的機率分類與可解釋 Decision Tree 規則,重點不是歷史重現,而是模型選擇與評估。

二、學習目標

理解二元分類機率與 0.5 門檻。

比較 Logistic 與 Decision Tree 的分類思維。

使用 Accuracy、Precision、Recall 評估模型。

理解模型績效與可解釋性的 trade-off。

讓 AI 解釋模型,而不是把模型輸出當作事實。

三、案例情境

分析團隊要用艙等、性別、年齡、票價與是否獨行預測二元結果,並向非技術主管說明:哪個模型比較準、哪個比較容易解釋、門檻改變會發生什麼。

Excel 核心表格(Word 完整閱讀版)

下列內容直接整理自本案例對應的 Excel 工作簿。Word 版保留理解案例所需的核心輸入、計算結果與管理輸出;若原始資料筆數很大,正文列示代表性樣本,而模型結果與管理摘要則完整呈現。學生可先只閱讀 Word 完成案例理解,再到 Excel 修改參數與資料進行情境重算。

Excel表 30-1|乘客資料與分類代表性樣本

ID

實際

機率

預測

正確?

Female

年齡

票價

獨行

說明

P001

0

58.85%

1

N

1

46

31.10

0

機率>=0.5 → 預測生存

P002

1

72.52%

1

Y

1

32

19.60

1

機率>=0.5 → 預測生存

P003

0

85.49%

1

N

1

19

95.40

0

機率>=0.5 → 預測生存

P004

0

39.86%

0

Y

0

15

104.80

1

機率>=0.5 → 預測生存

P005

1

77.22%

1

Y

1

44

75.30

0

機率>=0.5 → 預測生存

P006

1

89.78%

1

Y

1

1

68.30

0

機率>=0.5 → 預測生存

P007

1

66.59%

1

Y

1

31

25.90

0

機率>=0.5 → 預測生存

P008

1

71.11%

1

Y

1

40

23.50

0

機率>=0.5 → 預測生存

P009

1

84.12%

1

Y

1

19

71.80

1

機率>=0.5 → 預測生存

P010

0

77.03%

1

N

1

26

38.40

0

機率>=0.5 → 預測生存

註:此表列示代表性資料樣本,用來理解欄位與模型邏輯;完整資料保留於 Excel 工作簿供深入分析與 What-if 重算。

Excel表 30-2|Decision Tree 分類代表性樣本

ID

性別

艙等

年齡

實際

預測

正確?

命中規則

P001

Female

3

46

0

0

Y

預測不生存

P002

Female

2

32

1

1

Y

女性且艙等1-2

P003

Female

1

19

0

1

N

女性且艙等1-2

P004

Male

1

15

0

1

N

男性、1等艙且<18

P005

Female

1

44

1

1

Y

女性且艙等1-2

P006

Female

1

1

1

1

Y

女性且艙等1-2

P007

Female

3

31

1

1

Y

女性且年齡<35

P008

Female

2

40

1

1

Y

女性且艙等1-2

P009

Female

1

19

1

1

Y

女性且艙等1-2

P010

Female

2

26

0

1

N

女性且艙等1-2

註:此表列示代表性資料樣本,用來理解欄位與模型邏輯;完整資料保留於 Excel 工作簿供深入分析與 What-if 重算。

Excel表 30-3|Logistic 與 Decision Tree 模型比較

模型

Accuracy

Precision

Recall

可解釋性

管理用途

Logistic

0.74

74.64%

75.73%

中:可看係數與機率

風險排序、機率門檻

Decision Tree

0.73

74.75%

73.30%

高:規則可直接閱讀

規則溝通、快速分類

Logistic係數(標準化)

艙等

Female

年齡

票價

係數

-0.326

216.62%

-32.11%

-0.001

四、主要結果

Logistic:Accuracy 74.2%、Precision 74.6%、Recall 75.7%。

Decision Tree:Accuracy 73.5%、Precision 74.8%、Recall 73.3%。

Excel 保留每筆 Logistic 機率與 Tree 命中規則,因此學生可直接比較『機率模型』與『規則模型』的可解釋性。

五、Excel 分析方法

Logistic 把特徵轉成 0–1 機率,再用門檻分類。

Decision Tree 用可閱讀條件逐步切分樣本。

模型比較不只看 Accuracy,也比較 Precision、Recall 與可解釋性。

六、主要結果與管理解讀

模型績效差距很小時,可解釋性與實際使用成本可能比單一 Accuracy 更重要。

若 false negative 成本較高,可以降低 Logistic 門檻提高 Recall,但通常會犧牲 Precision。

歷史資料中的關係可能包含制度與情境偏差,模型不能脫離資料生成背景解讀。

七、What-if 練習

把 Logistic 門檻由 0.5 改為 0.4 或 0.6;修改 Tree 規則,重新比較 Accuracy、Precision、Recall。

八、AI 分析 Prompt

你是分類模型解讀助理。根據 Logistic 與 Decision Tree 的 Accuracy、Precision、Recall、機率與規則,說明兩模型的優缺點與門檻 trade-off。不得把模型關係描述成生存原因,也不得把教材模擬資料當成真實 Titanic 統計。

九、Excel 與 AI 的分工

Excel:分類、機率、規則與績效指標。

AI:模型比較、錯誤成本、門檻與可解釋性。

十、課堂討論題

準確率高 1% 值得犧牲可解釋性嗎?

何時 Recall 比 Precision 重要?

分類模型中的歷史偏差會如何影響使用?

十一、資料說明

本案例為 Titanic-inspired 教材模擬資料,不是原始 Titanic dataset。