2026 年 9 月・初步探索結果

換一個習慣,結果如何?

副露、防守備牌與提早做一色手。我們只改變一項決策規則,重播相同牌局,比較淨得分的變化。

首批樣本: 10 項比較・ 4,864 局模擬牌局

較大規模的評估尚未完成。 這些是小規模探索;結果能支持哪些解讀,取決於下方列出的樣本與實驗設計。

這批實驗尚未顯示哪種策略明顯較好。 區間跨越零,表示本次實驗尚未確定哪種策略較好,並不代表兩者效果相同。

先選對規則。

香港新章、國標(MCR)、日本立直與台灣會所分別測試。本批次不含台灣經典;會所結果不能直接套用至經典玩法。

10 項已完成的比較。分數採用各玩法自身的單位,不宜直接跨玩法排名。

多吃碰,真的更有利嗎?

重新檢查先前的副露實驗。其他決策皆由相同進階 AI 處理,只改變接受合法組牌副露的傾向。

香港麻雀

尚無明確結果
每手淨得分差-0.59
約 95% 區間-1.76 至 +0.58
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
進階 AI 原本的副露決策
受測改變
接受優先序最高的合法組牌副露;其他決策仍用相同進階 AI
平均每手淨得分
0.32 對照組 → -0.27 實驗組
胡牌率
26.6% → 24.6%
打出他人胡牌張的比率
14.5% → 11.3%
試驗策略的實際行為
665 次符合條件的決策;其中 540 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
158 / 256 配對牌局
下載配對結果(JSONL)

國標麻將

尚無明確結果
每手淨得分差+1.83
約 95% 區間-1.56 至 +5.22
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
進階 AI 原本的副露決策
受測改變
接受優先序最高的合法組牌副露;其他決策仍用相同進階 AI
平均每手淨得分
-0.37 對照組 → 1.46 實驗組
胡牌率
20.3% → 25.0%
打出他人胡牌張的比率
11.3% → 12.5%
試驗策略的實際行為
706 次符合條件的決策;其中 569 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
197 / 256 配對牌局
下載配對結果(JSONL)

應該參考誰的捨牌?

兩組在相同條件下轉守,分別比較使用全桌捨牌歷史,以及針對有威脅對手的估計方式。

日本立直麻將

模型診斷
每手淨得分差+52.73
約 95% 區間-37.73 至 +143.2
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
依全桌合併捨牌紀錄防守
受測改變
觸發條件相同,改按有威脅的對手排列捨牌選擇
平均每手淨得分
-226.17 對照組 → -173.44 實驗組
胡牌率
17.2% → 17.6%
打出他人胡牌張的比率
14.1% → 11.7%
試驗策略的實際行為
711 次符合條件的決策;其中 437 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
23 / 256 配對牌局
下載配對結果(JSONL)

香港麻雀

尚無明確結果
每手淨得分差+0.03
約 95% 區間-0.16 至 +0.22
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
依全桌合併捨牌紀錄防守
受測改變
觸發條件相同,改按有威脅的對手排列捨牌選擇
平均每手淨得分
-0.11 對照組 → -0.07 實驗組
胡牌率
20.3% → 20.3%
打出他人胡牌張的比率
12.1% → 11.3%
試驗策略的實際行為
609 次符合條件的決策;其中 386 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
20 / 256 配對牌局
下載配對結果(JSONL)

保留防守牌,值得放慢速度嗎?

在立直模型中,我們測試保留一張至少兩家曾打過的牌;接近聽牌或有人立直時,解除這項保留。

日本立直麻將

模型診斷
每手淨得分差-42.97
約 95% 區間-140.84 至 +54.9
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
進階 AI 原本的捨牌
受測改變
自己捨牌六次後,若只有一張牌至少兩家曾打過,便優先保留;接近聽牌或出現立直宣告時解除
平均每手淨得分
-29.3 對照組 → -72.27 實驗組
胡牌率
19.1% → 18.4%
打出他人胡牌張的比率
17.2% → 17.6%
試驗策略的實際行為
117 次符合條件的決策;其中 117 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
14 / 256 配對牌局
下載配對結果(JSONL)

什麼時候值得偏向一種花色?

若起手某花色很多,我們測試早期優先捨棄其他花色。只改變捨牌偏好,不強迫每次副露都配合一色手。

香港麻雀

尚無明確結果
每手淨得分差+1.03
約 95% 區間-0.94 至 +3
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
進階 AI 原本較靈活的捨牌
受測改變
首次決策時某花色至少八張,容許模型估計的成牌距離最多增加一級,優先打其他花色;副露或宣告後停止
平均每手淨得分
-0.69 對照組 → 0.34 實驗組
胡牌率
16.8% → 16.4%
打出他人胡牌張的比率
16.8% → 16.0%
試驗策略的實際行為
46 次符合條件的決策;其中 46 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
7 / 256 配對牌局
下載配對結果(JSONL)

台灣麻將・Hé Fēn 會所規則

尚無明確結果
每手淨得分差+0.04
約 95% 區間-0.04 至 +0.12
配對牌局128

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
進階 AI 原本較靈活的捨牌
受測改變
首次決策時某花色至少十張,容許模型估計的成牌距離最多增加一級,優先打其他花色;副露或宣告後停止
平均每手淨得分
-0.49 對照組 → -0.45 實驗組
胡牌率
14.1% → 14.1%
打出他人胡牌張的比率
13.3% → 13.3%
試驗策略的實際行為
10 次符合條件的決策;其中 10 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
1 / 128 配對牌局
下載配對結果(JSONL)

碰出役字刻子,還是維持門清?

門清時,接受或放過符合條件的三元牌、自風或圈風碰牌機會;其他決策仍由相同進階 AI 處理。

日本立直麻將

模型診斷
每手淨得分差-50.39
約 95% 區間-153.33 至 +52.55
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
門清時放過符合條件的役字碰牌
受測改變
門清時接受符合條件的三元、自風或圈風碰牌;其餘仍用相同進階 AI
平均每手淨得分
41.02 對照組 → -9.38 實驗組
胡牌率
24.6% → 23.8%
打出他人胡牌張的比率
12.1% → 13.7%
試驗策略的實際行為
41 次符合條件的決策;其中 9 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
31 / 256 配對牌局
下載配對結果(JSONL)

香港麻雀

尚無明確結果
每手淨得分差-0.11
約 95% 區間-1.05 至 +0.83
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
門清時放過符合條件的役字碰牌
受測改變
門清時接受符合條件的三元、自風或圈風碰牌;其餘仍用相同進階 AI
平均每手淨得分
-0.12 對照組 → -0.23 實驗組
胡牌率
22.7% → 19.1%
打出他人胡牌張的比率
11.7% → 13.3%
試驗策略的實際行為
45 次符合條件的決策;其中 22 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
35 / 256 配對牌局
下載配對結果(JSONL)

國標麻將

尚無明確結果
每手淨得分差-0.65
約 95% 區間-2.17 至 +0.87
配對牌局256

試驗組減去對照組。正值偏向支持受測改變,負值偏向支持對照策略。

確切比較方式與數據
對照組
門清時放過符合條件的役字碰牌
受測改變
門清時接受符合條件的三元、自風或圈風碰牌;其餘仍用相同進階 AI
平均每手淨得分
0.19 對照組 → -0.46 實驗組
胡牌率
22.3% → 20.7%
打出他人胡牌張的比率
12.1% → 12.9%
試驗策略的實際行為
53 次符合條件的決策;其中 17 次與預設 AI 的選擇不同。這裡計算的是決策次數,並非牌局數。
淨結果不同
48 / 256 配對牌局
下載配對結果(JSONL)

如何閱讀這些測試

每對牌局使用相同發牌種子、受測座位與圈風,受測者輪流坐四個位置,對上三名策略不變的進階對手。每手策略重新開始。台灣會所均衡採東南西北圈,其他比較使用東圈。

主要結果是受測者每手結算後的淨得分,包含自動支付與立直供託。各手彼此獨立,不模擬整場名次、本場數、未來尚未領取的供託棒或人工桌面支付。

樣本數事先固定:一般每項 256 對,台灣會所每項 128 對。區間依配對分數差的變異以常態近似估算,屬探索性結果,未對十項比較進行多重比較校正。罕見高價值手牌可能使小樣本結果不穩定。

四次執行記錄了錯誤的軟體版本,已按原定牌局重跑。原始紀錄與排除原因見下方連結;沒有因結果不利而排除資料。

進一步了解研究方法 · 提出下一個研究問題