覆蓋率門檻 85% 對一個初學者的日文基準線在數學上不可能達到,而且寫什麼內容都一樣。
機制
vocab_baseline.knows() 只對 evidence_words(他真的在卷子上勾過的詞)回 p = 1.0。
其餘 known_words 是 score() 展開出來的估計,走的是該頻段的 corrected。
2026-09-04 那一場日文階梯測驗:
evidence_words 6 個(かさ さいきん きょう ふゆ やくそく さいふ)
known_words 135 個(展開估計)
f1 corrected 0.625 f2 corrected 0.125 f3/f4 沒走到 → unrated
所以一篇日文故事裡,每一個他沒被親自考過的詞,上限就是 0.625。
實測
新寫的 8 課北海道課程,故事刻意只用 f1 的詞 + 5 個當課教過的新詞:
| 課 |
詞塊 |
覆蓋率 |
不認得的詞 |
| kuukou-touchaku |
36 |
64.1% |
0 |
| onsen-hairikata |
40 |
63.7% |
0 |
| michi-o-kikimasu |
39 |
62.5% |
0 |
| yukimichi-unten |
40 |
63.7% |
0 |
| yakkyoku-kaze |
38 |
62.5% |
0 |
| shokudou-chuumon |
36 |
63.7% |
0 |
| omiyage-erabi |
40 |
63.7% |
0 |
| rentacar-henkyaku |
37 |
63.9% |
0 |
一篇「他不認得的詞是零」的故事,仍然只量到 63.7%。 要湊到 0.85,32 個計入分母
的詞塊裡得有 19 個來自那 6 個 evidence words——那不是故事,是咒語。
英文那邊剛好相反:f1/f2 是 0.9、f3 是 1.0,所以 10 課實測 89.4–90.5%,輕鬆過關。
同一道門,一邊永遠過不了、一邊永遠過得了,而決定的不是內容,是那個人被考過幾個字。
這不是「把門檻放寬」可以修的
85% 是「可理解輸入」這件事的性質,不是學習者的程度——門檻一浮動,「他聽不懂」就被
重新定義成「他就這樣」,而那正是 gate 10 當初要抓的失效。要修的是尺。
三個方向,都還沒有設計:
- 讓
evidence_words 長大。 階梯式一場只問 16 個真詞,這是新設計的必然結果
(m98/fluent#27 也在講這個測驗太短)。課程證據(apply_evidence())與
vocab-index 本來就是設計來長大的路徑,但今天 index_words 是 0——沒有東西
在把學過的詞餵回去。這條可能是最實在的:他上完 8 課就會有 40 個直接證據。
- 分母只算「可判定」的詞塊,把
known_words_inferred 的不確定性移出比例本身。
現在的 ratio 把「我們對這個詞有多確定」跟「這篇文章有多好懂」混在同一個數字裡。
- 門檻對照的是同一把尺的另一端:例如要求覆蓋率 ≥ 該基準線的理論上限 × 某個比例。
最不喜歡這個——它其實就是浮動門檻,只是繞了一圈。
現況
那 8 課新的日文課已經上線(16 課 jahok 全部 200),內容品質是可以的:36–40 文節、
不認得的詞 0 個、每課 5 個新詞都有 sr_item。gate 10 對它們全紅,而紅的理由是尺。
舊的 8 課是 43–55%,那些是真的有 2–10 個他不認得的詞——兩者的差別在訊息裡看得出來
(「不認得 N 個」那一欄),但在紅/綠上看不出來。
訂正(PR #30 第二輪審查,2026-09-05)
上面寫「任何一篇日文故事的覆蓋率上限就是 0.625」——那個數字寫死了一位。
0.625 是「他沒被親自考過的那些詞」的上限。他勾過的 6 個 evidence words 拿 p=1.0,
所以一篇用得到那幾個字的故事會稍微高一點:實測最高是 kuukou-touchaku 的
63.8%,而它「他不認得的詞」是 0。
結論不變、而且更清楚:一篇未知詞為零的故事只量到 63.8%,離 85% 還差 21 個百分點,
而那 21 點沒有任何內容寫法補得回來。
覆蓋率門檻 85% 對一個初學者的日文基準線在數學上不可能達到,而且寫什麼內容都一樣。
機制
vocab_baseline.knows()只對evidence_words(他真的在卷子上勾過的詞)回p = 1.0。其餘
known_words是score()展開出來的估計,走的是該頻段的corrected。2026-09-04 那一場日文階梯測驗:
所以一篇日文故事裡,每一個他沒被親自考過的詞,上限就是 0.625。
實測
新寫的 8 課北海道課程,故事刻意只用 f1 的詞 + 5 個當課教過的新詞:
一篇「他不認得的詞是零」的故事,仍然只量到 63.7%。 要湊到 0.85,32 個計入分母
的詞塊裡得有 19 個來自那 6 個 evidence words——那不是故事,是咒語。
英文那邊剛好相反:f1/f2 是 0.9、f3 是 1.0,所以 10 課實測 89.4–90.5%,輕鬆過關。
同一道門,一邊永遠過不了、一邊永遠過得了,而決定的不是內容,是那個人被考過幾個字。
這不是「把門檻放寬」可以修的
85% 是「可理解輸入」這件事的性質,不是學習者的程度——門檻一浮動,「他聽不懂」就被
重新定義成「他就這樣」,而那正是 gate 10 當初要抓的失效。要修的是尺。
三個方向,都還沒有設計:
evidence_words長大。 階梯式一場只問 16 個真詞,這是新設計的必然結果(
m98/fluent#27也在講這個測驗太短)。課程證據(apply_evidence())與vocab-index本來就是設計來長大的路徑,但今天index_words是 0——沒有東西在把學過的詞餵回去。這條可能是最實在的:他上完 8 課就會有 40 個直接證據。
known_words_inferred的不確定性移出比例本身。現在的
ratio把「我們對這個詞有多確定」跟「這篇文章有多好懂」混在同一個數字裡。最不喜歡這個——它其實就是浮動門檻,只是繞了一圈。
現況
那 8 課新的日文課已經上線(16 課 jahok 全部 200),內容品質是可以的:36–40 文節、
不認得的詞 0 個、每課 5 個新詞都有
sr_item。gate 10 對它們全紅,而紅的理由是尺。舊的 8 課是 43–55%,那些是真的有 2–10 個他不認得的詞——兩者的差別在訊息裡看得出來
(「不認得 N 個」那一欄),但在紅/綠上看不出來。
訂正(PR #30 第二輪審查,2026-09-05)
上面寫「任何一篇日文故事的覆蓋率上限就是 0.625」——那個數字寫死了一位。
0.625 是「他沒被親自考過的那些詞」的上限。他勾過的 6 個 evidence words 拿 p=1.0,
所以一篇用得到那幾個字的故事會稍微高一點:實測最高是
kuukou-touchaku的63.8%,而它「他不認得的詞」是 0。
結論不變、而且更清楚:一篇未知詞為零的故事只量到 63.8%,離 85% 還差 21 個百分點,
而那 21 點沒有任何內容寫法補得回來。