MODEL EVALUATION FIELD NOTE 01 / 2026.09

分類能力,
得拆成三道題看。

open-jev 與 open-jev-laya 固定樣本實測。這份紀錄把分類命中、分數排序、標籤定義與執行時間拆開,避免一個準確率掩蓋真正的差異。

04 模型版本 03 任務切片 739 Laya 評測列 更新於 2026 年 9 月 27 日
READ THIS FIRST / 00

同一批模型,
不同任務有不同答案。

A 最好的分組基線

open-jev 在 Banking77 十類分組答對 77.1%。Laya 是 55.6%;Kev 兩個尺寸都被 other 選項拖累。

看分組診斷
B 最清楚的排序訊號

Laya 的 SMS spam AUC 是 0.894,但 0.5 門檻的 accuracy 只有 56.5%。分數會排序,不代表門檻已可用。

看 spam 分數
C 最高的 77 類命中率

kev-4b 在平衡子集答對 87.0%,但單題 p50 約 8.5 秒。Laya 的 77 選項會被截短,不能直接當成公平對照。

看 77-way 限制

!執行環境:下方所有延遲都來自 Node.js WebGPU,不是瀏覽器實測。評測使用固定資料、固定問題,每列只推論一次。

MODEL SCORECARD / 01

先比較同一個任務。

切換任務查看 macro-F1 和原始指標。SMS 的 accuracy 會受到正常訊息占多數影響,請同時看 AUC、precision 和 recall。

SMS SPAM / 固定 200 則

Macro-F1

看兩個類別的平衡表現
open-jev kev Laya

Brier / ECE 越低通常代表機率與正確率較一致。SMS ECE 對照 spam 正類機率;多選題以最高選項機率對預測正確性計算。樣本分箱會影響估值,請一併看樣本數與原始分數分布。

SMS SPAM / 02

會排序,
也可能選錯門檻。

資料有 27 則 spam、173 則正常訊息。只答「正常」也有 86.5% accuracy,是這組最重要的基準線。

LAYA · THRESHOLD 0.5未校準
56.5%

accuracy · 低於全部答正常

26抓到 spam
86正常誤報
1漏掉 spam
87判對正常
真實 spam / 正常predicted at p ≥ 0.5
RANKING SIGNAL 0.894 Laya AUC

AUC 高,表示 spam 常排在正常訊息前面;但預設門檻下,許多正常訊息也得到接近 1 的分數。要先用獨立驗證集選門檻並檢查校準。

p(spam) 中位數0 ───────── 1
≈1.00
0.491

不要直接用 confidence 做人工複核門檻。 Laya ECE 0.415;在本批資料挑出的最佳 F1 門檻 0.99999256 也是樣本內結果,F1 0.679,尚未獨立驗證。

Kev-0.6b27 則 spam 全漏掉;TP 0、FP 1、FN 27、TN 172。它的 86.0% accuracy 比全答正常的 86.5% 還低。
Kev 分數spam 中位數 0.0168,正常中位數 0.0205;排名最高的 28 則全是正常簡訊。AUC 0.459,接近隨機。
輸入已核對原文確實放入 state,yes/no 對應也確認正確。明顯 spam 樣本仍只得 0.045–0.086 的 spam 分數。
BANKING77 GROUP / 03

381 次選 other,
真實標籤只有 6 題。

主圖把模型選出的 other 數量和資料裡真正的 other 放在同一條 462 題刻度上。Kev 的偏差遠大於標籤本身的比例。

PREDICTED OTHER / n=462

輸出分布對照真實標籤

真實 other:6 題(1.3%)
kev-0.6b381 / 462
kev-4b327 / 462
open-jev4 / 462
Laya fp165 / 462
0每條長度代表 462 題462

細線標出真實 other 的位置;Kev 的 381 次預測裡,僅約 6 題是真實 other。把 other 從 Kev 候選排除後,離線 argmax accuracy 為 76.6%(kev-0.6b)與 78.4%(kev-4b)。

KEV-0.6B · OFFLINE COUNTERFACTUAL

降低 other 分數

原始16.0%
÷ 1041.6%
÷ 10065.8%
÷ 100075.1%

這些係數在同一批 462 題上試算,不能當成已驗證修正。

CONFIDENCE IS NOT A REVIEW GATE

越有把握,反而越常錯

信心 0.50–0.7032.9%
信心 ≥ 0.956.2%

Kev 的高信心多半是很有把握地選了 other,現在不適合用信心分數自動分流。

LABEL AUDIT

分組定義也在影響分數。

真實 other 只包含 contactless_not_working(6 題),語意上較像 card。費用類也散落在 transfers、atm_cash、exchange_fx 與 disputes_refunds;fees_charges 原始只有 card_payment_fee_charged。

contactless → card7 fee intents → fees_charges
重標診斷 accuracyKev-0.6b 16.0 → 13.6%Kev-4b 26.6 → 23.2%open-jev 77.1 → 82.9%

這是對固定預測做的離線重標 diagnostic,不是重新推論,也不代表新 taxonomy 已獲確認。

BANKING77 INTENT / 04

多選項測試,
先看得進去多少。

每個 intent 固定抽一題。模型間的速度與分類能力取捨很明顯,但 Laya 與 open-jev 各有不同的輸入限制。

TOP-1 ACCURACY · 77 INTENTS 最高命中率
87.0%
79.2%
35.1%
open-jev512-token context 不足,未執行
每題 p50kev-4b 8.54 秒kev-0.6b 1.83 秒Laya 226 ms
PROMPT TRIALS / APPENDIX

多寫 fallback 規則,
沒有解決 other 偏差。

v2 跑完整 462 題;v3、v4 是每類一題的 77 題 pilot。三種改寫都沒有勝過原始 baseline。

模型 / 問法nAccuracyMacro-F1選 otherp50
kev-0.6b · baseline46216.0%0.200381264 ms
kev-0.6b · fallback v246210.8%0.140410500 ms
open-jev · baseline46277.1%0.7364231 ms
open-jev · fallback v246220.3%0.273327445 ms
SHORT PROMPT PILOT / n=77

Kev: baseline 15.6% → v3 14.3% → v4 13.0%  open-jev: 75.3% → 14.3% → 22.1%

v2 雖抓到全部 6 個真實 other,卻同時製造 Kev 404、open-jev 321 個 false other。這些提示詞是在同一評測集上設計,不是獨立驗證。

LATENCY & METHOD / 05

速度數字,
要連執行環境一起讀。

每題延遲包含 tokenization、sequence construction、forward pass 和 decode;不含頁面載入時間。

任務kev-0.6bkev-4bopen-jevLaya
SMS spam · n=200108 / 189534 / 1,016101 / 15989 / 140
Banking77 group · n=462264 / 3121,394 / 1,684231 / 291116 / 166
Banking77 intent · n=771,826 / 2,0048,542 / 9,102未執行226 / 294

每格為 p50 / p99,單位毫秒。三種任務的樣本量不同。

RUNTIME

Node.js WebGPU

Node v24.18.0 · macOS arm64 · Transformers.js 4.3.0。Laya 使用 fp16;Kev 與 open-jev 使用 Q4。

MODEL LOAD

Laya 權重約 647 MB

快取後載入 1.77 秒;第一次下載與初始化約 71.96 秒。Kev-0.6b 1.61 秒、Kev-4b 6.39 秒、open-jev 2.75 秒。

REPEAT CHECK

Kev 系列一致性 1.000

三個 open-jev 內建模型在 50 則平衡 SMS 子集各重跑三次,預測一致;這不是整體準確率估計。Laya 未做重複測試。

資料來源、版本與限制

每題只跑一次,只有 50 則 SMS 做三次重複一致性檢查。open-jev 77-way 因 context limit 未執行;Laya 77-way 受到截短。重標 taxonomy、分數懲罰、最佳門檻都是同批資料上的離線診斷。Node WebGPU 延遲不代表瀏覽器量測。