受付室|いまの1件と、カードの行き先
開始前です。
問い合わせの全文
「受付をはじめる」を押すと、1件目が届きます。
絵を使わずに文字で見る
再生の速さは見せ方のための演出です。実際のAPIの応答時間は、「判定の詳細」に実測値として別に表示します。
操作
1件ずつ進める
確信度がこの値と同じか、それより高いときだけ自動で窓口へ送ります。 基準を変えると再生を止めて先頭に戻し、全件を新しい基準で計算し直します。 保存済みの判定を計算し直すだけなので、APIは呼びません。
どこに線を引くか(全評価データでの比べ方)
同じ判定でも、線の引き方で「人が読む件数」と「誤りの件数」が入れ替わります。 押すとその基準で全件を計算し直し、再生を先頭に戻します。
| 確認基準 | 人が読む | 自動で片づく | 自動のうち誤り | 操作 |
|---|
この表は手元の評価データの上での結果です。同じ基準が実際の運用でも安全だとは言えません。
集計
全評価データの結果
再生した分だけの途中集計
全データ
評価に使った問い合わせの一覧
誤った判定も隠さず載せています。並びはデータの順番です。調整用と書かれた行は、 基準を検討するときに見た例文で、上の集計には入れていません。
| ID | 原文 | Jevが選んだ窓口 | 確信度 | 最終の送り先 | 想定した送り先 | 判定 |
|---|
使っているモデル
Jevという選択肢について
この画面が使っているのはTypeSafeのJevです。文章を書くAIではありません。 決めておいた選択肢から1つ選び、選択肢ごとの確率と、答えがどれくらい1つに集中しているかを表す「確信度」を返します。 数字が返るから、「この値を下回ったら人が見る」という線を引けます。
測ったのはJevだけです。同じ問い合わせを他のモデルに解かせて比べてはいません。 確信度は正解の確率ではない点も、下の「読むときの注意」をご覧ください。
業務の設定
窓口と担当範囲、振り分けの規則
振り分けの規則
読むときの注意
この画面で分かること、分からないこと
- 確信度は「正解の確率」ではありません。 選択肢ごとの確率がどれくらい1つに集まっているかを表す数字です。高い確信度でも誤ることがあります。 基準を厳しくすれば誤りが必ずゼロになる、ということもありません。
- 基準を動かして良い結果を選べても、それは手元の評価データの上での話です。 同じ基準が実際の運用で安全だとは言えません。
- 例文は私が架空の事業を想定して作りました。 正解も同じ人間が決めています。書き手と採点者が同じという弱点があり、実務の全体を代表するものではありません。 この件数の結果から「日本語の実務全般で使える」とは言えません。
- 「検証メモ」は人が後から付けた説明です。 判定の理由としてJevが出力したものではありません。
- 人の確認へ戻すのはこのアプリの規則です。 確信度が足りない、対象外が選ばれた、という場合に戻しています。Jevが「人が確認」を選んだわけではありません。
- この画面はAPIを呼びません。 事前に記録した応答を再生しているだけです。閲覧しても判定の費用は増えません。自由入力欄も置いていません。