Jev:何なのか、どう使うのか

TypeSafe 初の System One モデル実践ガイド · @aizvestia 向け · 2026年9月

🤖 コーディングエージェント用モジュール(コピーして貼り付け)
Install the TypeSafe skill. If you're in Claude Code, run `claude plugin marketplace add typesafe-ai/skills`, then `claude plugin install typesafe@typesafe-ai`. If you're in another agent, run `npx skills add typesafe-ai/skills --skill typesafe-ai` and select your agent. Use one installation method. You can read the skill directly at https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md (raw: https://raw.githubusercontent.com/typesafe-ai/skills/main/skills/typesafe-ai/SKILL.md). Then use the TypeSafe skill when working on this project.

これは何か

Jev は TypeSafe が公開した最初の System One モデル。チャットモデルでも「JSON モード付き LLM の一つ」でもなく、そもそもテキストを生成しない。state(文脈:テキスト、JSON、配列)と型付き質問のリストを送ると、機械がそのまま使える判断が返ってくる:選ばれた選択肢、スケール上のスコア、「はい」の確率 - さらに各回答の確率分布と confidence。作った本人たちが一言で表すと 'smart if-statements'、コード用の賢い if-else。 一番わかりやすい例はメールだ:Jev は各メールをざっと見て「スパム、94% 確信」「要返信」「後回しでOK」と判定する。何も書き返さない、仕分けだけ:1700通が18セント。

System One という名前はカーネマンの『ファスト&スロー』から:直感的な高速判断向けで、遅い推論向けではない。面白い話、TypeSafe の共同創業者 Diogo Almeida は RLHF の共同発明者 - ChatGPT を訓練したまさにその手法だ。今は自動化には別の訓練手法が必要だと賭けている。

これは何か

「前のもの」と何が違うか

言語モデルの事後学習は3つの時代を経てきた:

   
RLHF
ChatGPT と全チャットボット
人に好まれる回答を出すモデルゴマすり、自信満々のハルシネーション、mode dropping(回答分布の狭まり)
RLVR
推論モデル
数学・チェス・長い連鎖に強い遅くて高い
RLCD
Reinforcement Learning for Calibrated Decisions - TypeSafe の手法
較正された確率つきの判断テキストは書けない、System 2 は苦手

較正の要点:モデルが 0.8 と言えば、長い系列では約80%が正解になる。確率がロジックを組める数値になる。

JSON を「無理やり」吐かせた LLM との実質的な違い:

3つのプリミティブ

3つのプリミティブ
    
Choiceどれ?choice + probabilities + confidenceチケット振り分け:billing / technical / sales
Scoreスケール上のどのレベル?score(小数もあり)+ probabilities + confidence顧客の苛立ち:0 = 穏やか、2 = 激怒
Noulこれは真か?noul:「はい」の確率、0〜1「顧客は返金を求めているか?」 - 0.95

時間を節約するニュアンス:

5分で始める

0. ウェイトリスト不要:Jev は Vercel AI Gateway に typesafe-ai/jev として既に公開中($0.042/100万入力トークン)。Vercel 使いなら ai パッケージからすぐ呼べる。OpenRouter にもある:~typesafe/jev-latest(OpenAI 互換 API)。

1. Playground。console.typesafe.ai/playground を開き、適当なテキストを state に貼り、質問を足して Run。(入ると小テスト「Jev とおしゃべりできる?」- 正解は No。)

2. API を直接叩く。コンソールでキーを取り、エンドポイントは1つだけ:

curl -X POST https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "state": "Trying to connect my Stripe for 3 days, keeps failing. Help ASAP.",
    "model": "jev-latest",
    "questions": {
      "department": {
        "type": "choice",
        "instructions": "Which team should handle this",
        "criteria": {
          "billing": "Payment or subscription issues",
          "technical": "Bugs or integration problems"
        }
      },
      "is_urgent": { "type": "noul", "instructions": "The message conveys urgency" }
    }
  }'

レスポンスでは各質問に、選ばれた値・全選択肢の確率・confidence がついてくる。

3. Python SDK(3.10+):クライアントが TYPESAFE_API_KEY を自動で読み、デフォルトで jev-latest を呼ぶ:

pip install typesafe-sdk
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()
response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing": "Payment or subscription issues",
                "technical": "Bugs or integration problems",
            },
        ),
        "is_urgent": Noul(instructions="The message conveys urgency"),
    },
)
print(response.answers["department"].choice)   # "billing"
print(response.answers["is_urgent"].noul)      # 0.999

JS には @typesafe-ai/sdk、エージェント(Claude Code、Codex など)には出来合いのスキル:npx skills add typesafe-ai/skills --skill typesafe-ai。このスキルは「質問はまとめて送れ」とエージェントに教える - エージェントは質問1つにリクエスト1つを燃やしがちなので。

主要4パターン

  1. Speculative fan-out。同じ state を共有する質問は全部1リクエストに。常に必要とは限らない「投機的」な質問もまとめて。追加1問はタダ同然で、応答時間はほぼ不変。TypeSafe のクックブック:13問を1回で送ると13回の個別呼び出しより約12倍安く約10倍速く、回答は同じ。
  2. Confidence-gated routing。回答は「何を」、confidence は「動くかどうか」を語る。3ゾーン:高 - 自動実行。中 - 確認またはレビュー行き。低 - 人間か推論モデルへエスカレーション。閾値はリスク次第:画面の表示ミスは0.6で許容、決済の実行は0.9以上で。
  3. Composite scoring。複雑な判断はアトミックな Score に分解し、コード内の重みで合成。チケット優先度 = severity * 0.5 + frustration * 0.3 + actionability * 0.2。優先度が変わったら?係数をいじるだけでプロンプトの書き直しは不要。
  4. Intent routing。流入リクエストを分類してルーティング:決定的コード、安いモデル、高い推論モデル、あるいは人間。
主要4パターン

価格と制限(jev-1.13.0)

弱点(彼ら自身のドキュメントから正直に)

jev-1.13 には公開の「jaggedness」ページがある - モデルにできないことの正直なリスト:

どこに使うか

RAG rerankLLM guardrailscitation checkjailbreak detectticket routingmoderationcomplianceML featurescatalog matchingresume scoringlead scoring

動く例:Jev 製のビットコイン BUY/SELL/HOLD ターミナル - jev-terminal.vercel.app。API は正直な確率を返し、判断は一瞬で届く。

もう一つの例 - インスタント生成 UI:実験 json-render + jev - Jev があなたのコンポーネント・アクション・デザインシステムから選び、インターフェースがミリ秒でレンダリングされる。

リンク

ここで直接 Jev を試す

メッセージを編集し、質問にチェックを入れて Run - 本物の jev-latest が答える。

2 · 質問と回答空間
Which team should handle this support message
billingPayment or subscription issues
technicalBugs or integration problems
salesPricing or account questions
How frustrated the customer appears
0Calm, just stating facts
1Frustrated but civil
2Very angry, strong language
The message conveys urgency or time-sensitivity
yesprobability that the statement is true

リクエストはサーバーレスプロキシ経由:state は2000文字まで、毎分約30回。キーは Vercel の環境変数にあり、ブラウザには渡らない。