EveryInfra Blog · BL-24
Jev 生态观察(一):220 个案例告诉我们决策原语四天长出了什么
TypeSafe AI 的 Jev 发布四天,我们用十轮全网扫描整理出 220+ 带一手出处的案例。本文是系列首篇:三原语语义、六大高频模式、反复回归的翻车教训,以及已经成形的生态基础设施层。
2026-09-15,TypeSafe AI 发布了 System One 系列的第一个模型 Jev。到 09-19 深夜,我们在 jev-radar 仓库里记录了 220+ 个案例(含项目、演示与想法,均带原始出处;其中 108 个进入字段化注册表),生态总规模按我们第九轮扫描的估计约为 500 个仓库、21,600+ 星。四天长出这些,通常意味着一个真实需求被压了很久。
本文是「Jev 生态观察」系列的首篇。先说清方法:以下所有案例都来自我们 2026-09-15 至 09-19 的十轮扫描(GitHub Search、Reddit、Hacker News、X,以及 madewithjev、awesomejev、risetive、jevable、typesafeai.app 五个目录站),每条都带可点击的原始出处(项目地址必有,原帖地址存在时给出);所有第三方项目的效果数字均为作者自报,我们按证据强度做了 A/B/C 分级(A=可直接核验工件,C=仅口头声称)。数字是时点快照,生态每 3 小时都在变,最新计数以仓库为准。
Jev 是什么:一个不写句子的模型
OpenRouter 的模型页对 Jev 的描述是"来自 TypeSafe 的结构化决策模型,System One 系列的第一个"。它不生成文本:你送入一段非结构化状态加一组类型化问题,它返回你的代码可以直接分支的决策。三个原语:
- Noul:这件事为真吗——返回校准过的 0-1 概率。
- Choice:哪个选项合适——返回完整分布加置信度。
- Score:按你的量规打几分——返回概率加权分值。
价格是理解这个生态的钥匙:OpenRouter 标价 $0.042/百万输入 token,输出免费。TypeSafe 官网把技术路线称为 RLCD——用强化学习做校准决策,与聊天模型分属不同物种。对工程师来说,这意味着"每个循环步骤都问一次"在成本上第一次成立:后面你会看到,几乎所有项目作者都会主动报出单次调用成本,几分之一美分是常态。
六大高频模式:大家实际在用它干什么
一、给 agent 配安全副驾驶,是第一大场景。 发布 72 小时内这一类就冒出 30+ 个项目,现已同质化到"红海"。案例集里证据最完整的是 pi-warden:Jev 读取用户指令、agent 的自述和即将执行的工具调用,用 Noul 判断"是否不可逆、是否与所说相符、影响是否越界",结果注入上下文让 agent 自我纠正——作者在 17,000 次历史调用上回放自评(自报数据):仅拦截 42 次、约 88% 拦得对、抱怨率约 2%。同类还有给 Codex 当"软件工厂监工"的 Foreman,以及专拦编码 agent"篡改评分器、偷看隐藏测试"的 rh-guard——反 reward-hacking 已经独立成子类。
二、上下文压缩。 判断每条工具输出"当前任务还需要吗",不需要就替换成可恢复的占位。星数最高的社区工具 fast-jev-compaction(快照 2,735★)就是这个方向;winnow 的设计更精细——高置信无用的块替换成三行摘要 stub,随一条恢复指令可取回全文,"什么都没丢,只是先不花 token"。
三、路由与重排。 jev-codex-router 是第一个带回测数据的模型路由器:7 天 237 个真实轮次回放,每轮约 $0.00003 的决策成本省下约 60% 总开销(作者自报)。但独立评测 Janus 给了冷水:最优置信阈值、模型优劣、路由是否回本,在两个数据集之间全部翻转——路由参数不可跨数据集迁移,逐场景校准是必需品。
四、实时决策层。 共同架构是"代码管感知与执行,Jev 只在有界动作空间里做 Choice"。browser-use 团队官方出品的 Jev Ultrafast 把浏览器操作压缩到一次 Jev 请求同时决策动作和目标元素:苏黎世→伦敦机票搜索 7.1 秒,浏览器协议调用从 1,092 次降到 101 次(作者自报,单 profile 非普适基准);语音控浏览器的 jev-voice-browser 每句约 $0.0002。游戏侧更极端:中文开发者的杀戮尖塔 2 实测"每步 0.7 秒,画面没看清它就操作完了"。
五、基础设施化——这是四天里最明确的信号。 pg-jev 把 Noul/Choice/Score 变成 PostgreSQL 里的 SQL 谓词,DuckDB 侧有同类扩展;发布三天内出现 10+ 门语言的 SDK;Vercel 的 eve(快照 5,253★)已把 Jev 设为默认 evaluation 模型,LanceDB、LiteLLM、Pydantic AI、n8n 都有官方级接入。一个模型发布第四天就被当基础设施铺开,这个速度本身就是信号。
六、垂直业务开始落地。 税务分类器在 261 份 IRS 表单上做到 100% 严格准确(作者自报);欺诈检测级联用 Jev 快筛 100 封邮件、低于 95% 置信的 31 封再交大模型复核,整条流水线 96/100 正确、总成本 $0.07;1,018 篇论文的主题分类总共花 $0.08,作者对照"同样的事让摘要模型做要 $3.99"。交易侧出现了 895★ 的实盘项目(每 300ms 一个区块决策一次真实买卖),也有人诚实地贴出 41.1% 胜率、375 笔模拟交易的未过滤数据——这类不吹的数字在这个生态里格外值得记下。
翻车样本:四天里反复回归的教训
新生态的翻车记录比成功案例更值钱。案例集里的负面样本集中在五件事上:
- 输入质量决定一切。 Supercov 作者的教训被广泛引用:扔整个文件问"质量如何"效果很差;只问机械性问题(重复代码、深嵌套)就追平商业工具、便宜 100 倍。
- 选项一多就崩。 案例集里证据最扎实的独立评测(agentjournal,3 任务、5,477 测试行、总花费 $1.43)发现:12 选 1 的 Choice 在真实记账数据上准确率只有 0.3998——模型"理解了每个词,但选不出 12 选 1",瓶颈是决策格式而非理解。
- 置信度不是免死金牌。 agentjournal 实测 confidence ≥ 0.9 的行上准确率只有 72.2%;声明核查产品 Attest 干脆删掉了置信度字段——24 次真实检查里 22 次落在 0.95-0.99,"永远是同一个数的数字不是信息"。社区已有专门审计这件事的仓库。
- 对顺序和措辞敏感。 Attest 公开承认证据顺序翻转会让 5.8% 的判决改变;创业点子评分器 killmyidea 被用户实测去掉三个字各项分数大幅漂移;连官方 quickstart 自己都翻过车——示例注释标 technical,实际跑 100 次稳定判成 billing。
- 病毒演示里混着假的。 知名开发者 steve8708 公开点名 X 上病毒传播的 Jev 演示里有加速和伪造内容。我们的应对写进了收录标准:凡"超人类速度"类演示,以带完整方法论和运行痕迹的仓库为准。
生态的基础设施层已经成形
把 500 个仓库切开看,第四天结束时已经分层:官方示范约 10 个 → 平台集成约 15 个 → 独立应用约 50 个 → agent 工具约 90 个 → SDK 与长尾约 300 个。目录站经济出现得最快——五个聚合站加至少五个 awesome-jev 清单,最大的 awesomejev 收录 488 条、聚合 21,644 星。克隆生态同样凶猛:SemIf(1,647★,家用 3090 跑开源语义判断层)、jevlike(905★)等复刻合计超 4,000 星,其中一个开源克隆在 201 题基准上跑出 198 分对官方 191——这些均非官方 Jev,我们在案例集里单独归类并明确标注。TechCrunch 已进场报道,沃顿经济学教授和 Hasura 联合创始人的背书都有了。中文社区在第四天出现首批落地:X 时间线清洁工 qingliu(目前唯一报出校准数据的中文项目:误杀率 0.7%、比词库过滤多抓 47%,作者自报)、知乎信息流过滤器、美联储发布会鹰鸽判读。
对做产品的人,这意味着什么
四天 500 仓库验证出的甜点区很清晰:窄问题 × 高频调用 × 有界动作空间 × 成本敏感——agent 循环内的逐步监督、大规模分类/重排/打分、毫秒级选择。禁区同样清晰:生成类任务、宽选项空间、指望一套阈值吃遍所有数据集。
还有一个被多数演示忽略的事实:决策原语的输入是状态,而状态从哪来决定了整个链路的上限。Noul 判"这条评论像真实买家吗",前提是有人把成千上万条评论可靠地采下来;Score 给口碑、商品、榜单打分分桶,前提是有干净的字段和可复核的来源。这恰好是我们的位置——EveryInfra 用一个 API 覆盖 88 个平台的公开数据(评论、口碑、价格、内容),按量计费、失败或空结果不形成最终扣款。决策模型负责"怎么判",我们负责"判的原料从哪来"——如果你在搭这类流水线,可以从统一数据 API 接入指南开始。
系列下一篇我们深潜第一大场景:那些给 agent 站岗的安全层,到底拦住了什么、放过了什么。jev-radar 每 3 小时自动重扫,案例集持续生长,欢迎带着你的项目来提 issue。