Jev 生态观察(七):内容评分与信息过滤——从创业点子到万人格测试
生态里第二大场景:用 Jev 给内容打分、过滤信息流、预测外联表现。我们拆了 Reddit 最火的 killmyidea、37 篇写作语料做 Jev 评审试验的 Every 编辑部 Mike Taylor、SuperX 的 61 问病毒度模型和 Crowdcheck 的万人格模拟,看哪些真正跑出了数字。
上一篇深潜了代码质量评测。这一篇看生态的另一个大场景:内容评分与信息过滤。从创业点子打分到社交媒体帖子的病毒度预测,从视频逐句可信度仪表到万人格模拟——这些项目有一个共同架构:Jev 负责给非结构化内容输出结构化判断,代码负责根据判断执行动作。
五个有数字的项目
killmyidea:Reddit 最火的创业点子评分器
killmyidea(Reddit 209 赞)把创业点子提交给 10 个 0-4 分的量规(Score),并行打分后加权出总分。作者自己承认它是"consistent gut check, not an oracle"——但 Reddit 用户实测发现了它的边界:同一 idea 去掉 "open source" 三个字,各项分数大幅漂移。这不是 bug,是决策原语对输入措辞敏感的真实体现。
Every 编辑部:37 篇写作语料的一次 Jev 评审试验(1,709 次判断)
Every 编辑部 Mike Taylor(dan.shipper)把 Jev 集成到编辑部工作流中,对其 37 篇已发表文章做过一次完整的 Jev 评审试验,共 1,709 次判断、总成本不到 $0.01(作者自报)。这是一次性语料试验,不是持续生产集成。
SuperX:61 问病毒度模型
SuperX(@robj3d3)给每条草稿帖子过 61 个 Jev 问题,约 1 秒出分、每次约 $0.0004。模型在 207 位创作者的 9,481 条真实帖子上拟合——声称「3 次里 2 次选中病毒帖,从不奖励回复诱饵」(作者自报)。免费无注册。
Crowdcheck:10,000 个合成人格
Crowdcheck 用短帖测试 10,000 个持久化合成人格的 read/like/agree/repost/follow/block 概率——Noul 批量判断、按组批处理。这是「用决策原语模拟群体反应」的最激进实验。
jevmeter:视频逐句「胡说仪表」
jevmeter(2026-09-21 快照 76★)给任意视频加实时可信度仪表——每句话打一个 Score,渲染成 16:9 可剪辑画面。这是 X 上流传的 "Realtime debate BS meter" 类 demo 的开源实现。
共同架构:Jev 当感知层
这些项目的共同架构是「代码管流程,Jev 管判断」:
- killmyidea:代码收集点子 → Jev 按 10 个量规打分 → 代码加权出总分
- SuperX:代码预处理草稿 → Jev 答 61 问 → 代码汇总出病毒度预测
- Every:编辑提交文章 → Jev 按编辑标准判断 → 结果反馈给作者修改
Jev 不决定「什么内容好」——量规是人定的。Jev 的是否擅长的是:在人类定义的标准下,快速、一致、便宜地判断大量非结构化内容。
什么场景该用
- 该用:大批量内容的初步筛选(哪些帖子值得人看)、一致标准的持续评分(品牌监控的口碑分桶)、A/B 测试的自动化评估(哪个版本更好)。
- 不该用:需要深度上下文理解的内容审核(讽刺、文化敏感性)、最终发布决策(Jev 是参考,不是编辑)。
- 边界意识:killmyidea 的措辞漂移提醒我们,输入的微小变化可能导致输出大幅变化。生产使用时需要固定输入格式、做敏感性测试。
与 EveryInfra 的组合
内容评分的输入是待评估的帖子、评论或商品描述。如果你需要先批量采集这些内容,EveryInfra 可以提供结构化输入。从统一数据 API 接入指南开始。