AI Radar
Support
LiveUpdated 2026-09-24 02:41 UTC

Jev要被开源模型干掉了 ?我来实测两个决策模型的能力,到底有没有吹牛?

Jev要被开源模型干掉了 ?我来实测两个决策模型的能力,到底有没有吹牛? Jev 实际上不应该跟LLM相比,要测就得找同一个生态位的对手!于是我找到了同样是决策模型的 FLock——一个超轻量级的决策模型,而且完全开源免费…

This is a AI post classified by Jev as Open & local models (a model release), kept by the AI Radar because it carries real work, not commentary.

Jev要被开源模型干掉了 ?我来实测两个决策模型的能力,到底有没有吹牛? Jev 实际上不应该跟LLM相比,要测就得找同一个生态位的对手!于是我找到了同样是决策模型的 FLock——一个超轻量级的决策模型,而且完全开源免费 为了不测垃圾数据,我从美国消费者金融保护局(CFPB)公开数据库摘了 1,000 条真实的真人长篇控诉(包含真实口语、愤怒投诉、维权错字以及乱码垃圾单),同时喂给这两个主打毫秒级决策的模型,实时分流到 15 个细分金融业务部门👇 左边:TypeSafe Jev(jev-latest) 右边:FLock(this-that-model-1.0)(开源免费) ─── 具体正确率表现如下 ─── • 日常核心业务 │ Jev: 90%~95% │ FLock: 85%~98% (双方差距不大) • 复杂长文过滤 │ Jev: 70%~100%│ FLock: 14%~61%(Jev占优) • 决策时间对比 │ Jev:33.5 S │ FLock: 36.1S (Jev占优) • API响应速度 │ Jev: 368ms │ FLock: 405ms (双方差距不大) • 官方API 成本 │ Jev: $0.146│ FLock: $0 (Flock成本完胜) ──────────────────────── 客观总结: Jev @types

Posted by 梭哈.AI (33.9k followers) 14 h ago · 46 likes · 6.7k views · view the original post on X. Kept by the AI Radar as Open & local models.

More AI work like this

Every post is read and classified by Jev (TypeSafe): what it is, which market it belongs to, and whether the link is a real tool. 45.7k posts from 5k X accounts over the last 14 days, 1.9k tools, 19 markets. Collected every 5 minutes, fully re-ranked every hour — last update 2026-09-24 02:41 UTC. Full method.