Introducing System One Models and Jev
发布文章:架构、RLCD、基准测试、定价和 FAQ。
首页 / 文章与演讲
33 条
本页由英文清单自动生成。
发布文章:架构、RLCD、基准测试、定价和 FAQ。
创始人的论证:经 RLCD 训练的决策模型比聊天更快通向价值。
对这些基准测试持怀疑态度的解读都在这里。
发布报道、Doom 演示,以及 4000 万美元种子轮。
发布当日的汇总。
简短的发布摘要。
第三方对这些原语、定价和厂商评测的讲解。
关于训练方法已公开的部分。
发布周的技术汇总:API、评测、适配器和技能。
发布两天后:需求一度把 API 打挂,以及 Almeida 谈不想做前沿实验室。
商业视角,附报道中的估值以及 Every 给出的速度和成本数字。
16,000 次调用对比两款 GPT 模型:它在哪里胜出、在哪里崩掉,以及一套定阈值的流程。
三项分类任务,一个直接问题对比十二个带拟合权重的打分维度。
在本地活动信息上的正面对比,附成本和延迟。
Every 在一份写作归档上跑了 1,709 次判断,花费不到一美分。
只在合法走法中做 Choice,让它与推理模型比肩。
读过一手资料后,哪些发布时的说法还站得住。
把已发布的说法与公开证据能确立的部分区分开。
日语;在 Gemma 上复现了 logit 捷径,并在马里奥载体上与多款 LLM 作对比。
约 9,750 次调用的预注册测试:按问题类型给出校准误差,Jev 在提交分类上领先、在知识库归档上落后,弃权把差距补了回来。
哪些已知、哪些是猜的、它适合做什么,把各方独立数字汇到一处。
LangChain 谈模型路由,以及把危险的工具调用挡在一个带类型决策之后。
分诊、RAG 过滤、引用核查和置信度门禁,附代码。
一篇随笔,谈一个校准良好、不做生成的模型有什么用。
Guillermo Rauch 谈用 Jev 审查每一条 fx 命令。
Steve Krouse 的十六项判断演示和视频。
Vercel AI SDK 集成的逐步讲解。
开发者把 Jev 当作工具使用的安全层。
日语;Jev 对弈 Jev 下五子棋,附源码和计时日志。
一次 10,000 调用的探测,重建出共享状态、并行分支的架构;上面的 kev 就是据此造的。
直接读 logits 到底算不算新鲜事,一场长篇争论。
一项关于非自回归带类型决策的在先技术主张,以及反驳意见:真正的差别在于零样本的通用性。