2026-06-18 huggingface
Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。
阅读全文 2026-06-16 ollama
Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。
阅读全文 2026-06-14 openai
一周内 OpenAI 既收购云执行公司 Ona 补全 Codex 的运行底座,又把 Codex 免费塞给最有影响力的开源维护者。两手指向同一笔账:模型在商品化,护城河正在转移到 agent 在哪运行、嵌进谁的工作流。
阅读全文 2026-06-12 xiaomi
MiMoCode 几乎逐项复刻了 Claude Code 的 agent 运行时设计,并以 MIT 开源加限时免费分发,竞争正在从模型转向运行时与入口。
阅读全文 2026-06-10 moonshot
模型会被比价、被替换,握住终端编码 agent 这个运行时却能握住分发。MIT 开源、可接非 Kimi 模型的 Kimi Code CLI,是月之暗面从卖模型转向卖工作流入口的明牌。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 内置 coder、explore、plan 子 agent,并让它们在隔离上下文里并行工作。这个设计的价值,是把 agent 编程拆成可分工、可监督、可组合的流程,明显超出把模型接进终端的包装层。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 把读写代码、执行命令、抓取网页和规划行动放在同一个终端工作流里。这个闭环能提升开发效率,也会把权限、审计和人工监督推到更前面。
阅读全文