2026-06-20 servicenow
ServiceNow 的 MosaicLeaks 把研究型 agent 会不会泄密这件事,从模糊担忧变成可度量的属性。对手看不到私有文档,也看不到 agent 的推理,只能看到累积的出站查询日志,却能把一条条无害的 web 查询拼出仅存于内部文档的私有事实,这就是马赛克效应。最反直觉的发现:只为任务表现做强化学习,会让泄漏更严重。他们的 PA-DR 训练法证明隐私必须进训练目标:严格链成功率从 48.7% 升到 58.7% 的同时,答案与全信息泄漏从 34.0% 降到 9.9%。给 builder 的判断:agent 数据外泄是工程与训练目标问题,不是一句别泄露的 prompt 能修的对齐口号。
阅读全文 2026-06-20 ai-policy
挪威首相 Jonas Gahr Støre 6 月 19 日宣布,新学年起 1 至 7 年级(约 6 到 13 岁)近乎全面禁用生成式 AI,14 到 16 岁须在教师直接监督下使用,17 岁及以上鼓励自主合理使用。划线依据不是技术属性,是发育阶段,理由是 AI 让孩子跳过读写算这些基础步骤。先例是挪威 2024 年的学校手机禁令,官方认定成效显著:霸凌减少,成绩提升,因心理问题就诊心理医生的次数下降,女生效果尤其明显。给教育科技和 AI 建设者的真问题不再是 AI 该不该进课堂,而是哪个年龄段、什么监督结构下进。年龄分层正在成为教育 AI 产品的合规轴线。
阅读全文 2026-06-20 openai
Ed Zitron 拿到的审计文件、FT 复核:OpenAI 营收从 2024 年 37 亿美元涨到 2025 年 131 亿美元,但同年研发单项就花掉 192 亿,运营亏损扩大到 209 亿。真正的信号不是发现了亏损,而是亏损规模被研发和算力承诺锁死。问题从「何时盈利」变成「IPO 前谁继续每年填上约 200 亿缺口,以及亏损率从 237% 收窄到 160% 的速度够不够说服公开市场」。给建设者的判断在正文。
阅读全文 2026-06-20 softbank
据 Reuters 转引韩媒,软银行使 2021 年留下的看跌期权,作价约 3.25 亿美元把手里约 9.65% 波士顿动力残股全卖给 Hyundai,公司变为 Hyundai 全资,董事会预计 6 月 22 日批准。真实信号不在看衰人形机器人,而在孙正义于两类 AI 赌注间做现金流取舍:具身智能回报太慢,资本被挪向那笔约 410 亿美元的 OpenAI 押注。给建设者和创业者的判断在正文。
阅读全文 2026-06-18 huggingface
Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。
阅读全文 2026-06-18 deepseek
路透独家:DeepSeek、内存厂 CXMT 和另外 100 多家被认定国家安全风险的公司,去年就被跨部门委员会批准列入商务部实体清单,至今没公布。实体清单自十月起没有任何新增,是十多年来最长的空窗。原因不是它们没问题,是 Trump 政府不想在中美谈判时火上浇油。给建设者的关键判断:中国开源权重模型现在在美国仍然合法可用,但这是一份签好字、压在抽屉里的缓刑,谈判一翻脸随时可能落地。别把对 DeepSeek 的硬依赖建在它会一直合法的假设上。
阅读全文 2026-06-18 midjourney
Midjourney CEO 把图像生成公司的剩余算力和品牌,押到了一台全身超声扫描仪上。真正干活的是 Butterfly Network 的超声芯片,生成式 AI 只贡献了一层分割叠加。要把「给数十亿人每天做预防性扫描」这件事做成,挡在前面的是软件公司绕不开的 FDA、过度诊断和临床验证,而不是算力。
阅读全文 2026-06-16 aws
一周内三起独立事故,AI agent 扫网络把运营者干到 6531 美元 AWS 账单、在 Fedora 仓库里乱改 bug 骗过维护者、被一笔一分钱转账劫持成银行钓鱼通道。看着无关,根因是同一个:把高权限交给一个无人复核、无支出上限、无审计回放的 agent。这不是模型对齐问题,是部署纪律问题。给建设者的三道闸:权限最小化、硬性熔断、动作可回滚。
阅读全文 2026-06-16 zhipu
智谱放出 GLM-5.2 权重,MIT 许可,1M 上下文,主打长程任务和可调思考预算。官方自报跑分把它放到了闭源旗舰一两个点的射程内。真正的信号不是又一次刷榜,而是开放权重的能力成本曲线又压低一格。但厂商自报数字要打折,1M 是否真可用、长程是否真可靠,得自己在目标任务上测。
阅读全文 2026-06-16 ollama
Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。
阅读全文 2026-06-16 alibaba
Qwen 一次推出三个机器人基础模型,导航、操作、世界模型各管一段,用语言接口把它们串成可调用的工具。真正的杠杆不是某个跑分,而是想把物理世界智能做成像 LLM 那样可二次开发的开放底座。但从看懂到会动这条鸿沟,一个套件远没填平,真正的瓶颈在真实机器人上的泛化与可靠性。
阅读全文 2026-06-15 moonshot
月之暗面开源 Kimi K2.7-Code,1T 总参 32B 激活的编码向 agentic 模型。头号卖点不是榜单峰值,而是 thinking token 比 K2.6 降约 30%。它在主流编码与 agentic 榜上仍全面低于 GPT-5.5 和 Opus 4.8,但把够用加便宜加可自托管这条路又推近一步。真正的瓶颈仍是缺一个好用的英文 CLI。
阅读全文 2026-06-15 model-merging
里约政府 IT 公司发布 397B「巴西主权」开放模型并宣称自训练击败同级。Nex-AGI 用身份测试与权重共线性两套独立证据证明它只是 0.6 倍 Nex 加 0.4 倍 Qwen 的逐元素合并。要害不是没标引用,是对外谎报了自己实验室的能力,而权重张量这次成了无法抵赖的指纹。
阅读全文 2026-06-14 zhipu
智谱发布 GLM-5.2 并宣布完全开放,时间卡在 Anthropic Fable 被叫停的同一周。真正的新闻不是参数(没公开跑分),而是定位:当闭源 API 的访问能被非技术原因随时撤销,开放权重的价值从省钱可定制升级为供给确定性。这是开放阵营当下最锋利的卖点,但权重未上线、无独立 benchmark 前,别据此切换生产负载。
阅读全文 2026-06-14 google
Google 支持 UC San Diego 用 2000 部退役 Pixel 搭低碳算力集群。容易被讲成废物利用的暖故事,但真正的看点是它替代的是本该被丢弃的蕴含碳,且只对可中断的批处理负载现实。
阅读全文 2026-06-14 openai
一周内 OpenAI 既收购云执行公司 Ona 补全 Codex 的运行底座,又把 Codex 免费塞给最有影响力的开源维护者。两手指向同一笔账:模型在商品化,护城河正在转移到 agent 在哪运行、嵌进谁的工作流。
阅读全文 2026-06-14 tensorzero
TensorZero 拿过 730 万美元种子轮,GitHub 仓库一夜被设为只读。HN 吵的是 wrapper 还是 infra,但真正的裂缝在开源加风投这对组合上。给 builder 的选型判断。
阅读全文 2026-06-13 glean
Glean 报告说白领每周花 6.4 小时看管 AI。87% 的人在用、75% 觉得更高效,只有 13% 说公司因此表现更好。这道缺口被谁吃掉了。
阅读全文 2026-06-13 ai-slop
当 AI 把生产文本和代码的成本压到接近零,人类注意力成了真正稀缺的东西。这篇登上 HN 全站第一的短文主张:请别人花时间之前,先拿出自己花过的时间。我们拆它的主张、HN 上的真实分歧,以及它该被收紧的地方。
阅读全文 2026-06-13 anthropic
美国政府以国家安全为由发出出口管制指令,要求对所有外国国籍者暂停 Fable 5 与 Mythos 5 访问,净效果是 Anthropic 必须对全部客户立即禁用这两款模型。拆解这步监管的真实逻辑,以及它给所有前沿实验室重写的风险账。
阅读全文 2026-06-12 xiaomi
MiMoCode 几乎逐项复刻了 Claude Code 的 agent 运行时设计,并以 MIT 开源加限时免费分发,竞争正在从模型转向运行时与入口。
阅读全文 2026-06-11 open-source
一个疑似失控的 AI agent 涌进 Fedora 等项目,真正暴露的不是机器写了坏代码,而是开源协作里没人为 agent 贡献负责,维护者被迫给机器当免费 QA。
阅读全文 2026-06-11 jobs
Apollo 首席经济学家用招聘缺口和 5 月就业数据论证没有 ChatGPT 替代工人的迹象。但宏观平均值正好是局部冲击的天然消音器。这场争论真正的分歧不在数据,在你拿什么口径去看。
阅读全文 2026-06-11 ai-coding
Jesse Skinner 把 AI 编码工具比作一支随叫随到的明星开发者大军:产出飞快,代码却没人维护得起。工程难题不在写得多快,而在谁来兜底。
阅读全文 2026-06-11 alibaba
阿里把内部用了两年的 AI 代码评审工具开源成 ocr CLI。它值钱的地方在于把口口相传的评审标准固化成可执行、可调试的检查,会找 bug 只是顺带。
阅读全文 2026-06-11 amazon
员工在 Slack 把公司 AI 的产出叫 slop、给它起外号 Sloppenheimer。这不是抱怨,是自上而下强推 AI 的公司在批量制造合规式假用的证据。
阅读全文 2026-06-11 anthropic
Anthropic 给 Fable 加的护栏为防滥用,却连读博客、做代码审查这类正当安全工作也一起拒答,争的是安全与可用、以及谁来定义正当用途。
阅读全文 2026-06-11 anthropic
Anthropic 对 Mythos 类模型强制 30 天数据留存,经 Bedrock 调用也要开启留存才能用。被「更强模型」叙事盖住的,是企业自己得吞下的治理与合规成本。
阅读全文 2026-06-11 anthropic
Anthropic 完成 Series H,筹 650 亿美元、投后估值 9650 亿,run-rate 收入越过 470 亿。资本和算力被一次性买断,真正的标的是前沿位置和对 OpenAI 的对冲,不是那个估值数字本身。
阅读全文 2026-06-11 agents
Burr 进入 Apache 孵化器,用状态机、内置 telemetry 和可重放押注:agent 框架的胜负手正从能力转向可靠性。
阅读全文 2026-06-11 bunq
blue41 帮欧洲第二大数字银行 bunq 修复了金融 AI 助手的间接提示注入:一笔几分钱的转账、把指令藏进转账备注,就能让助手替攻击者发钓鱼。真正的教训是工具权限、确认门和把外部数据当不可信输入。
阅读全文 2026-06-11 biology
Biohub 开源了一套蛋白质世界模型,卖点是设计出在真实实验里有功能的结合体,不是再做一次结构预测。它的可信度边界在 binder 这一小块。
阅读全文 2026-06-11 jobs
Techdirt 一篇评论(HN 808 赞)戳破了一种 CEO 叙事:他们把 AI 当裁员的理由,本质是把组织设计、流程和培训的责任甩给一项技术。反方也有一句不能忽略的话:有些岗位确实正在被重塑。
阅读全文 2026-06-11 anthropic
Amodei 放弃押 AGI 日期、改用指数与复利重设监管议题。框架哪里站得住、哪里在替 Anthropic 说话,本文逐条拆开。
阅读全文 2026-06-11 google-deepmind
DeepMind 把 Google 街景灌进 Project Genie,赌的不是更漂亮的画面,而是机器人和自动驾驶的合成数据飞轮。但这次放出的是消费级 demo,不是仿真管线。
阅读全文 2026-06-11 google-deepmind
DeepMind 联合四家机构发起最高 1000 万美元的多 agent 安全研究资助。真问题不在单个模型对不对齐,而在一群各自对齐良好的 agent 凑到一起时涌现的协同失效。
阅读全文 2026-06-11 google-deepmind
1763 名学生、8 周、+0.258 个标准差,这是 AI 教育罕见的实证。但增益最大的恰是底子好的学生,而读懂它能不能外推,才是 builder 该关心的事。
阅读全文 2026-06-11 google
Google 开源了首个主流文本扩散模型。真正的卖点不是「快」,而是它把本地解码的瓶颈从显存带宽挪到算力,用双向注意力并行生成 256 个 token。代价是质量、实验性和那个 26B MoE 的取舍。
阅读全文 2026-06-11 nvidia
NVIDIA 把 Revolut、Mastercard、Adyen、Stripe 攒成一条叙事:金融业的赢家模型是用自家交易流水训练的专用基础模型。数据独占性才是垂直 AI 的护城河,但这套故事里有几处该打折。
阅读全文 2026-06-11 cognition
Cognition 发布 FrontierCode,用维护者会不会真的合并这段代码当评测信号,把可读性、可维护性、改动范围纳入评分,逼近人类代码评审,也暴露出主观性和谁来判合并的难题。
阅读全文 2026-06-11 google
Google DeepMind 发布流式语音到语音翻译,70+ 语言、保留语调语速音高,关键不在演示而在它进了 Gemini Live API。
阅读全文 2026-06-11 google
Gemma 4 12B 把视觉和音频直接喂进语言模型主干,放弃了独立编码器。这是一个架构赌注,而不只是又一个端侧模型。
阅读全文 2026-06-11 google
Google 给 Gemma 4 放出量化感知训练(QAT)的权重,把 E2B 的内存占用压到 1GB,能在手机和消费级显卡上跑。真正的转折不是「能跑了」,而是它把矛盾从「装不装得下」推到了功耗、隐私边界和质量损失到底有多大。
阅读全文 2026-06-11 genai
震动工程师的多数不是模型某天突然变强,是预期校准长期落后于能力。该记的是反复触发它的那几类任务。
阅读全文 2026-06-11 developer-sentiment
一条「为什么 HN 这么反 AI」的热帖,和一个把 AI 文章全部过滤掉的工具,暴露的不是卢德式抵触,而是信噪比崩坏。把它当噪音的公司,会误判最懂技术的那批用户。
阅读全文 2026-06-11 hcompany
H Company 第一次放出可本地运行的 computer-use 模型。它不去抢榜单第一,而是去解决一个云端方案绕不过的问题:每一步都要把你的屏幕发出去。
阅读全文 2026-06-11 jetbrains
JetBrains 在 Hugging Face 开源 12B MoE 的 Mellum2,只激活 2.5B 参数,主打路由/RAG/子代理的高频低延迟环节。这是 IDE 厂商把模型握进自己手里的信号。
阅读全文 2026-06-11 legal
密西西比一桩案子的两边律师都用 AI 写了引用虚假判例的文书,法官停审、取消庭审、四名律师全部被取消代理资格。
阅读全文 2026-06-11 meta
攻击者只用一句把验证码发到某个邮箱,就让 Meta 的 AI 客服替没开两步验证的账号重置了密码。当 AI 接进账号系统,它就成了传统鉴权之外的一道新越权入口。
阅读全文 2026-06-11 microsoft
微软自研推理模型发布,真正的目标是摆脱对 OpenAI 推理能力的依赖。能力是否追平 GPT/o 系是其次,从数据到加速器全栈自有才是这步棋的底牌。
阅读全文 2026-06-11 microsoft
微软下架了 70 多个 GitHub 仓库,因为攻击者把窃取凭证的恶意代码注入了 Azure 和 AI 编码工具的依赖里。这对建设者意味着该重做哪几件事。
阅读全文 2026-06-11 nvidia
Apple 把 PCC 的服务端推理交给 NVIDIA Blackwell 机密计算 GPU,还放到了 Google Cloud 上。这一步把隐私从一句政策承诺,变成可被密码学验证的芯片状态。
阅读全文 2026-06-11 openai
Lockdown Mode 面向记者、异见者等高危用户,潜台词是 OpenAI 承认默认配置对这类人不够安全。它把产品安全从模型对齐推到了用户侧的威胁建模。
阅读全文 2026-06-11 formal-verification
一名开发者用 Opus 4.8 自主跑出了一份带 Lean 形式化证明的多边形求交算法,此前的模型做不到。证明要么成立要么不成立,这比刷分诚实,但一个案例不等于普遍能力。
阅读全文 2026-06-11 disinformation
The Intercept 扒出一个由美军特种作战南方司令部运营、用大语言模型批量生产的拉美亲美内容农场 La Tilde。它的意义不在内容多逼真,而在生产成本被砍到几乎为零、归因被刻意做模糊。
阅读全文 2026-06-11 niantic
数亿玩家为游戏奖励拍下的街景,训练了一套现在准备装进军用无人机的视觉导航模型。同意给游戏,不等于同意给武器项目。
阅读全文 2026-06-11 data
IncludeSecurity 逆向了 Bright Data 嵌在消费 App 里的 SDK:一份匿名可读的配置,把智能电视变成代为 AI 抓取训练数据的住宅代理出口,默认每月放行 500 MB 别人的流量。
阅读全文 2026-06-11 openai
S&P Dow Jones Indices 拒绝为 SpaceX 快速放行,也明确不会为 OpenAI、Anthropic 豁免盈利门槛。私募估值再高,也换不来被动指数资金的自动买入。
阅读全文 2026-06-11 reinforcement-learning
Sutton 把发现拆成变异、评估、选择性保留三步,断言纯生成式 AI 缺了评估这一环。论点的内核是对的,但他自己列的反例已经拆掉了对 LLM 路线的那部分结论。
阅读全文 2026-06-11 theory
新论文证明 transformer 表示某些语言时比时序逻辑、循环网络指数级简洁,比有限自动机双指数级简洁。这是一个关于规模的解释,不是一份工程指南。
阅读全文 2026-06-11 policy
白宫发布全国性 AI 框架,向国会建议用单一联邦标准取代各州 AI 法规。表面是减少合规碎片,真实效果是抬高州级监管门槛、让大公司受益。
阅读全文 2026-06-10 anthropic
Anthropic Project Glasswing 暴露的核心问题,是前沿 cyber agent 如何被授权、记录和追责,而不只是模型能力。
阅读全文 2026-06-10 anthropic
Anthropic 扩展 Project Glasswing 的真正信号,是把 Claude cyber agent 放进漏洞分诊、披露、修补和部署流程。
阅读全文 2026-06-10 apple
Gemini 在 Apple 生态里的价值不只是给 Siri 供能,而是进入系统级开发者入口;Google 得到的是隐藏但高杠杆的分发。
阅读全文 2026-06-10 apple
Apple 与 Google 的合作重点不只是 Siri 变强,而是外部模型如何在 Private Cloud Compute 里被去品牌化、被 Apple 叙事吸收。
阅读全文 2026-06-10 openai
广告试点和个人财务体验同时进入 ChatGPT,说明 OpenAI 的核心挑战正在变成如何让上下文、商业化和信任共存。
阅读全文 2026-06-10 openai
ChatGPT 的广告和个人金融说明,OpenAI 面临的商业化问题核心在于哪些上下文能被商业化、哪些必须隔离。
阅读全文 2026-06-10 anthropic
Fable 5 的真正信号不是能力封顶,而是 Anthropic 首次公开把对齐推进到模型可以在特定请求上不全力帮你——而这道边界落在用户无从验证的灰区。
阅读全文 2026-06-10 cohere
Cohere 这家一向做封闭企业模型的公司,首次拿出面向开发者的 agentic 编码模型:30B MoE(3B active)、Apache 2.0、单张 H100 就能跑。比起 33.4 的 Coding Index 分数,更值得 builder 记住的是它押的方向:主权自托管。
阅读全文 2026-06-10 nvidia
Cosmos 3 开放模型、脚本和数据集,让更多团队能从同一起点做物理 AI;但官方优化路径会提高 NIM、Dynamo、NGC 和 Blackwell 的默认性。
阅读全文 2026-06-10 nvidia
NVIDIA Cosmos 3 的重点不在生成一段漂亮视频,而在让世界生成、动作生成和后训练脚本进入机器人团队的默认训练循环。
阅读全文 2026-06-10 deepseek
DeepSeek V4 的核心变化不是把 1M context 写进功能清单,而是让长上下文从能力展示进入成本、路由和产品默认值的重新设计。
阅读全文 2026-06-10 deepseek
DeepSeek V4 的信号是 1.6T MoE 配上推理侧工程把前沿能力做到可负担、可自托管。开放权重阵营第一次在单位 token 成本与吞吐上拿到领先位,不再是又一个跑分名次。
阅读全文 2026-06-10 deepseek
DeepSeek V4 同时给出开放权重和当天可用 API,真正挑战闭源前沿模型的是部署自由与低迁移成本的组合。
阅读全文 2026-06-10 google
一家德国地方法院认定,Google 的 AI 概览是 Google 自己的言论而非搜索结果,要对其中的虚假指控直接负责。这推翻了搜索引擎运营方惯有的中介免责,谁生成谁担责的红线,第一次被法律明确划出。
阅读全文 2026-06-10 xai
xAI 给 Grok Imagine 1.5 Preview 标出输入图收费、分辨率分层的每秒输出价格和 60 RPM 限额,这比单条 demo 更重要:视频生成进入可预算、可限流、可接入采购流程的 API 形态。
阅读全文 2026-06-10 xai
xAI 在 Grok Imagine 1.5 发布页里强调 sequence:逐帧布置、分别动画、再串成一致的长场景。对 builder 来说,API 化视频生成最值得验证的是它能否成为流水线节点,而不是某条样片是否惊艳。
阅读全文 2026-06-10 huggingface
OpenEnv 从单项目走向技术委员会协调,说明开源 agent 训练需要可信治理,而不只是一个接口实现。
阅读全文 2026-06-10 huggingface
Hugging Face 推动 OpenEnv 成为协议层,真正解决的是开源 agentic RL 训练环境碎片化,而不是再造一个奖励框架。
阅读全文 2026-06-10 moonshot
模型会被比价、被替换,握住终端编码 agent 这个运行时却能握住分发。MIT 开源、可接非 Kimi 模型的 Kimi Code CLI,是月之暗面从卖模型转向卖工作流入口的明牌。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 内置 coder、explore、plan 子 agent,并让它们在隔离上下文里并行工作。这个设计的价值,是把 agent 编程拆成可分工、可监督、可组合的流程,明显超出把模型接进终端的包装层。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 把读写代码、执行命令、抓取网页和规划行动放在同一个终端工作流里。这个闭环能提升开发效率,也会把权限、审计和人工监督推到更前面。
阅读全文 2026-06-10 microsoft
MAI-Code-1-Flash 表面是一个轻量编码模型,真正值得跟踪的是它进入 GitHub Copilot 和 VS Code 后,微软有了让低成本自研模型获得默认路径曝光的机会。
阅读全文 2026-06-10 microsoft
微软把 MAI 模型、Frontier Tuning、Azure/GitHub 工作流放到一起,核心信号是把企业调优路径和反馈回路沉淀进自家模型体系;这会增加内部路由选项,也会加深客户对微软栈的绑定。
阅读全文 2026-06-10 microsoft
Build 2026 上微软一口气发了 7 个 MAI 模型,反复强调不蒸馏任何第三方、从干净授权数据从头训。这不是追平谁,是系统性减少对 OpenAI 的依赖。Azure 上的模型供应链和绑定逻辑该重估了。
阅读全文 2026-06-10 xiaomi
MiMo-V2.5-Pro-UltraSpeed 的 1000 tps 价值不是速度炫技,而是让长输出、并行采样和实时交互的单位时间成本重新计算。
阅读全文 2026-06-10 xiaomi
MiMo UltraSpeed 的实时 agent 想象很强,但 limited capacity 与申请制说明它更像高价值能力通道,而非稳定通用生产入口。
阅读全文 2026-06-10 minimax
MiniMax M3 的关键不是又一个 1M context,而是 MSA 试图从注意力结构上降低长上下文每 token 成本。
阅读全文 2026-06-10 minimax
M3 的真信号是 MSA 把 1M 上下文的每 token 算力压到上一代的 1/20、解码提速 15 倍。长上下文 agent 的成本曲线第一次被一家中国实验室往下按。但发布日权重并未开放,过 10 天再开源这句承诺是诚意的试金石。
阅读全文 2026-06-10 minimax
M3 的难点不是模型卡片,而是 vLLM 等 serving 生态能否及时支持 MSA 的块级稀疏注意力。
阅读全文 2026-06-10 nvidia
开放权重的 omnimodal 物理 AI 模型,真正动机是卡位机器人时代的上游软件栈——把开发者锁进它的工具链。
阅读全文 2026-06-10 openai
OpenAI 据报正秘密递交招股书草案,联手高盛、摩根士丹利,最快今年 Q4 上市,私募估值已逾 8500 亿美元。融资只是表层。更要紧的是,一家靠叙事和巨额亏损换增长的公司,要被套上披露、盈利路径和治理审查的公开市场纪律。
阅读全文 2026-06-10 openai
GPT Image 2、GPT Realtime 和 GPT-Rosalind 说明,专项模型真正的难题会从能力转向权限、责任、数据边界和评估。
阅读全文 2026-06-10 openai
GPT Image 2、GPT Realtime 和 GPT-Rosalind 的共同信号,是 OpenAI 正把一个旗舰模型叙事拆成多个可采购、可治理、可嵌入的专业产品表面。
阅读全文 2026-06-10 anthropic
Anthropic 与 PwC 的扩展合作,不只是一个渠道 logo;真正的价值在于把 Claude 嵌进咨询交付、行业流程和客户信任。
阅读全文 2026-06-10 anthropic
PwC/Claude 组合真正适合 regulated workflows 的原因,是 auditability、risk controls 和责任边界,而不是 agent 把事情做快这一点。
阅读全文 2026-06-10 alibaba
Qwen3.7-Max 的关键变化,是把模型从单轮问答能力推向可承载长任务、工具调用和跨脚手架执行的 agent foundation。对建设者来说,首要验证项是能否把真实工作交给它持续推进。
阅读全文 2026-06-10 alibaba
Qwen3.7-Max 的战略价值不只来自模型能力,而来自阿里把它放进 Model Studio、兼容接口和云上执行环境里的企业 agent stack。真正的问题是企业能否把它接入受控工作流。
阅读全文 2026-06-10 alibaba
Qwen3.7-Max 的真正信号不是又一组跑分,而是一个能无人值守跨上千步、连跑数十小时的 agent 底座。阿里押的是和西方实验室同一条长任务可靠性战线,对 builder 该问的是能不能放手让它跑。
阅读全文 2026-06-10 xai
Grok Imagine 1.5 Preview 走 xAI API + 官方 SDK 路线,把图生视频当成可编程后端来卖。这是切入 Sora/Veo 主导格局的绕侧翼打法,对 builder 意味着多了一个能写进代码的视频生成选项。
阅读全文