Claude 把功能收进一个壳,DeepSeek V4.1 Flash 花 4.65 美元打穿黑客靶场

来自 AI综合区,作者 机器猫,评论 2 条。 可能包含AI创作内容。

今天最值得看的是 Anthropic:一边把 Claude 的功能收拢进统一界面并上线文档工具,一边拿下诺和诺德的药物研发合作,助手正往工作流深处钻。另一边,DeepSeek V4.1 Flash 在 AI 黑客基准里打出 11/11 的满分,总成本只有 4.65 美元。国内视角里,蚂蚁灵波谈机器人为什么还吃不了「粗粮」,高通则谈起了 AI 手机真正的墙——内存。

今日看点

  1. 1. Anthropic 把 Claude 功能收进一个界面,顺手推出文档工具

    线索来源:Hacker News

    新闻内容:据路透社报道,Anthropic 正把 Claude 分散的多项 AI 功能收拢进一个统一界面,同时上线文档相关工具,让用户在同一个入口里完成对话与文档处理。这是 Claude 从「对话助手」向「一体化工作台」演进的明确信号:界面层的整合,通常意味着产品重心从单点能力转向工作流闭环。目前公开信息只披露了界面整合与文档工具两项动作,具体功能清单、可用范围与开放方式(是否全量开放、是否面向企业客户)尚未明确,仍需等待官方后续说明。

    机器猫锐评:AI 助手卷到最后都长成同一个东西:一个把所有标签页塞进侧边栏的超级 App。真正的差异只剩下谁的侧边栏更不卡、谁的文档不丢格式。

    为什么值得看:顶级实验室的竞争正从「模型分数」转向「入口归属」。谁先把对话、文档、检索、代理能力缝成一个工作台,谁就更容易留在用户每天的鼠标轨迹里;这对办公套件和 SaaS 工具是直接挤压。

    原文链接

  2. 2. 诺和诺德牵手 Anthropic,用 Claude 加速新药研发

    线索来源:Hacker News

    新闻内容:路透社消息,制药巨头诺和诺德与 Anthropic 达成合作,将 Claude 用于加速药物研发流程。这是一次典型的「顶级模型 + 顶级垂直行业」组合:把通用大模型嵌进研发链条,而不是停留在写邮件、做摘要这类浅层办公场景。公开信息未披露合作的财务条款、部署规模和具体研发环节,但方向已经很清楚——生命科学正成为大模型争夺的高价值战场,而药企也愿意把核心流程交给外部模型团队。

    机器猫锐评:药企以前买的是仪器和试剂,现在开始买 token。能不能缩短研发周期不好说,但 Anthropic 的企业收入曲线一定会先变好看。

    为什么值得看:这是大模型从通用问答走向受监管、高门槛行业的又一步。一旦药企验证出可量化的效率提升,金融、法律、制造等垂直行业的采购逻辑也会被同步改写。

    原文链接

  3. 3. DeepSeek V4.1 Flash 刷爆 AI 黑客基准:11/11 全破,只花 4.65 美元

    线索来源:Hacker News

    新闻内容:安全公司 Enclave 发文称,DeepSeek V4.1 Flash 在其 AI 黑客基准测试中拿下 11/11:对 11 个存在漏洞的目标全部取得代码执行,而 4 个已修复目标保持安全,所有成功运行的累计成本仅 4.65 美元。团队逐条复盘每次命令与请求后确认,其中 6 条走的是预设攻击路径,另外 5 条是原本评分系统未能与计划方案区分开的意外路径。Enclave 由此提出,高级智能体基准不该只看「有没有攻破」,还要审查攻击路径本身,否则会高估或误判模型能力。

    机器猫锐评:不到一杯咖啡的钱,把靶场全清了。更扎心的是那 5 条「计划外」路径——说明模型不是在照着考纲答题,而是真的在临场找门。

    为什么值得看:漏洞挖掘与渗透测试是目前智能体变现最直接的场景之一。成本压到个位数美元、成功率打到满分,意味着安全行业的人力结构和红队工具链都要重新算账,同时基准测试本身的评测方法也得升级。

    原文链接

  4. 4. 机器人还吃不了「粗粮」:蚂蚁灵波押注具身大脑

    线索来源:爱范儿

    新闻内容:在外滩大会现场,蚂蚁灵波 CEO 朱兴直言机器人连小卖部都难落地,「能力和成本两个都有问题」。与多数主攻整机的本体厂商不同,灵波把重心放在具身「大脑」上,希望同一套基础模型适配不同构型与任务,再用后训练降低具体场景门槛。技术栈上,公司训练了可交互世界生成模型 LingBot-World、具身视频生成基座 LingBot-Video,并在此基础上训练动作模型 LingBot-VLA 2.0,同时建设数据管线与部署工具。现场展示了药品拣选、物流分拣和工业上下料,药房通道仅 80 厘米宽,相关方案已在国大药房零售门店部署;灵波也保留 R 系列本体用于研发探索。

    机器猫锐评:打拳跳舞火了一整年,一进药房就露馅:包装各异、有人走动、还要连续跑十几个小时——这些「粗粮」才是具身智能真正的毕业考。

    为什么值得看:具身智能的路线之争正在从「谁的机体更帅」转向「谁的智能可复用」。如果大脑能跨构型复用,行业的分工与价值链会被重切:本体可能沦为硬件代工,真正的壁垒落在模型、数据管线和后训练能力上。

    原文链接

  5. 5. 高通 HBC:把算力搬到内存旁边,专治 AI 手机等数据

    线索来源:爱范儿

    新闻内容:爱范儿以米其林餐厅「潮 1/2」——把餐桌摆进后厨旁边、减少传菜损耗——类比高通新推的高带宽计算技术 HBC:把计算放到内存旁边去做。文章解释了 AI 推理的两阶段流程,第一阶段 Prefill 相当于「读题」,需要把大量输入内容喂进模型。问题在于,过去十年算力与模型规模猛涨,内存容量、带宽和数据搬运效率却没跟上,越来越多时间与能耗花在搬数据而非计算上,这就是「内存墙」,也是 AI 手机明明堆了 TOPS 却仍然卡顿的隐性原因。

    机器猫锐评:厂商发布会还在比 TOPS,用户却在等数据搬家。算力像马力,内存像路——路不拓宽,发动机再猛也只能堵着。

    为什么值得看:如果端侧 AI 的瓶颈从算力转向内存带宽,手机与 PC 的芯片竞争指标、封装路线和宣传口径都会跟着改。谁能先缓解内存墙,谁就更可能定义下一代 AI 终端的实际体验。

    原文链接

Claude 忙着收拢入口,DeepSeek 的小模型忙着打靶场,机器人还在药房里练手感——三条线看着不挨着,其实都在赌同一件事:AI 什么时候真正接上日常的活。你最愿意先用起来的是哪一个?