人工智能资讯 第85页
聚合当前分类下的最新内容,按时间顺序查看第 85 页精选文章。

NotebookLM 把研究资料剪成 60 秒短视频:Google 做对了入口,也埋下了浅化的坑
Google 正在向 AI Ultra 和 Pro 订阅用户推出 NotebookLM 的 Short Video Overviews,可把用户上传资料生成 60 秒竖屏 AI 视频,含 AI 图像和旁白。它不是 TikTok 或 YouTube Shorts 发布功能,而是把研究资料变成更容易消费的摘要媒介。效率是真的,风险也清楚:用户可能更快入门,也更容易把摘要误当理解。

ScarfBench 给 AI 编码代理划线:企业 Java 迁移不能只看能否编译
IBM Research 发布 ScarfBench,专门评测 AI 编码代理做企业 Java 框架迁移,覆盖 Spring、Jakarta EE、Quarkus。它的关键信号很冷:当前最强代理的行为成功率低于 10%,构建成功会明显高估迁移质量。对企业现代化团队来说,AI 可以做迁移草稿,但不能替代测试、部署验证和架构师复核。

Acti 把 AI 智能体塞进输入法,真正难的不是打字
Acti 已上线 iOS 和 Android AI 键盘,把 Gemini 驱动的智能体能力放进输入法,主打跨 App 调用和自然语言创建 Skills。看点不在“键盘加 AI”,而在输入法能不能成为智能体入口。成败要看三件事:系统权限、隐私信任、用户是否愿意为省下的动作付费。

AI 助手越顺手,我们越不认识机器
unix.foo 这篇文章把 1990 年代配置电脑玩游戏的麻烦,和今天 AI 助手的顺从放在一起看。它真正讨论的不是技术知识消失,而是人通过失败、排错、反复尝试建立的亲历式熟悉感正在变少。对开发者和技术教育者来说,关键动作不是拒绝 AI,而是保留日志、复核、测试和手动排错这些“不顺手”的训练。

Claude Sonnet 5 上线:Anthropic 把更强智能体能力放进中档价格
Anthropic 发布 Claude Sonnet 5,并把它设为 Claude Free 和 Pro 的默认模型,同时开放 Claude Code 与 API。它不是用来全面取代 Opus 4.8,而是用更低价格补上 Sonnet 与 Opus 之间的智能体能力空档。开发者和企业团队该重点看三件事:长流程任务成功率、真实 token 成本、安全拦截边界。

OpenAI的GeneBench-Pro:基因测试题真正难在脏数据
OpenAI公开了GeneBench-Pro的10个案例题,材料包括原始prompt、数据集和支撑材料,但没有公布模型成绩、排名或通过率。它的重点不是证明AI能做临床决策,而是把模型推到基因组学里最麻烦的地带:混杂因素、伪影、校准和不确定性。对AI生物医药团队和计算生物学研究者来说,接下来要看的不是模型会不会说术语,而是能不能少犯危险的确定性错误。

OpenAI GeneBench-Pro:31.5%之后,AI科研卡在判断力
OpenAI 发布 GeneBench-Pro,用 129 个合成但贴近真实的计算生物学任务,测试 AI 在基因组学、生物学和科研分析中的高阶判断。GPT-5.6 Sol Pro 最高通过率为 31.5%,比 GPT-5 起初低于 5%进步很快,但仍不到三分之一。真正的变化不是 AI 会不会跑流程,而是它开始被拿来考“能不能做研究判断”。

The AI Compass:AI 圈有了政治罗盘,但别把标签当能力
Simon Willison 推荐了 The AI Compass:一个由 bambamramfan 制作的 AI 立场测试,29 道题后把用户归入 30 种原型之一。它好玩,但不是严肃量表;真正有意思的是,它把 AI 圈的分裂压成了两条轴:GOOD/BAD 与 OVERHYPED/TRANSFORMATIVE。我的判断很简单:标签可以帮人看清分歧,但不能替代把模型接进真实工作流的能力。

Claude Science 公测:它不是新模型,而是 Anthropic 想塞进实验室的 AI 工作台
Claude Science 是 public beta app,不是新的 Claude 模型;它使用用户计划内已有模型,面向 macOS 和 Linux,开放给 Pro、Max、Team、Enterprise 用户。真正的变化在工具层:连接科学数据库、Python/R、HPC/SSH、Modal 和结果溯源。对生命科学团队来说,它更像一个待验证的科研工作台,而不是能替代专业工具和专家判断的万能助手。

Netflix《Wonka’s The Golden Ticket》用 AI 复刻 Gene Wilder 声音:授权之后,边界才开始
Netflix 真人竞赛节目《Wonka’s The Golden Ticket》将于 9 月 23 日首播,9 月 30 日播出两集结局;预告片旁白使用 ElevenLabs 生成的 Gene Wilder AI 声音,Netflix 称已获其家属同意。 这件事的关键不只是声音像不像,而是经典 IP 真人秀化和逝者声音复刻被放进同一个商业包装。 授权能解决一部分法律问题,但观众是否接受、平台是否充分披露、合同如何限制二次使用,才是更难的部分。

Google 推出 Nano Banana 2 Lite:图像模型竞争开始拼速度和成本
Google DeepMind 发布 Nano Banana 2 Lite,称其为最快、最高效的 Gemini Image 模型,入口已开放到 Google AI Studio,模型参数为 gemini-3.1-flash-lite-image。它的核心价值更像是降低图像生成与编辑的等待时间和调用成本,而不是宣称图像质量全面领先。对开发者和内容团队来说,这类 Lite 模型的意义在于让批量试稿、A/B 素材和快速编辑更容易进入日常流程。

OpenAI 修掉的不是模型问题,是 AI 基础设施的隐蔽裂缝
OpenAI 工程师批量分析 Rockset 过去一年的生产 core dump,把一组诡异 C++ 崩溃拆成两类根因:一台 Azure 物理宿主机的静默硬件错误,以及 GNU libunwind 中潜伏 18 年的竞态 bug。 这事的重点不在模型能力,而在可靠性方法:大规模 AI 产品已经不能只靠工程师盯单个 core dump 破案,必须把崩溃样本做成可查询、可归因的数据资产。 对 SRE、后端和基础架构团队来说,真正该补的不是口号里的“稳定性”,而是 crash 数据留存、标签体系、硬件相关性分析和开源依赖边界。

OpenAI Signals 数据:ChatGPT 增长正在从尝鲜转向日常使用
OpenAI Signals 显示,ChatGPT 个人用户注册 6 个月后,日均消息数比注册初期高 50%,尝试任务数量翻倍。更有意思的是,增长不只发生在英语和高收入市场:非英语为主用户已超过活跃用户一半,非洲、亚洲和低 HDI 国家相对增速更快。需要看清口径:地区数据是相对 2023 年 7 月的增长,不是绝对用户规模排名;性别相关结论来自姓名推断,不是用户自报。

特斯拉无方向盘 Cybercab 上路:Robotaxi 的账,终于要当街算
特斯拉开始在奥斯汀测试量产版 Cybercab:两座、无方向盘、无踏板,但车内仍有安全监控员。这还不是无人 Robotaxi 商业化,而是把多年承诺推到监管、成本和公众视线前。真正要看的不是车有多科幻,而是它能不能稳定、低成本、可解释地跑起来。

通用 AI 到企业里,账多半要靠专业化来结
Dharma AI 解读 Goldfeder、Wyder、LeCun、Shwartz-Ziv 2026 年论文,核心判断是:AI 在算力、数据和研发时间有限时,会被推向领域专精。通用 AI 未必失败,但通用性进入企业采购后,必须接受成本、可靠性和边界的审计。最受影响的是企业采购负责人和押注单一通用助手的产品团队。

Libby 准备过滤 AI 书籍,但选择权卡在标签是否诚实
Libby 准备上线 AI 内容控制,用户可选择是否显示 AI 生成或参与制作的内容。它保护的是读者的知情权和筛选权,不是自动识别 AI 图书的技术系统。最大软肋在源头:出版方、作者平台和内容供应商是否如实标注。

AWS拿10亿美元做FDE:企业AI竞争开始拼交付能力
AWS成立新的企业AI FDE内部组织,承诺投入10亿美元内部资源,不是对外投资、新基金或合资融资。工程师会临时嵌入客户企业,在客户AWS环境中部署定制化AI代理,并把工作流、AI技能和可复用模式留下来。我的判断是,企业AI竞争正在从模型参数和价格,转向谁能进流程、扛交付、帮客户把系统跑起来。

X 上线托管版 MCP:AI 工具接入更省事,但权限没放宽
X 推出托管版 MCP 服务器,Claude、Cursor、Grok Build 等兼容 MCP 的 AI 工具,可以通过用户自己的 X 账号权限连接 X API。 这次变化不是新增搜索、读帖、查用户或趋势分析能力,而是把过去开发者要自建的接入层交给 X 托管。 开发者会少做一段基础设施活,但仍要面对 API 套餐、速率、权限和反垃圾规则。

让 Claude 少说废话:企业开始按 token 抠 AI 成本
Caveman 让 Claude Code、Codex、Gemini 等编程代理少写寒暄和铺垫,创作者评估可减少约 65%–75% 输出 token,404 Media 测试约省 5800 个 token、65%。这件事的重点不是“让 AI 像穴居人说话”,而是企业 AI 使用正在从包月体验进入 token 核算。采购和开发团队接下来要管的,不只是买哪个模型,还包括默认模型、推理档位、输出长度和员工配额。

AI奇花种子涌入电商:假种子老骗局被生成式图片放大
eBay、Amazon、Etsy 上出现大量用 AI 奇异植物图兜售种子的商品,紫色巨型 teddy bear 向日葵、彩虹玫瑰、蝴蝶形和猫头形植物都在其中。假种子骗局早就存在,生成式 AI 改变的是造假成本和铺货速度。对买家来说,损失不只是一笔退款,还包括错种、搜索误导和未知植物进入环境的风险。

Lumo 2.0 上线:Proton 要证明隐私 AI 不是低配替代品
Proton 本周发布 Lumo 2.0,补上图像分析、图像编辑、图像生成、Projects 记忆和 thinking mode,并称多数查询最高提速 76%。 这次升级的重点不是超越 ChatGPT 或 Gemini,而是把隐私 AI 推到一场硬考试:少拿用户数据,体验还能不能跟上。 对隐私敏感用户,可以试;对重度团队迁移,最好先等第三方评测和更清楚的验证材料。