人工智能资讯 第4页
聚合当前分类下的最新内容,按时间顺序查看第 4 页精选文章。

AI能拿奥数金牌,却可能编不出自己的解题过程
推理模型确实拿到了IMO金牌级战绩,也啃下了几道数学悬案,这一步是真的;但多项研究发现,把它写出来的思考步骤删掉三到六成、甚至换成错误内容,答案照样对,说明思维链未必忠实记录了内部计算过程;能算对题和能审计它怎么想,是两件不同的事,厂商的类人推理叙事目前还撑不住这道坎。

电梯调度的反常识:规则越复杂,高峰期未必等得越短
一套电梯调度模拟显示,高流量或少梯组场景中,简单的 LOOK 可能比每 5 秒重算一次的 RSR 更快;目的层派梯也只在超高层、大梯组等部分条件下占优。真正决定候梯体验的,不是系统掌握多少信息,而是客流变化后还能否及时改派和纠偏。该结果只来自模拟,不能直接当成所有楼宇和厂商系统的实测结论。

GPT-5.6降价80%,OpenAI在讲一个更大的算盘
OpenAI把GPT-5.6系列价格砍掉最多80%,同时用一堆内部数据证明模型和系统效率大幅提升,试图讲清一个降本-扩用-再投资的闭环故事。但这套闭环能否自我造血,还是给重资产扩张找一个体面说法,目前只能听OpenAI自己说。

耶鲁AI作弊案打成13项联邦诉讼:争议焦点从检测器滑向一份迟到的文件
耶鲁一名EMBA学生因期末考卷被指用AI代写、迟迟不交原始文件,遭停学判F,随后以13项诉因把母校告上联邦法院,打到2026年仍未开庭。真正让案件失控的,不是AI检测器判得准不准,是他面对反复索要底稿时沉默了数月。这提醒的是同一件事:技术证据靠不住时,程序和配合本身就成了证据。

1300万美元融资押注延迟:语音AI的下一关不是像不像人
语音AI公司Smallest.ai完成1300万美元A轮融资,累计融资超过2100万美元,押注小模型顶前线、大模型管复杂问题的双引擎架构。转接停顿有多长、口音识别准不准,公司都没给出实测数据,商业化目前只能算“有客户”。

曝光9天后,ISBNdb删除AI购书页面并改口:只是一次“需求测试”
图书数据公司ISBNdb在404 Media曝光其“为AI公司采购扫描纸质书”的营销页面后,9天内删除页面并改口,称从未购买、扫描或出售过书,那只是一次“市场需求测试”。但书商反馈的异常批量订单没有随页面一起消失,真正的问题也不是ISBNdb扫没扫过书,而是AI行业对“干净纸质文本”的胃口正把版权与二手书交易之间的灰区变成生意。

240万美元预付款报价被撤:一场AI代写疑云,逼作者自证'我写的'
一部新人小说在出版社竞价中报出240万美元预付款,随后因编辑怀疑文本出自AI而被撤约,书稿来源至今没有独立信源坐实。科幻作家Hugh Howey据此判断:出版变便宜用了不到十年,写作本身也可能被批量生成,以后作者得自证'这真是我写的'。这套推测目前更像行业焦虑的一次集中爆发,还谈不上已经验证的规律。

苹果新版《恐怖角》:老仇人这次不用刀,用无人机和AI
Apple TV把《恐怖角》改成10集剧,Max Cady服刑17年靠他人认罪出狱后,转而用无人机和AI折磨当年的辩护律师Anna与检察官Tom。三代改编换了三次复仇工具,这次换的是最容易被信任的日常技术。

私募信贷的Excel账本没换,Ryan Williams的AI代理先接进去了
Cadre联合创始人Ryan Williams的新公司Ellis AI拿到1000万美元种子轮,想用AI代理接管私募信贷基金的对账和月末结账;它不换基金现有系统,只负责接进去、标差异,重大决策仍留给人;真正的门槛在审计留痕和责任归属,不在种子轮的投资人阵容。

97%员工用上ChatGPT,Univé押注的不是工具而是人
荷兰保险公司Univé把ChatGPT Enterprise许可证激活率做到97%,员工自建约1500个定制GPT,宠物险理赔材料准备从数小时压缩到几分钟。这些数字来自企业自述,成本、错误率、实际回报仍未披露。真正值得同行学的,是治理先行、员工自建这条组织路径,而不是激活率本身。

OpenAI向欧盟摊开安全账本:主动合规,也在争夺规则解释权
OpenAI公开其模型安全、外部评测、内容溯源和网络安全措施,并表示支持欧盟GPAI实践准则及AI生成内容透明度实践准则。对欧洲企业和开发者,这意味着采购、部署与留证流程都要调整。我的判断是:主动合规值得肯定,但企业自述不能代替监管验收,技术优势也不该自动兑换成规则解释权。

DeepSeek V4-Flash公测:架构没换,官方喊'远超Pro'却没给对照分数
DeepSeek把V4-Flash API推入公开测试,同一套架构只做了一轮后训练,新增Codex原生适配;官方跑分数字好看,但没给出V4-Pro-Preview的对照分数,且升级只覆盖API,V4-Pro和APP端都没变;企业迁移和采购决策还得等价格、延迟和真实项目数据。

你保存的AI对话记录,正在变成供应商数据库里的一个指针
主流推理API正把推理过程、检索证据、上下文压缩和多智能体通信封装成只有供应商能读的私有状态,用户导出的记录只是残缍的一角。加密防的是客户端读取,不是防供应商读取,这不等于阴谋,但客观效果确实是锁定。真正该盯的是:换个供应商时,你手里的记录够不够自解释、能不能被接手。

本地模型接上 OpenAI 接口:0.1a0 插件测的不是兼容,是日志
Simon Willison 发布 llm-chat-completions-server 0.1a0,把本地已装的 LLM 模型统一包成 OpenAI Chat Completions 兼容接口。插件真正要测试的是 LLM 0.32rc1 新增的内容寻址日志,而不是接口兼容本身。OpenAI 消息格式早已是本地推理生态的常见外壳,这次的新意在验证日志去重,不在多一个兼容层。

AI 正在长出自己的界面语言,但不是每一处都能留下
设计师 Jim Nielsen 发现,流式吐字、闪烁等待态、瘦身细线图标正从 Claude、Codex、Cursor 这类 AI 聊天产品外溢到更多软件界面。闪烁等待态对应“等待”这个通用场景,更可能留下来;流式文本、米色配色更像这一波的表层跟风。AI 桌面应用图标比 Finder、Photos 细弱一大截,但这笔账部分要算在 Electron 头上,不能全推给“AI 美学”。

Luna 降价 80%,OpenAI 只解释了其中一部分
OpenAI 将 GPT-5.6 Terra 降价 20%,Luna 降价 80%,后者新价格为输入 0.20 美元、输出 1.20 美元/百万 tokens。官方披露的推理优化让整体服务成本下降 20%,却不足以单独解释 Luna 的降幅;更合理的判断是,技术提效托住了底价,市场竞争决定了标价。

库克暗示 iCloud+ 将提供 AI 额度升级,Siri 的下一道考题是值不值得付费
库克在财报电话会上确认,苹果考虑让用户通过 iCloud+ 购买更高的 Apple Intelligence 与新版 Siri 使用额度,但价格、额度和上线时间仍未公布。新版 Siri 计划随 iOS 27 于秋季广泛推出,苹果想把服务器算力接入服务收入体系。问题很直接:Siri 必须先证明自己足够好用,额度分层才有资格成为一门生意。

审稿人自曝:22篇论文15篇引用造假,两篇伪造作者仍获口头报告
两名研究者称,他们2026年夏天为NeurIPS、WACV和ECCV TerraBytes工作坊评审的22篇投稿中,15篇存在虚构引用、伪造作者或明显AI生成痕迹,其中两篇被举报伪造作者的论文仍拿到口头报告资格,只被要求改引用了事。这暴露的不是AI能不能写论文,而是同行评审为什么拦不住未经核实的内容。

AI写文档满嘴文案腔?一份1983年的航空手册标准把违规率砍了72.9%
GitHub开源项目SimpleEnglish把1983年航空业的ASD-STE100简化技术英语标准打包成AI Agent Skills技能,逼大模型按一句不超20词、一词一义、主动语态的规矩写文档。项目自测称在6个Claude模型、96次生成里违规率平均降了72.9%,但这只是自家正则检测器跑出的结果,离STE官方认证和事实准确还有距离。

AI项圈Friend涨到249美元:多了把声音,用途还是老样子
AI陪伴项圈Friend推出2.0版本,内置扬声器让它能用相对稳定的人格开口说话,售价从99美元涨到249美元,涨幅超过150%。除了陪聊,产品能干什么创始人也说不清楚,连关系定位都含糊成了知己、朋友、上帝三个词叠在一起。这次涨价真正要检验的,是陪伴本身能不能撑住2.5倍的价格。

写政策备忘录不是目的:施奈尔划出AI能不能代写的那条线
施奈尔提出用“工作任务”和“健身任务”区分该不该用AI代写;学生写政策备忘录属于后者,练的是构思和论证过程,不是最终文本;评价方式不变,学生和雇主都没有理由不选效率更高的那条路。