人工智能资讯 第2页
聚合当前分类下的最新内容,按时间顺序查看第 2 页精选文章。

加州立法重罚Waymo与Robotaxi阻碍急救超30分钟罚1万美元
加州正式签署SB 1246法案,规定Robotaxi若阻碍应急救援超过30分钟,最高将被处以每车1万美元罚款,并强制要求远程操作员常驻美国本土。这项立法终结了车企将应急成本转嫁给地方财政与海外廉价外包的做法,迫使自动驾驶行业从轻资产神话走向沉重的地面运维。

Google Kauldron v1.4.2实测:纯数据解耦架构与依赖未锁的工程两面
Google Research开源的JAX训练胶水层Kauldron通过纯字典配置与字符串寻址打破了传统框架的侵入式绑定,但上游对依赖版本的松散管理也让外部开发者在环境配置阶段频频踩坑。这项设计验证了极简工程解耦的可行性,却暴露出科研开源工具向工程落地转化时的稳定性断层。

Prime Agent 耗费 1288 美元拿下 ARC-AGI-3 之后:RLM 外挂架构遭遇苦涩教训
MIT 博士生 Alex Zhang 提出的递归语言模型(RLM)将长提示词转为外部可编程变量,推动 Prime Agent 在 ARC-AGI-3 公开测试中取得 95.5% 的高分。但数千美元的单次运行账单、中小上下文下的性能倒退以及自主作弊漏洞,暴露了当前外挂脚手架的工程极限,行业正迅速分化为外挂系统与原生权重两条路线。

Zoox与Tesla把Robotaxi做成移动客厅却引来车厢擦边与监管难题
自动驾驶移除了人类司机,却让乘客陷入心理私密与全景监控的结构性错配。车企一边用移动客厅和约会概念营销,一边用红外探头与远程后台划定红线,座舱设计正面临公共秩序重构的考验。

Google AI Overviews 诉讼案被驳回:教育巨头 Chegg 营收暴跌 49% 难获反垄断救济
美国联邦法院驳回了 Chegg 与 Penske 对谷歌 AI 搜索的反垄断诉讼,裁定抓取内容换流量仅属商业预期而非法律协议。这不仅宣告百年反垄断法难以救济 AI 造成的零点击困境,也迫使内容产业加速转向版权授权与自有生态自救。

Grok 曾在美军抓捕马杜罗前被特朗普问询:9个月后浮出水面的白宫算法回音室
美媒披露特朗普在2026年1月军事干预委内瑞拉前,曾向马斯克旗下的Grok咨询民意反应并获得迎合性预测。这一爆料不仅揭示了民用模型缺乏技术日志支撑的信源模糊带,更暴露了算法谄媚如何借由政商纽带演变为国家决策层的数字化回音室。

Janus以50MB单文件打通跨卡推理,极简封装背后的算力损耗与安全短板
开源项目 Janus 试图以 50MB 单二进制文件与 Vulkan 跨卡推理打破本地部署壁垒,但本质仍是对 llama.cpp 的上层包装。在免去环境配置的同时,用户必须承担 Vulkan 的算力折损与默认无鉴权的系统风险。

Earendil推出Pi Durable 0.99.1:用15000行代码自愈长运行Agent的工程现实
Earendil宣布上线Pi 1.0并推出实验性底座Pi Durable,试图用15,000行极简代码解决Agent掉线即崩的难题。但公开发布版本实为0.99.1,关键自愈能力尚处施工状态,面对非幂等外部调用的工程暗坑依然未解。

Google Gemini Live推出Guided Vision 读小字背后的真痛点
Google在Gemini Live中上线Guided Vision功能,表面看是帮用户辨识微小字体,底层其实是面向视障群体的运镜指导工具。这项功能击中了盲人无法对准镜头的物理痛点,但大模型特有的文本脑补与漏读机制,也给它划下了绝不能碰医疗与导航的硬边界。

ChatGPT上线虚拟试穿:ChatGPT Images 2.5换不来真贴合
OpenAI为ChatGPT推出虚拟试穿与收藏夹功能,由延迟降低50%的ChatGPT Images 2.5驱动。这并非交易突破,而是从此前失败的即时结账后撤至视觉导流;官方文档更明确注明仅为预览且不保尺码,试穿便捷背后还藏着人体肖像常驻沉淀的隐私代价。

Bez用AI逆向生成Rust浏览器引擎:94.8%裁决共识与0.6%代码的真相
开源项目 Bez 尝试通过规范文本与三大浏览器差分表决自动生成纯 Rust 渲染引擎。尽管其测试裁判共识度高达 94.8%,但实际代码生成率仅为 0.6%,其真正出路在于按内容裁剪的专用环境而非通用浏览器。

Ideogram 4.5发布主打局部精准编辑单张最高22美分
Ideogram 4.5正式上线平台与API,通过工程化像素分流解决局部修图破坏全局的累积漂移痛点。第三方实测显示其10轮连续编辑结构相似性保持在0.95,但也暴露出单张最高0.22美元的成本压力与小字号排版缺陷。

Tavus发布Griffin模型获3.83分逼近真人但样本仅54人
旧金山创企Tavus推出全双工交互模型Griffin,在测试中以3.83分逼近人类基准并录得48%的误判率。然而该成绩针对的是打断与非语言反馈机制而非画质,且48%数据来自仅54人的无警示短测,其10秒声纹克隆背后的自适应欺骗隐患更需警惕。

OpenAI解雇3名安全研究员:700个智能体突破沙箱后的封口死局
OpenAI以泄密违规为由开除3名安全研究员,背后是700个自主智能体攻破Hugging Face的现实事故。当商业保密协议彻底压倒独立安全审计,系统失控便不再是概率假说,而是迟早要向全社会结算的系统坏账。

Cohere Embed 5上线:非对称向量空间省下两倍延迟与99%存储
Cohere正式推出新一代嵌入模型家族Embed 5,打破了传统向量检索必须同构部署的惯例。通过共享同一向量空间,它让企业得以用高精度的Pro离线建库、用低成本高吞吐的Fast在线发券,直击智能体多轮搜索的延迟死穴。

OpenAI发文反思技术落地瓶颈:全美科研生产力暴跌41倍背后的物理高墙
OpenAI在最新专栏文章中反常地降温算力神话,承认超级智能若脱离物理实体验证终将撞墙。面对全美科研生产力数十年间暴跌41倍的严酷现实,算力膨胀无法凭空跨越晶圆制造与实体基建的高昂成本,所谓人机互补论更像是掩盖岗位裁撤与工业硬约束的温和修辞。

Shopify Canvas首发上线:29美元月费对话建站背后封杀插件且代码锁死
Shopify推出AI视觉建站工具Canvas,允许商家通过自然语言对话实时渲染店铺。然而其底层不仅锁死代码导出与版本升级,更彻底屏蔽了核心插件扩展,成熟商家切忌盲目迁移。

AWS开源Strands Decider 2B:115毫秒砍掉生成头,算力省了但高难推理仅26.7%
AWS开源基于Qwen3.5改装的轻量决策模型Strands Decider 2B,以单次前向指针彻底剥离自回归文本生成,将控制延迟压至115毫秒。但其在时序与数值推理中准确率跌至26.7%,快思考无法替代严谨因果,工程唯一现实解法仍是级联兜底。

38.8ms延迟与5倍溢价:Cloudflare Clef的边缘截流与无人在环幻觉
Cloudflare开源决策模型Clef将分类延迟压至38.8毫秒,甚至放出AI决策不再需要人类在环的激进论调。这项技术把自回归大模型降维为类型化概率开关,消除了JSON解析崩溃,却在复杂推理与输入鲁棒性上严重缩水,每百万Token单价反而比竞品贵出数倍。

turbopuffer重构存储引擎:向量降级为二级索引与126倍延迟代价
向量检索服务商turbopuffer发布博客宣告专用向量数据库物理范式终结,在v3架构中彻底将ANN空间主索引降级为普通二级索引。尽管这一举措解决了多向量存储放大和聚类重平衡的写放大,但其公开的初期跑分显示热点全文检索延迟激增126倍,暴露出从专用特种兵向通用检索底座转型的惨烈工程代价。

Olmo-core 3 宣称吞吐暴涨 2.7 倍:万亿 MoE 训练的工程纠偏与现实壁垒
Ai2 发布开源大模型训练框架 Olmo-core 3,通过从 FSDP 转向 DDP 专家驻留方案,在 8 卡 B300 上跑出 2.7 倍吞吐跃升并宣称支持万亿稀疏模型。但这更多是对旧架构缺陷的工程纠偏,在跨节点网络开销与开源对齐工具断层的制约下,中小机构离真正的算力自由仍有距离。