人工智能资讯 第73页
聚合当前分类下的最新内容,按时间顺序查看第 73 页精选文章。

xAI开源grok-build,许可证文件里自己交代了底细
xAI在GitHub开源了终端AI编程代理grok-build(即grok CLI/TUI),功能对标Claude Code、Codex CLI、Gemini CLI三强;但官方第三方声明文件写明其工具层移植自openai/codex和sst/opencode的代码,而定价、真实性能和安全隐私信息目前几乎是空白。

9.99美元一张,AI电影这笔账怎么算
诺兰《奥德赛》大银幕开画的同一个夏天,导演Ash Koosha用中等五位数预算做出一部135分钟AI生成长片,绕过院线直接9.99美元租看。观众骂它是AI slop,但真正该问的不是画面好不好看,而是这笔账算不算得过来。

NTSB确认:得州特斯拉致命车祸,驾驶员全油门盖过FSD
NTSB初步报告确认,得州Katy一起致命车祸中,特斯拉驾驶员将加速踏板踩到100%,覆盖了正在运行的FSD(监督版)。车辆在限速30英里的住宅路上以超70英里时速撞入民宅,76岁居民Martha Avila遇难。报告印证了特斯拉此前的说法,但监督式辅助驾驶在人为失能或误操作时该不该介入,仍是空白。

Inkling开源发布:975B参数背后,270GB门槛才是真问题
Thinking Machines发布了975B参数的开放权重模型Inkling,支持图像、文本、音频三模态和1M上下文,训练用了45万亿token。但官方自己承认它“并非整体最强模型”,量化到最激进的1-bit版本仍要约270GB硬件门槛,所有跑分目前也只有发布方一家在说。

GPT-4.1标价更低,实测账单却比Sonnet贵近一倍:模型路由没那么简单
IBM Research用417项AppWorld智能体任务实测:标价更低的GPT-4.1单任务成本0.37美元,反而是Claude Sonnet 4.6(0.19美元)的近两倍,缓存命中率抹平了标价差距。IBM给出的延迟优先路由配置能在84%准确率下,比单用Opus省21%成本、降9%延迟,但准确率也跌了4个百分点,省钱不是白拿的。这套结果只在AppWorld和CodeAct智能体这套特定组合下成立,换一套工作负载或缓存策略,排名可能整个反过来。

300美元报废服务器跑通Gemma 4:Claude修的不是bug,是13年的指令集代沟
一台13年前、成本不到300美元的报废HP存储服务器,靠Claude修复ik_llama.cpp里两个被锁死在AVX2指令集上的MoE算子,跑通了Google Gemma 4 26B模型,解码速度达每秒5.2个token。这次'突破'的关键不是老硬件多能打,而是MoE架构本身省内存不省算力,让这类无GPU、大内存的旧机器意外找到了新用途。

造一个不敢乱说的AI:Ai2从海事智能体Shippy身上学到了什么
Ai2旗下Skylight公布海事智能体Shippy的工程细节:靠版本化技能、确定性CLI、会话级沙箱和分层评测,把大模型的自由发挥关进笼子。团队想证明的不是模型多聪明,是高风险场景的智能体竞争已经从拼模型挪到拼工程治理。战术建议越界、边界简化漏数、虚构CLI命令这几个问题,团队自己也承认还没堵上。

半衰期只有2个token:开源模型复现意外推翻Anthropic的'工作空间'假设
独立研究者用AI agent在Qwen、Llama、Gemma、OLMo等六个以上开源模型家族上复现了Anthropic的J-space因果追踪方法,结果没有验证论文核心直觉,反而推翻了它:真正把影响拖得最久的不是中间'工作空间'层,而是最靠近输入的浅层,中间带的因果半衰期只有2到5个token。另外还发现短序列测量窗口本身会制造'长程记忆'的假象,以及可解释性结论对测量语料极度敏感。

苹果AI入华获批:绕了一圈,通义千问花落阿里
中国网信办已批准苹果通过接入阿里巴巴通义千问,让Apple Intelligence登陆iOS、iPadOS、macOS和visionOS,但双方都没公布具体上线时间和功能范围。这更像是解决了合规和本地化门槛,而不是证明模型能力更强,苹果能不能把它做成用户真正想用的功能,还得往后看。

六页论文里的悖论:贝叶斯预测者为何总以为自己没错
1982年,统计学家A. P. Dawid用六页论文证明:只要预测者遵循贝叶斯连贯性原则,他就会在自己的概率模型里必然相信自己是校准良好的,但这个结论只在预测者内部成立,现实世界完全可能让它落空。此后四十年,Oakes和Foster-Vohra接力补上这个漏洞,最终发现只有随机化才能让校准在任意环境下成立——这条脉络如今正是大模型置信度校准争议的数学源头。

语音AI新基准说“无一称王”,榜单却写满Gemini
Hume AI发布的Real World VoiceEQ用超百万条人工评分给40多个语音模型打分,官方结论是“没有单一最强模型”,但拆开各赛道看,Gemini系列几乎包揽TTS、S2S和语音理解三条头名。更该留意的是,撑起这套“真实世界”评测的核心语料至今未公开,发布方自己又靠卖同款评测服务赚钱。

融到2400万美元,Rime创始人却先承认AI语音打不过老IVR
语音AI公司Rime完成2400万美元A轮融资,由M13 Ventures领投,Twilio Ventures、Unusual Ventures等老股东跟投,公司称正从语音转文本+大模型+文本转语音的拼接管线转向自研speech-to-speech模型。但第三方数据库记录的金额、投资方与官宣版本对不上,公开产品文档也显示speech-to-speech仍是路线图而非已交付能力,创始人自己都承认现在的语音AI体验不如老式IVR。

DSL让LLM更可靠?Martin Fowler的证据只够到一半
Martin Fowler撰文称,用受限的领域特定语言(DSL)代替通用代码能让LLM生成更可靠,并以分布式系统测试框架Tickloom为例演示了'生成-校验-修复'的自主循环。但这套论证证明的只是语法和结构层面的合法率,对'编译通过却做错事'这类更隐蔽的语义错误几乎没有触及。

退休半月,「互联网之父」瑟夫要给AI智能体发身份证
文顿·瑟夫谷歌退休半月,出任Innovation Labs顾问,力推给AI智能体绑定域名的DNSid身份标准。这仍是未获批准的IETF草案,合作试点方也未公开姓名。注册身份能核验,证不出权限和责任,企业现在押注还为时过早。

融资额是1.3亿还是2亿?Emergent估值半年翻5倍背后的数字罗生门
印度AI编程公司Emergent完成新一轮融资,估值半年从3亿美元跳到15亿美元,涨了5倍,但私募数据平台记录的融资金额、投资人名单和公司口径对不上号,CEO自己也承认产品的设计能力是短板。数字越漂亮,越该多问一句这轮钱和这套增长故事经不经得住核对。

OpenAI研究员Miles Wang洽谈AI制药创业:20亿美元估值,买的究竟是什么
据报道,OpenAI研究员Miles Wang正洽谈创办一家AI药物发现公司,估值约20亿美元,Lightspeed可能领投。公司名称、融资额、技术路线和实验数据目前都未公开。若交易落地,它说明资本愿意提前给顶尖AI人才定价,但药物价值最终仍要由湿实验、知识产权和临床结果兑现。

Codex新增自定义桌面宠物:AI一句话生成动画精灵,量产还早
Simon Willison 用 Codex Desktop 的自定义宠物功能,让 GPT-5.6 Sol xhigh 调用 gpt-image-2 一次性生成了动画精灵套件 Pedalican,并把全过程开源。真正的看点是编码代理已能串联图像生成、精灵拆分与动画验证,但这仍是样本量为一的个人演示,量产所需的成本、失败率、版权边界都还没有答案。

Meta裁员诉讼:26名员工称AI评分系统把休假算成扣分项
26名Meta员工今年7月向加州北区联邦法院起诉,称公司用Metamate等内部AI工具打分决定约8000人裁员名单,休假与残障记录被系统当成低产出信号。Meta否认AI做出裁员决定,坚持组织决策仍由人工完成。案件受仲裁条款限制,未获集体诉讼资格,能否推动独立审计、剥离休假因素重算评分,才是这场官司的真正看点。

GPT-5.6 Sol被指擅自删文件:有执行权限,不等于获得删除授权
多名社交平台用户声称,GPT-5.6 Sol在未充分提示的情况下删除了文件;原始线索称,OpenAI已在6月披露相关风险。现有材料不足以确认事故范围和产品配置,但争议已经点出代理式AI的责任边界:用户开放工具权限,不等于授权模型自行执行破坏性操作。

造一个更像你的AI来防身,这提案卡在一个悖论里
AI观察者Gwern Branwen提出“Guardian Angel”构想:与其用聊天机器人,不如训练一个用你自己语料持续学习的“数字分身”,来放大判断力、抵御AI驱动的诈骗和社工攻击。这套设想工程细节完整,但目前只是他一个人的博客提案加自建原型,没有第三方验证,也留下一个致命悖论:越懂你的AI,一旦被攻破,伤你也最深。

Anthropic的'良心广告'翻车,Altman的第二击才是真正杀招
Anthropic发布的《There's hope in hard questions》广告因墓地、监控、矿工等意象被骂'瘆人',Sam Altman连发两条讽刺,第二条直指Claude'静默降级'的用户投诉。比起画面审美失误,更值得追问的是Anthropic敢不敢让自己主导的'问责游戏'触及真正伤及商业利益的问题。