最新科技资讯 第88页
聚合 AI、科技、商业、硬件与开发工具的最新内容,按时间顺序查看第 88 页精选文章。

OpenAI亲手否决自荐基准:SWE-Bench Pro三成任务被判'不及格'
OpenAI对自己去年力荐的编程基准SWE-Bench Pro做了一次自我审计,认定约30%的公开任务存在缺陷,当场撤回此前的推荐。更值得留意的是,部分问题GitHub上早有编号明确的报告,而这次审计的裁判和运动员,某种程度上是同一批人。

OpenAI亲手拆了自己力荐的编程基准:SWE-Bench Pro三成任务是坏的
OpenAI审计Scale AI打造的SWE-Bench Pro,发现731个公开任务里约三成存在测试过严、提示误导等缺陷,人工复核揪出的坏任务比例(34.1%)高于自动化流水线(27.4%)。这是OpenAI一年内第二次拆穿主流coding基准的可信度,此前它刚建议行业从SWE-bench Verified转向Pro,如今又亲自撤回这条推荐。

OpenAI立下国家安全三条红线,问题是谁来验证
OpenAI发布《国家安全原则》,同时披露一个月内与八国及欧盟机构建立网络防务信任合作、扩大生物安全模型访问权限,其国防业务已包含一份两亿美元级合同。但公司自证式的“不用于监控、不用于自主武器”承诺至今没有第三方审计,参议员沃伦已在国会追问合同细节能否公开。

AI写的PR描述,为什么比没有还糟?
工程师Kenton Varda在团队内部禁用AI生成的PR描述、commit信息和issue文字,理由是这类文本详细复述代码本身就能看出的细节,却漏掉审查者真正需要的意图说明。问题不是AI写得不够细,而是它擅长的信息维度和PR消息的核心价值本来就不在一个频道上。

三星预约新机送30美元,钱却不能买手机
三星在7月22日Unpacked发布会前推出预约活动,预约后预购可得30美元三星积分,但官方细则显示这笔钱不能抵手机价格,只能买配件,且退货即作废。这更像是三星借发布会造势、把用户导向Galaxy Ring等配件生态的一次精准营销漏斗,而非真让利。

爱尔兰退场,塔尔萨押注:一家无人机公司的双面表态
Manna Aero一边撤出爱尔兰本土配送业务,一边在俄克拉荷马州塔尔萨建厂,计划三年内提供约1000个岗位。公司把这次扩张归因于美国监管环境变好,但这套说法目前只有创始人一方在讲,缺乏独立信源和具体政策依据。

麦康奈尔病床假照翻车:Google水印赢了一局,但这场胜利经不起细看
一张米奇·麦康奈尔病床惨状的AI假图疯传后被Snopes借助Google的SynthID水印戳穿,这被称为'罕见但重大的胜利'。但破案的关键其实是生成工具主动参与水印计划,而非系统主动识破谎言,这恰恰暴露了深伪检测的真实覆盖率有多窄。

《Avowed》续作开发顺利仍被砍,微软转向做新《辐射》游戏
微软Xbox新一轮"重置"影响约3200个岗位,Obsidian同期裁员近四分之一,开发进展顺利的《Avowed》续作连同其他项目一并取消,产能转去做由Josh Sawyer带队的新《辐射》游戏。微软赌的是一个空窗8年、但剧集正热的成熟IP,而不是继续为一款口碑不错的原创续作买单。这笔账短期划算,长期是拿Obsidian的原创能力去还债。

8分钟数据、23亿估值:机器人的ChatGPT时刻是真是假
General Intuition称用视频游戏动作数据训练的模型,只需8分钟真实数据微调就能让四足机器人在办公室里zero-shot行走,公司借此叙事一个月内把估值从传闻的20亿美元推到23亿美元。但目前所有证据只来自公司自证的单一演示,没有第三方复现,也没有披露失败率和任务边界。

Roost想让你慢下来,自己却红得很快
“慢社交”App Roost靠虚拟鸟类按真实飞行速度送信,主打反即时、反算法,五周内用户号称从1万涨到近30万,但这条增长曲线全部来自创始人自述,缺乏第三方数据佐证。更值得玩味的是,它标榜逃离算法病毒传播,破圈却恰恰靠了一条在Threads上疯传的帖子。

Grok 4.5发布:马斯克对标错了一代,还有个神秘模型全程领跑
xAI发布Grok 4.5,定价比Opus级模型便宜不少,但摊开官方自己公布的跑分表会发现,马斯克拿来对比的是旧一代Opus 4.7,而不是同代的Opus 4.8——在Grok重点强调的SWE Bench Pro测试里,Opus 4.8其实领先Grok 4.5。榜单里还有一个叫Fable(max)的模型全程夺冠,却没人解释它是谁。

微软开源Flint:AI画图表,先过编译器这一关
微软研究院联合人大IDEAS Lab开源可视化中间语言Flint,用语义类型和编译器把AI生成的图表规格翻译成Vega-Lite、ECharts、Chart.js配置。它省的是调试底层参数的成本,不是画图能力,效果全看数据语义标注是否到位。三个后端渲染能力并不对等,Flint也不是BI工作流的替代品。

Google 出的考卷,自家 Gemini 却排到第五
Google 更新了自研的 Android 开发基准 Android Bench,新增 Claude Fable 5、GPT 5.5 等八款模型,结果自家 Gemini 3.1 Pro 反而跌到第五名,排在 GPT 5.4、Claude Sonnet 5 和 Claude Fable 5 之后。更值得琢磨的是,这份自己出题的榜单,本身也在改版中悄悄挪动过分数。

美国首颗「商业核动力卫星」升空:真正的突破不在电池,在审批文件
迈阿密公司City Labs的BOHR立方星升空,被称为「首颗商业核动力卫星」,但其贝塔伏特电池功率只在纳瓦到微瓦量级,远不及政府用了六十年的RTG。真正的看点是它趟通了FAA与NRC两道核发射审批关卡,而「商业」标签本身,因为没有独立客户、疑似依赖国防经费,还经不起细看。

伊朗摧毁10亿美元死神无人机?这笔账没人真正算清
美国空军在伊朗战事中损失大量MQ-9死神无人机,五角大楼由此启动廉价替代招标,但10亿美元/近30架的说法其实来自国会研究处和媒体估算,并非CENTCOM官方数字。更容易被忽视的是,这个刚曝光的廉价替代项目和三周前已经落地的协同作战飞机合同,是两件完全不同的事。

点一下'不感兴趣'能砍掉八成内容,但TikTok算法几天就把你打回原形
美国西北大学团队用90个傀儡账号实测发现,TikTok的'不感兴趣'按钮能让同类内容减少约84%,远胜单纯划走的48%,但只要用户后来多看几秒同类视频,算法就会悄悄把内容推回来。Instagram、YouTube也有类似的半吊子控制工具,说明这不是TikTok一家的产品瑕疵,而是整个推荐系统把'看了多久'看得比'说了什么'更重。

还能上网却被判报废:数千台路由器为何被一键停用
澳大利亚ACCC的宽带测速项目6月30日收官,数千台SamKnows测速路由器被厂商远程停用,官方建议直接送电子垃圾回收。设备本身仍可正常工作,Cisco和ACCC都没有正面解释为何不发一份解锁固件,暴露的是公共项目收尾时硬件退役和电子垃圾责任的治理空白。

美国最便宜的电动车,可能压根不算车
菲亚特Topolino售价13995美元、时速19mph、续航46英里,官方直接把它归为微出行工具而非乘用车。它对标的不是主流家用EV,而是高尔夫车和电动四轮车。真正决定它能不能卖起来的,是美国各州对低速车的路权和牌照政策——这一点官方公告没有说清楚。

Google Photos上新AI剪辑术,水印真挡得住深度伪造吗
Google Photos新增Video Remix,靠Gemini Omni几秒内给旧视频补光、换背景、上艺术风格,14国订阅用户先用。但三个月内相册里已经堆了三个功能相近的AI生成工具,唯一的安全网SynthID水印,连Google自己都承认防不住裁剪和转码。

马斯克给X加了条'纠错私信',但绕不开那8.3%
马斯克宣布X将给曾互动过被纠正帖子的用户发私信提醒,功能尚未上线。但Community Notes真正的瓶颈是发布率不足一成,且能跑出来的注释往往依赖它标榜要抛弃的专业事实核查信源。

GPT-Live能边听边说,但没人给出延迟实测数字
OpenAI发布全双工语音模型GPT-Live,支持边听边说、随时打断,深度任务交给GPT-5.5在后台处理;但目前没有第三方数据能验证"更自然"的说法,早期用户反馈也不如官方宣传的那么颠覆。