人工智能资讯 第41页

聚合当前分类下的最新内容,按时间顺序查看第 41 页精选文章。

大模型的“反向诅咒”:会背答案,不等于真懂关系
人工智能 2026/6/23

大模型的“反向诅咒”:会背答案,不等于真懂关系

arXiv:2309.12288 论文《The Reversal Curse》指出,自回归大语言模型学到“A 是 B”后,并不会自动学会“B 是 A”。这刺破了一个常被营销话术含混带过的问题:模型记住文本关联,不等于拥有可双向调用的关系知识。

反向诅咒大语言模型The Reversal Curse
AI在《文明VI》里造了核弹,但输在更普通的事上
人工智能 2026/6/23

AI在《文明VI》里造了核弹,但输在更普通的事上

一名曾参与英国政府AI工作的作者,把大语言模型接入《文明VI》,让它长期经营一个文明,并扩展成CivBench基准。 最有价值的结论不是AI会不会造核弹,而是它在复杂系统里能否持续看见问题、执行计划、及时换目标。 对AI采购和评测团队来说,选择题高分只能说明会答题,不能直接说明能治理流程。

大语言模型CivBench文明VI
Omio 接入 OpenAI:旅行 AI 的真考题,是能不能接住真实订单
人工智能 2026/6/23

Omio 接入 OpenAI:旅行 AI 的真考题,是能不能接住真实订单

Omio 将 OpenAI 模型接入实时交通库存和预订系统,让对话式旅行查询不再停在攻略问答,而是指向可预订行程。更关键的变化在内部:Omio 称部分产品开发时间降至原来的约 20%,AI 开始进入研发和运营链路。这个案例还不能证明 AI 改写 OTA 格局,但足以提醒旅游平台和数字化团队:入口、库存校验、权限审计和责任边界都要重做。

OpenAIOmio旅行 AI
Mythos 未必是神话,但这次漏洞盲测把护城河问穿了
人工智能 2026/6/23

Mythos 未必是神话,但这次漏洞盲测把护城河问穿了

一位开发者用自建 Nelson 基准测试了 9 个 Mythos 文档披露过的真实漏洞,公开模型没有一个全找出来,Mythos 仍可能更强。更反常的是,低价中国模型和部分小模型在盲测里表现抢眼,大厂模型、代理工具和安全护栏反而不稳。对开发者和采购负责人来说,这事不能当权威榜单看,但足够提醒:安全审计 AI 的门槛不只在模型参数。

AI安全审计AnthropicMythos
YOLO26 的重点不是更会刷榜,而是更少折腾部署
人工智能 2026/6/23

YOLO26 的重点不是更会刷榜,而是更少折腾部署

Ultralytics 在 2026 年 1 月发布 YOLO26,覆盖检测、分割、姿态、OBB 和分类五类视觉任务。它的关键变化是取消 NMS、移除 DFL,主打低延迟、边缘部署和导出兼容。对视觉工程师来说,这不是一场单纯的精度竞赛,而是一次部署成本的再计算。

YOLO26Ultralytics实时视觉模型
VibeThinker-3B 冲进一线推理区间:小模型撬开的不是通用智能,而是可验证推理
人工智能 2026/6/23

VibeThinker-3B 冲进一线推理区间:小模型撬开的不是通用智能,而是可验证推理

VibeThinker-3B 论文声称,3B 稠密模型在 AIME26、LiveCodeBench、LeetCode unseen contests 等可验证推理任务上进入一线系统性能带。重点不是小模型全面击败大模型,而是数学、代码这类答案能验证的任务,正在被压缩成可训练、可蒸馏、可低成本部署的窄能力。真正要盯的是评测可信度、test-time scaling 成本,以及它能否从榜单走进产品链路。

VibeThinker-3B小模型可验证推理
科技巨头把AI写进裁员理由:岗位在变薄,不只是公司变差
人工智能 2026/6/23

科技巨头把AI写进裁员理由:岗位在变薄,不只是公司变差

2026年以来,Oracle、Amazon、Meta、Cisco等公司在裁员、重组或岗位调整中提到AI。更准确的判断是:AI正在替代一部分流程型工作,也被企业用来消化过度招聘、压缩层级和重配预算。对从业者和管理者来说,关键不是猜谁被AI取代,而是看哪些岗位价值正在被重新定价。

AI裁员人工智能岗位替代
Claude Code 把 CUDA 图像修复模型搬进浏览器,真正看点是工程链路
人工智能 2026/6/23

Claude Code 把 CUDA 图像修复模型搬进浏览器,真正看点是工程链路

Simon Willison 用 Claude Code 将依赖 PyTorch 和 NVIDIA CUDA 的 Moebius 0.2B 图像修复模型转成 ONNX,并通过 ONNX Runtime Web + WebGPU 做成浏览器 Demo。关键不在 Moebius 是否足够强,而在编码代理已经能推进模型转换、部署、前端 UI 和缓存这些端到端工程任务。限制也很硬:这不是官方浏览器版,首次加载仍要下载约 1.3GB 模型文件。

Claude CodeMoebius 0.2B模型转换
得州致命车祸后,特斯拉把争议拉回司机脚下
人工智能 2026/6/23

得州致命车祸后,特斯拉把争议拉回司机脚下

得州 Katy 一辆 Tesla Model 3 冲入民宅,76 岁 Martha Avila 死亡,司机 Michael Butler 称事发时车辆处于 Autopilot 状态。特斯拉 Autopilot 软件负责人 Ashok Elluswamy 随后在 X 上引用车辆数据反驳,称司机手动全踩加速踏板,撞击速度达 73 mph。现在不能判定 Autopilot 肇事,也不能把特斯拉单方解读当结论,关键要等车辆日志和官方调查还原人机接管边界。

特斯拉Autopilot自动驾驶
GLM-5.2 能本地跑了:744B 模型进了 GGUF,但别低估 256GB 门槛
人工智能 2026/6/23

GLM-5.2 能本地跑了:744B 模型进了 GGUF,但别低估 256GB 门槛

Unsloth 发布 GLM-5.2 本地运行文档和 GGUF 量化版本,744B 总参数的 Z.ai 开源 MoE 模型可以走 Unsloth Studio 或 llama.cpp 本地加载。真正的变化是 Dynamic GGUF 把原始约 1.51TB 的模型压到 2-bit 约 239GB、1-bit 约 217GB,让 256GB 统一内存 Mac 或高内存工作站有了尝试空间。它不是普通消费级电脑的胜利,部署前仍要算清内存、速度和量化精度损失。

GLM-5.2本地部署量化
毕业十几年还要交 SAT:AI 把招聘逼回了旧筛子
人工智能 2026/6/23

毕业十几年还要交 SAT:AI 把招聘逼回了旧筛子

一位求职者在 YC Jobs 上看到,一家 ETL 类创业公司要求申请人提交本科 GPA 和 SAT/GRE/GMAT 等标准化考试成绩,不交就不再考虑,哪怕已经毕业多年。它不代表行业已经转向,但暴露了一个现实:AI 正在抹平简历、求职信和作业信号,公司开始重新寻找更可验证的人才筛选方式。旧 SAT 可以做参考,拿来当硬门槛就太粗糙。

AI 时代招聘标准化考试SAT
Kyber 招 Head of Engineering:AI 文档公司开始补硬工程
人工智能 2026/6/23

Kyber 招 Head of Engineering:AI 文档公司开始补硬工程

Kyber 正在纽约招聘 Head of Engineering,年薪 22万至28万美元,股权 0.5%至1.5%,并写明有通往 CTO 的路径。 这条招聘的重点不是头衔,而是公司阶段:Kyber 已把 AI 文档卖进保险等受监管行业,接下来要补可靠性、安全合规和工程团队。 对资深工程师来说,这不是纯管理岗;对关注垂直 SaaS 的读者来说,Kyber 的成败要看它能否把 AI 生成纳入企业责任链。

KyberAI 文档Head of Engineering
AI 写代码开始进入 agent loop:生产力工具,还是 token 无底洞?
人工智能 2026/6/23

AI 写代码开始进入 agent loop:生产力工具,还是 token 无底洞?

Claude Code 创建者 Boris Cherny 在 Meta @Scale 上称,agent loop 是真的,重要性可能接近从手写代码到 agent 写代码的变化。 它最先适配代码场景,因为代码有测试、PR、回滚和审查机制;但它还不是被大规模商业验证的新范式。 工程团队现在要看的不是概念热度,而是 token 成本、停止条件、权限边界和人工审核能不能管住循环。

AI 写代码agent loopClaude Code
AI 修出的纽约租房照,让租客为“不存在的家”多跑一趟
人工智能 2026/6/23

AI 修出的纽约租房照,让租客为“不存在的家”多跑一趟

纽约这类高压租房市场里,生成式 AI 和虚拟布置正在把房源照片修得更像“理想之家”。问题不在修图新不新,而在它把租房信息不对称继续推向房东和经纪人一侧。对普通租客来说,代价是更多筛选、核验、通勤和看房成本。

生成式 AI租房市场AI 修图
Groq融到6.5亿美元,但它要证明的已经不是芯片了
人工智能 2026/6/23

Groq融到6.5亿美元,但它要证明的已经不是芯片了

Groq确认完成6.5亿美元融资,新估值未披露;上一轮估值为69亿美元。半年之前,NVIDIA通过非独家IP授权拿到Groq相关技术使用权,并带走Jonathan Ross、Sunny Madra等核心成员。钱能让Groq继续扩张推理云,但LPU的独占叙事已经松了。

GroqNVIDIAAI推理云
暴雪老工程师求职受挫:AI没毁掉招聘,但放大了最烂的筛选
人工智能 2026/6/23

暴雪老工程师求职受挫:AI没毁掉招聘,但放大了最烂的筛选

一名约10年经验、曾在暴雪工作7年的软件工程师,2025年6月随团队被裁后求职受挫,多次进入终面仍落选,还遭遇招聘方后续沉默。真正刺痛他的不是“岗位少”,而是CoderPad、HackerRank、AI监考和简历关键词筛选,把招聘变成低信任消耗战。AI没有发明烂招聘,但让作弊更容易、筛选更便宜,守规则的人反而更吃亏。

AI招聘筛选自动化筛选软件工程师求职
DeepMind 投资 A24:AI 进好莱坞,先过创作者这一关
人工智能 2026/6/23

DeepMind 投资 A24:AI 进好莱坞,先过创作者这一关

据《华尔街日报》报道,Google DeepMind 将向 A24 投资 7500 万美元,双方合作开发电影制作 AI 工具。 这不是收购,也不是 A24 全面用 AI 拍片,关键在于 DeepMind 想让一线艺术家参与工具打磨。 对 AI 产业和影视从业者来说,接下来要看的不是演示片多惊艳,而是版权、工会、素材归属和片场流程能不能谈拢。

Google DeepMindA24AI 影视工具
Alexa+ 在印度测印地语:亚马逊想补的不是语言包
人工智能 2026/6/23

Alexa+ 在印度测印地语:亚马逊想补的不是语言包

亚马逊已向部分印度用户发邮件,邀请他们在 6 月 22 日前填写印地语表单,加入 Alexa+ Beta 测试。Alexa+ 目前尚未在印度正式上线,发布时间不明,测试版也可能出现错误、信息不准确和本地发音问题。真正要看的,是亚马逊能否把生成式语音助手从英语市场带进高人口、多语言、语音优先的印度场景。

Alexa+Amazon生成式语音助手
Google投A24:AI电影工具要的不是片库,是片场入场券
人工智能 2026/6/23

Google投A24:AI电影工具要的不是片库,是片场入场券

WSJ报道称,Google将向A24投资约7500万美元,并通过DeepMind展开多年AI研发合作;这是Google首次入股电影公司。合作据称非独家、不开放A24片库数据,也没有公布具体电影项目。真正要看的不是AI能不能生成画面,而是谁来定义电影制作、发行和创作控制的新工作流。

Google DeepMindA24AI电影
Reflection 每月 1.5 亿美元租 SpaceX 算力:开源 AI 也开始交重资产入场费
人工智能 2026/6/23

Reflection 每月 1.5 亿美元租 SpaceX 算力:开源 AI 也开始交重资产入场费

Reflection AI 将从 2026 年 7 月 1 日起,每月向 SpaceX 支付 1.5 亿美元,租用孟菲斯附近 Colossus 2 数据中心的 Nvidia GB300 芯片及配套硬件。合同最高约 63 亿美元,但前三个月后双方可提前 90 天通知终止,不能直接当成 SpaceX 的确定收入。我的判断是:这单证明开放权重模型也被卷进了前沿 AI 的算力军备赛,SpaceX 则把马斯克系 AI 基础设施变成了更稳的出租生意。

Reflection AISpaceX算力租赁
GLM-5.2 刺到闭源模型的,不是榜单,是编码工作流
人工智能 2026/6/22

GLM-5.2 刺到闭源模型的,不是榜单,是编码工作流

Z.ai 在 6 月 16 日公开 GLM-5.2 的 MIT 许可权重,社区反馈显示,它在部分编码代理、设计和 agent 场景里已接近甚至挑战 Claude/OpenAI 前沿模型。 更关键的是,它开始进入 Claude Code 这类真实工作流,而不是只在 benchmark 上好看。 对开发团队和企业采购来说,这会带来一个现实动作:先别急着锁死闭源高价套餐,开源代理模型已经值得纳入评估。

GLM-5.2开源权重模型编码代理