人工智能资讯
聚合当前分类下的最新内容,按时间顺序查看第 1 页精选文章。

4.3GB内存跑80B大模型,这个数字你敢信几分
开源项目Swiftlet让Qwen3-Next-80B在4.3GB内存里跑起来,还首次把35B模型塞进iPhone,但峰值内存的测量方法从未公开,iPhone的理论提速和实测速度也对不上。工程思路值得肯定,数字本身还需要独立验证。

Steve Yegge 称 Opus 4.7 让 Gas Town 无法收工:Agent 升级最怕行为漂移
Steve Yegge 称,Gas Town 在 Opus 4.6 上运行良好,换到 4.7 后却反复陷入“还要再改两件事”,迟迟无法进入真正任务。这只是单个开发者案例,不能证明模型全面退步,却暴露了 Agent 上线常被忽略的指标:它能否稳定收敛并按时停手。

'肉体代理':AI时代的新词,四十年前的老毛病
程序员Niklas Gruhn造了个新词'meat proxy'(肉体代理),批评人们不加理解就转发AI输出;Simon Willison随手转发,却让这个俏皮词撞上了一条长达四十年的自动化信任研究谱系——人类形式上把关、实质上只是盖章工具的问题,从未被真正解决,只是换了个战场。

5万架无人机学会自己撞向目标,但那笔'1亿美元合同'厂商自己都没认过
美国公司Auterion给乌克兰400美元级Shrike自杀无人机装上AI自主追踪套件,失联后仍能凭摄像头锁定移动目标撞上去,5万架订单已从7月中旬开始交付。但外界反复引用的'1亿美元合同'厂商官方从未确认,'人在环路'具体兜底了什么,也远比宣传语含糊。

AI监考考出5倍学霸,却治不好作弊,还治出个假数字
墨西哥国立自治大学首次全程远程AI监考的招生考试,满分段人数暴涨到过去的四五倍,校方怀疑大面积AI辅助作弊,要求近5.8万名达标考生重考。但这场“AI监考翻车”的真正问题不是系统误伤无辜,而是它根本没拦住作弊。

陶哲轩的ChatGPT聊天记录,藏着AI真正拉大的差距
程序员Sean Goedecke拿陶哲轩与ChatGPT讨论雅可比猜想反例的公开对话做案例,指出大模型并未抹平专业差距,反而放大了领域专家的优势。真正决定产出上限的不是提示词技巧,而是用户能否凭专业知识识别错误、重构问题、持续纠偏。

GPT-Live的“六个月奇迹”:一份还没人验证过的自述稿
OpenAI发布长文自述GPT-Live如何用六个月拿掉话轮检测器、做出全双工语音系统,还宣称Go重写后p95延迟追平旧系统p50。但对照官方正式发布内容会发现,标题、术语、核心数字都对不上号,眼下这套说法只有OpenAI一家在讲。

AI模型开始学审美,但这门数据生意先死过一次
Intelligence旗下的DesignArena完成790万美元种子轮,靠530万用户的A/B投票为AI实验室提供人类审美反馈,官方称ARR已达6000万美元。人类偏好确实补上了自动评测测不出的“好不好看”,但用户量和融资额从来不是护城河——同赛道的Yupp融了3300万美元照样关门。

Cloudflare让Kimi、GLM省一半显存,却没说清"保护缓存"护住了什么
Cloudflare公布用KV cache量化、权重压缩和缓存完整性校验三项技术叠加,把Kimi K2.6、GLM等大模型的可用上下文和吞吐大幅提升,精度几乎无损。但博客里一句带过的"保护共享缓存",并未说清多租户环境下的旁路隔离问题,而所有性能提升数字目前也只是Cloudflare的自证结果。

苹果终于修好 Siri,但 AI 助手的及格线已经变了
新版 Siri 终于补上上下文理解、跨应用操作等关键能力,开始接近苹果在 WWDC 2024 上描绘的个人助理。问题在于,ChatGPT、Gemini 等产品已经把竞争推向推理、创作和任务执行;Siri 此刻的进步很实用,却更像一次迟到的补课。

欧盟AI标签新规生效:罚则写清楚了,标签长什么样还没人知道
欧盟AI法案第50条透明度义务8月2日正式生效,聊天机器人、深度伪造、AI公共议题文本都被纳入披露范围,违规最高罚1500万欧元或全球营收3%。但法条并未规定统一标签格式,技术指南和成员国执法细则仍在路上,规则生效和真正可执行之间还有一段空档。

条款里的悬念:Wispr Flow要做会议记录,但录不录音还没说
语音听写应用Wispr Flow更新服务条款,新增会议音频、转录、摘要等条款措辞,暗示会议记录功能即将上线。真正的看点不是它要不要做会议记录,而是它会不会像Fireflies、Otter那样派机器人录音,还是学Granola只抓系统音频不留档——这个选择将直接决定它的隐私麻烦有多大。

国会一年砸10万美元用ChatGPT,这本账只说了一半真话
众议院支出记录显示,过去一年ChatGPT拿走了国会付费AI工具支出的九成,是Claude的近八倍。但这份数据只统计直接付费采购,免费账号和微软、谷歌捆绑合同里的AI功能全部不计入,真实使用规模可能远超账面。

14小时、251美元,Claude近乎复刻一个1.6万行Go程序
Epoch AI 与 METR 推出 MirrorCode,让模型在无源码、无网络、无人干预的环境中重写完整程序。Claude Opus 4.7 用14小时和251美元通过 gotree 的2000/2001项测试,但高成本、训练数据污染和工程质量仍未解决。它更像一根能力上限探针:AI编程的竞争,正从生成几段代码转向能否持续数天完成交付。

开源模型的新计分板:数据来自五方,验证来自无人
Interconnects上线Artifacts Hub和Adoption Dashboard,想给开源模型的“采用度”建一把统一的尺子,数据缝合了Hugging Face、Open Router、Artificial Analysis和VAIL四家,但目前找不到任何第三方对这把尺子的检验。工具本身有价值,可信度还是空白。

MiniMax H3开放权重上线,ComfyUI同日支持:3060能跑,不等于跑得快
MiniMax发布首个开放权重视频模型H3,ComfyUI同日接入本地生成,音画同步一次生成、最高2K、最长15秒。官方称内存占用降到42.5GB,RTX 3060能跑,但生成速度和系统内存门槛都没给数字,能跑不代表能干活。开放权重也不等于能随意商用,许可条款还需另外核实。

阿里Qwen3.8-Max逼近头部:2.4万亿参数之外,开放方式更关键
阿里称Qwen3.8-Max拥有2.4万亿参数,部分自测成绩匹敌或超过Anthropic头部模型,但Arena文本、前端编码和视觉榜单仍有差距。它目前更像一个可信的追赶者;能否削弱美国闭源模型的控制力,要看权重、许可证、价格和开发者采用,而不是一次排名。

融资2000万美元不用PPT:June想用AI取代AI实施顾问
AI初创公司June用一轮没有PPT的2000万美元融资高调出道,号称能替代正在爆红的“驻场工程师”把agent部署进企业系统。但创始人嘴上说“补充”FDE,客户案例里说的却是“不想要FDE”,这道口径裂缝比融资数字本身更值得盯。

别再把Claude的话原封不动甩给我
科技博主Niklas Gruhn提出“meat proxy”一词,批评人们把Claude的回复原封不动转发到Slack、PR评论和群聊里;核查发现这个说法目前还没进社区热议榜,但它精准点破了一个正在发生的事——转发者省了时间,验证的活儿却甩给了下一个人。

AI迁移COBOL到Java,论文说91.90%覆盖率——剩下的8%才是真问题
一篇讲COBOL迁移到Java如何做确定性验证的工程论文,被外部标题包装成'AI迁移惹祸';论文核心其实是一套双运行环境+witness search+parity校验的方法,内部生产级案例上跑出91.90%分支覆盖率。问题是,这套'用AI验证AI'的工具本身只有3个样本、且未见第三方复现,离真正可信还有距离。

'Qwen3.8-Max'刷屏,阿里官方渠道却查无此模型
一篇自称阿里云官方发布的'Qwen3.8-Max'博客称模型达2.4万亿参数并将开源权重,但qwen.ai和GitHub官方渠道均查不到这个名字,唯一对应的真实型号Qwen3-Max在参数、训练数据和开源策略上都与文章描述不同。在权威信源确认之前,文章里那些具体数字都不宜直接采信。