人工智能资讯 第24页
聚合当前分类下的最新内容,按时间顺序查看第 24 页精选文章。

744B参数模型塞进25GB内存,速度却慢到像道证明题
开源项目colibri用纯C引擎把744B参数的GLM-5.2塞进25GB内存的消费级机器,专家权重全丢给磁盘按需读取。它证明了物理上可行,但冷启动只有0.05-0.1 tok/s,量化后的模型准确率至今也没人验证过。

GPT-5.6三档发布:OpenAI自设基准全胜,公认基准告负一局
OpenAI发布GPT-5.6全系(Luna/Terra/Sol),定价比Claude Fable 5便宜近一半,并宣称在自设基准Agents' Last Exam上大幅领先;但在业内公认的SWE-Bench Pro上,Fable 5反超近16个百分点,而OpenAI恰好在发布前一天发文质疑该基准可信度。两套基准各说各话,连OpenAI自己的分数都对不上口径,买家该先想清楚信谁的跑分,而不是谁的模型更强。

OpenAI被曝藏8800万条ChatGPT日志,纽约时报版权案进入证据制裁阶段
《纽约时报》等媒体指控OpenAI两年来隐瞒两批共8800万条ChatGPT日志样本,原告手里只有一份遮蔽190亿处、共2000万条的样本。官司焦点从训练数据合法性,转向ChatGPT输出日志能否证明新闻原文被复现、造成市场替代。目前这仍是原告在制裁动议里的单方指控,法院尚未认定OpenAI故意隐瞒或侵权。

OpenAI说'搜不了',内部却早存着7800万条对话
《纽约时报》等原告称OpenAI在版权诉讼证据披露环节隐瞒关键能力——诉讼提起前就已建成7800万条对话的内部数据库,还有专门追踪内容'再现'的过滤工具,却始终对外说'技术上难以搜索'。这已经不是突发丑闻,而是一场拖了两年多、法院多次介入的证据拉锯战走到了摊牌时刻。

Spark 1.1定价罗生门:Meta编码模型其实比对手更便宜
Meta发布智能体编码模型Muse Spark 1.1,官方定价换算后其实低于Anthropic Claude Haiku 4.5,但外界普遍误读为'略贵';同时其宣传的跑分成绩仅见于开发者社区自测,尚无官方基准或第三方复现支撑。

Instagram的AI开关,你可能只关了一半
Meta新推出的Muse Image允许用户拿公开Instagram照片做AI创图,本人不知情也不会被通知;而Instagram设置里那个新增的关闭开关,其实只管住了“别人拿你照片”这一层,挡不住Meta自己拿你的公开内容训练底层AI模型。真正想管住后者,得去另一套隐私中心走“反对权”流程,而且效力还因地区而异。

OpenAI的Sol凭什么过审?连白宫都说不清
OpenAI把新旗舰模型Sol推向公众,能力被认为和Anthropic的Fable相当,但两者拿到的政府待遇截然不同。审批依据的行政令白纸黑字写着不设强制许可,安全卡上的第三方测试也只停留在能力引出阶段,监管的空白正被政治关系填满。

从7000万到1亿:Gradium种子轮悄悄追加,Nvidia进场做了什么
巴黎语音AI公司Gradium把去年12月官宣的7000万美元种子轮追加到1亿美元,新引入Nvidia,钱要用来在湾区开点抢人才。数字增长背后,是一家欧洲AI公司主动向硅谷交的投名状,也是Nvidia在语音赛道抢占算力生态位的老套路。

Google给AI广告贴标签,查不查全靠自觉
Google在My Ad Center新增“广告是怎么做的”入口,用户能看到搜索、YouTube、Discover里的广告是否用AI生成或编辑。但关键漏洞是:只有Google自家AI工具制作的广告会自动标注,用外部工具做的广告全靠广告主自己举手,Google不核验。

Mercor 谈判200亿估值:四个月翻倍的收入数字里藏着什么
Mercor 正洽谈新一轮融资,目标估值200亿美元,是去年10月100亿美元估值的两倍,谈判仍处早期。撑起这个数字的是CEO自称的20亿美元年化收入run rate,并非审计收入。同日官宣收购AI智能体训练公司Deeptune,但2026年早些时候的数据泄露和合同工诉讼仍未翻篇。

ChatGPT要当'数字员工',却每小时只能醒一次
OpenAI发布ChatGPT Work,把Codex的智能体能力从写代码扩展到做表格、写文案、开月结账,主打'完成任务'而非'回答问题'。但它宣传的'随时随地持续推进'背后,藏着任务频率上限和跨应用授权范围这两个公关稿没细讲的约束。

GPT-5.6全面开放:OpenAI自称跑赢Claude,独立榜单却给出相反答案
OpenAI旗下GPT-5.6三档模型(Sol、Terra、Luna)结束限量预览正式开放,官方数据显示在多项跑分上全面超越Claude Fable 5,但独立评测机构Artificial Analysis的公开榜单却显示Fable 5仍然领先。这场跑分口径之争,比模型本身更值得开发者留意。

Meta新模型被插件抢先接入,官方规格页却还没上线
Simon Willison给命令行工具llm加了个Meta provider,能跑通muse-spark-1.1,可Meta自己至今没有这个版本的官方页面,定价、上下文窗口、跑分全是空白。独立开发者的响应速度,已经跑到了大厂文档前面。

OpenAI 说政府开了绿灯,白宫官员却当场否认
OpenAI 正式向全球推送 GPT-5.6 与新品 ChatGPT Work,但报道中反复出现的'政府绿灯'说法,被白宫官员在发布前一天公开否认存在正式批准。ChatGPT Work究竟是什么,目前也拿不出独立信源确认。

ChatGPT Work上线首日,OpenAI连GPT-5.6是什么都没说清
OpenAI把编程工具Codex扩展成能连Slack、写报表的办公智能体ChatGPT Work,同日上线的GPT-5.6却在官网自家页面上说法不一,暴露发布节奏可能抢跑于产品成熟度。它擅长跨应用编排任务,原生表格幻灯片编辑仍不如Office和Workspace精细,企业接入前更该先弄清管理员能看到多少员工与AI的对话。

Meta新模型开放API了,但没人拿得出它的computer use成绩单
Meta于7月9日发布Muse Spark 1.1,首次为该系列模型开放公开API,评估报告称其agentic工具调用和computer use能力有显著提升。但对照Gemini、Claude、OpenAI已经公开的OSWorld-Verified等标准基准分数,Meta目前拿不出一份可第三方验证的对比数据,这份'改进'眼下更像自评而非定论。

Claude新功能教你「反思」用AI,顺手把你焊得更牢
Anthropic给Claude上线了名为Reflect的用量分析仪表盘,一边提醒用户少依赖AI,一边把使用痕迹可视化成粘性证据,玩法和2012年Gmail Meter如出一辙。检索发现该功能的官方命名和细节存在核验缺口,而它真正的对手其实是ChatGPT押注的记忆连续性策略。

YC新秀Context.dev上线:抓取API已经挤成这样,Firecrawl却先坐不住了
Context.dev是YC最新一批被投的网页数据API,专给AI Agent提供结构化网页与品牌数据,定价从每月25美元起步。它和老玩家Firecrawl互设对比页、还晒出客户迁移案例,这场撞脸战比产品功能本身更值得细看。

Meta 押注编程赛道:Muse Spark 1.1 只对美国开发者开放
Meta 7月9日发布 Muse Spark 1.1,并通过新的 Meta Model API 首次向开发者开放,想挤进 AI 编程工具链。目前只有美国开发者能拿到20美元额度试用,编码能力全靠官方自述,还没有第三方实测数据。这一步说明 Meta 想从消费端聊天机器人转向开发者平台竞争,但要追上 OpenAI、Google、Anthropic,还差一截。

Muse Spark 1.1 发布:Meta 晒了图表,却没晒价格和跑分
Meta正式开放Muse Spark 1.1的开发者API,官方通稿讲了100万token上下文和agent编排能力,却没提一句价格——每百万token1.25美元输入、4.25美元输出的定价,是Axios扒出来的,不是Meta自己公布的。跑分同理:官方只晒内部对比图,没给一张能跟GPT-5的SWE-bench、Aider Polyglot分数摆在一起看的表,开发者社区已经开始用'benchmaxxing'质疑这套叙事。

LinkedIn长帖四成AI代写:越讲真实,AI用得越猛
AI检测公司Pangram用浏览器插件抽样近100万条用户实际刷到的帖子,发现LinkedIn长帖约四成、X长文章约两到三成是AI全文生成,越标榜真实身份的平台AI代写反而越猛。这笔账最终由读者的辨伪成本买单,LinkedIn和Reddit已经用相反的策略给出了答案。