人工智能资讯 第18页
聚合当前分类下的最新内容,按时间顺序查看第 18 页精选文章。

105位YC创始人流向:63人在OpenAI和Anthropic做技术岗
创业数据站Startups.RIP整理的105人名单显示,63人现在的职位是OpenAI或Anthropic的Member of Technical Staff,占六成。这份样本是该站自行筛选的结果,不能代表全体YC校友,但足够提示前沿模型和算力门槛正把创业人才拉向少数几个实验室。名单里混有已离职的'OpenAI former'和跨批次重复计数的创始人,读数字前得先看清这些前提。

1300幅19世纪博物画免费上线,但真正的修复功夫AI替代不了
设计师Nicholas Rougeux修复上线了维多利亚时代《博物学家图书馆》全套1300余幅动植物图版,网站免费开放,AI只参与了找项目、补素材和构思封面。真正决定成品质量的,仍是长期的人工校订与设计判断。

KBR领投2000万美元,伦敦创业公司想让AI读懂整座油气工厂
伦敦工业AI公司Applied Computing完成KBR领投、Databricks Ventures跟投的2000万美元A轮融资,模型Orbital试图打通传感器数据、物理规律和工程知识来预测油气工厂状态。公司自称脱离隐身18个月做到数千万美元级ARR,但客户数量和名称均未披露。真正决定Orbital能走多远的,是数据、信任和安全责任,不是模型聪明与否。

Grok CLI 的 Mermaid 渲染器被搬进浏览器,亮点不在画图
Simon Willison 将 xAI 新近开源的 Grok CLI 中一段 Rust 代码编译为 WebAssembly,做成了 Mermaid 转 Unicode 框线图的浏览器工具。它没有改写 Mermaid 的技术路线,却说明 AI 编程工具正在明显缩短开源代码从“被发现”到“可使用”的距离;实际采用仍要看语法覆盖、字符对齐和许可证。

微软不是要你别用Claude,是要你别绕开Copilot
微软在FY27内部战略会上教销售团队贬低OpenAI、谷歌和Anthropic,直接点名Claude在Office场景里“更慢、更不准确、缺安全集成”。这场话术转向的真正触发点,是四月那份把微软和OpenAI从独家绑定改成非独家合作的协议——微软丢了独家分销权,于是转身把嘴皮子和产品线都押在自研模型上。但对外它仍在说Copilot多模型兼容、竞品用量在涨,两套说法拼在一起,露出的是想锁住集成层而非否定模型本身的算盘。

AI帮你配路由器很顺手,但小心把自己反锁在门外
一位网络爱好者用Claude Code等四个大模型配置和迁移MikroTik网络,总结出REST API替代SSH、CAPsMAN简化多AP、MAC Telnet断网兜底等一套实用技巧,还自称是'跳过权限'的危险玩法。清单本身没问题,但它绕开了这套玩法真正该讲清的部分——权限交出去之后,配置出错、凭证泄露、AI把自己反锁在外面,谁来兜底。

Two Sigma创始人喊话开源AI,论证却在最关键一步戛然而止
Two Sigma联合创始人David Siegel在Fortune撰文,用自己与Richard Stallman当年的开源之争类比现在AI加速闭源的趋势,呼吁公共资金资助的AI默认开源。文章最该展开的'AI太危险不能开放'反方论证却戛然而止,而这篇评论本身也是经由作者自家基金会二次转发放大的。

xAI开源grok-build,许可证文件里自己交代了底细
xAI在GitHub开源了终端AI编程代理grok-build(即grok CLI/TUI),功能对标Claude Code、Codex CLI、Gemini CLI三强;但官方第三方声明文件写明其工具层移植自openai/codex和sst/opencode的代码,而定价、真实性能和安全隐私信息目前几乎是空白。

9.99美元一张,AI电影这笔账怎么算
诺兰《奥德赛》大银幕开画的同一个夏天,导演Ash Koosha用中等五位数预算做出一部135分钟AI生成长片,绕过院线直接9.99美元租看。观众骂它是AI slop,但真正该问的不是画面好不好看,而是这笔账算不算得过来。

NTSB确认:得州特斯拉致命车祸,驾驶员全油门盖过FSD
NTSB初步报告确认,得州Katy一起致命车祸中,特斯拉驾驶员将加速踏板踩到100%,覆盖了正在运行的FSD(监督版)。车辆在限速30英里的住宅路上以超70英里时速撞入民宅,76岁居民Martha Avila遇难。报告印证了特斯拉此前的说法,但监督式辅助驾驶在人为失能或误操作时该不该介入,仍是空白。

Inkling开源发布:975B参数背后,270GB门槛才是真问题
Thinking Machines发布了975B参数的开放权重模型Inkling,支持图像、文本、音频三模态和1M上下文,训练用了45万亿token。但官方自己承认它“并非整体最强模型”,量化到最激进的1-bit版本仍要约270GB硬件门槛,所有跑分目前也只有发布方一家在说。

GPT-4.1标价更低,实测账单却比Sonnet贵近一倍:模型路由没那么简单
IBM Research用417项AppWorld智能体任务实测:标价更低的GPT-4.1单任务成本0.37美元,反而是Claude Sonnet 4.6(0.19美元)的近两倍,缓存命中率抹平了标价差距。IBM给出的延迟优先路由配置能在84%准确率下,比单用Opus省21%成本、降9%延迟,但准确率也跌了4个百分点,省钱不是白拿的。这套结果只在AppWorld和CodeAct智能体这套特定组合下成立,换一套工作负载或缓存策略,排名可能整个反过来。

300美元报废服务器跑通Gemma 4:Claude修的不是bug,是13年的指令集代沟
一台13年前、成本不到300美元的报废HP存储服务器,靠Claude修复ik_llama.cpp里两个被锁死在AVX2指令集上的MoE算子,跑通了Google Gemma 4 26B模型,解码速度达每秒5.2个token。这次'突破'的关键不是老硬件多能打,而是MoE架构本身省内存不省算力,让这类无GPU、大内存的旧机器意外找到了新用途。

200万条YouTube歌曲被扒:Suno的黑客泄露,砸中了它官司里最怕被问的那句话
黑客“ellie.191”曝光的Suno内部代码显示,这家AI音乐公司靠第三方抓取服务从YouTube等平台“扒”下超43年时长的音频,还专挑纯人声版本训练模型。更麻烦的是,这批证据出现的时间点,正好卡在Suno和唱片公司围绕DMCA反规避条款的法律缠斗上,把一场原本抽象的技术定性之争,变成了有代码可查的实操记录。

造一个不敢乱说的AI:Ai2从海事智能体Shippy身上学到了什么
Ai2旗下Skylight公布海事智能体Shippy的工程细节:靠版本化技能、确定性CLI、会话级沙箱和分层评测,把大模型的自由发挥关进笼子。团队想证明的不是模型多聪明,是高风险场景的智能体竞争已经从拼模型挪到拼工程治理。战术建议越界、边界简化漏数、虚构CLI命令这几个问题,团队自己也承认还没堵上。

半衰期只有2个token:开源模型复现意外推翻Anthropic的'工作空间'假设
独立研究者用AI agent在Qwen、Llama、Gemma、OLMo等六个以上开源模型家族上复现了Anthropic的J-space因果追踪方法,结果没有验证论文核心直觉,反而推翻了它:真正把影响拖得最久的不是中间'工作空间'层,而是最靠近输入的浅层,中间带的因果半衰期只有2到5个token。另外还发现短序列测量窗口本身会制造'长程记忆'的假象,以及可解释性结论对测量语料极度敏感。

苹果AI入华获批:绕了一圈,通义千问花落阿里
中国网信办已批准苹果通过接入阿里巴巴通义千问,让Apple Intelligence登陆iOS、iPadOS、macOS和visionOS,但双方都没公布具体上线时间和功能范围。这更像是解决了合规和本地化门槛,而不是证明模型能力更强,苹果能不能把它做成用户真正想用的功能,还得往后看。

六页论文里的悖论:贝叶斯预测者为何总以为自己没错
1982年,统计学家A. P. Dawid用六页论文证明:只要预测者遵循贝叶斯连贯性原则,他就会在自己的概率模型里必然相信自己是校准良好的,但这个结论只在预测者内部成立,现实世界完全可能让它落空。此后四十年,Oakes和Foster-Vohra接力补上这个漏洞,最终发现只有随机化才能让校准在任意环境下成立——这条脉络如今正是大模型置信度校准争议的数学源头。

语音AI新基准说“无一称王”,榜单却写满Gemini
Hume AI发布的Real World VoiceEQ用超百万条人工评分给40多个语音模型打分,官方结论是“没有单一最强模型”,但拆开各赛道看,Gemini系列几乎包揽TTS、S2S和语音理解三条头名。更该留意的是,撑起这套“真实世界”评测的核心语料至今未公开,发布方自己又靠卖同款评测服务赚钱。

融到2400万美元,Rime创始人却先承认AI语音打不过老IVR
语音AI公司Rime完成2400万美元A轮融资,由M13 Ventures领投,Twilio Ventures、Unusual Ventures等老股东跟投,公司称正从语音转文本+大模型+文本转语音的拼接管线转向自研speech-to-speech模型。但第三方数据库记录的金额、投资方与官宣版本对不上,公开产品文档也显示speech-to-speech仍是路线图而非已交付能力,创始人自己都承认现在的语音AI体验不如老式IVR。

DSL让LLM更可靠?Martin Fowler的证据只够到一半
Martin Fowler撰文称,用受限的领域特定语言(DSL)代替通用代码能让LLM生成更可靠,并以分布式系统测试框架Tickloom为例演示了'生成-校验-修复'的自主循环。但这套论证证明的只是语法和结构层面的合法率,对'编译通过却做错事'这类更隐蔽的语义错误几乎没有触及。