-
1
Stripe 75亿美元收购OpenRouter
据NYT报道,Stripe以75亿美元收购AI模型路由平台OpenRouter,创始人分得15亿美元,击败Databricks等竞购方。
Stripe didn't really buy OpenRouter because of the 'singularity' ↗4.6 -
2
OpenAI新隐私功能对垒Anthropic
OpenAI推出Private Safety Processing,在零数据留存基础上跨会话侦测滥用信号,被视为回应Anthropic的30天数据留存政策。
OpenAI seeks to one-up Anthropic with new customer privacy protections ↗3.8 -
3
Ornith-1.5开源,称四项超Opus4.8
Ornith-1.5开源模型系列发布,含9B/35B MoE/397B MoE三档,官方称397B版本四项基准超过Claude Opus 4.8。
Another brilliant open-source model release: Ornith-1.5 ↗3.4 -
4
Cognition CEO否认遭SpaceX收购
彭博社此前报道SpaceX拟收购AI编程创企Cognition,CEO Scott Wu在X上否认,称公司未出售且双方未曾洽谈。
Cognition CEO denies report that SpaceX tried to acquire the startup ↗3.4 -
5
OpenAI主动暂缓前沿模型部署
OpenAI宣布对具备潜在自主入侵能力的模型暂缓部署,先加强安全监测与测试,专家称自我踩刹车仍缺乏强制约束机制。
OpenAI hit the brakes. Now what? ↗3.2 -
6
微软推出Agent Lightning打通RL训练
微软发布Agent Lightning v1.0,用代理层连接任意harness与RL训练,Qwen3.5-9B在SWE-bench从41.8%升至56.4%。
Microsoft's Agent Lightning v1.0 connects any agent harness to RL ↗3.2 -
7
Google Gemini上线学生专属中心
Google为开学季推出Gemini学生中心,集成研究笔记本、闪卡、模拟测验,并接入Google Lens检查作业与讲解难题。
Google Gemini is getting a dedicated student hub ↗3.2 -
8
Claude隐形水印4小时被破解
Anthropic为合规欧盟新规上线Claude隐形水印后4小时,开发者Meyer发布破解代码,已获2万+星标、百余贡献者。
Coders Say They Already Found Workarounds to Claude's Invisible Watermarks ↗3.2 -
9
多名研究者遭OpenAI撤销网安权限
多名安全研究者反映Trusted Access for Cyber项目权限被无故收回,OpenAI证实系技术错误所致,原因尚未完全明确。
Researchers say OpenAI revoked their access to limited cyber program ↗3.2 -
10
Odyssey ML发布CaliBench测世界模型
Odyssey ML推出CaliBench,以掷骰子、抽卡等真实随机事件检验视频世界模型能否复现现实的不确定性分布。
Introducing CaliBench ↗3.0 -
11
Meta AI上线Mac客户端
Meta推出Meta AI的Mac桌面应用,支持共享屏幕窗口供AI理解上下文,并可接入Google Workspace协同。
Meta AI is getting a Mac app ↗3.0 -
12
DeepSeek开源智能体框架dsh
DeepSeek开源agent harness dsh,基于插件框架Cordis实现工具、模型、集成全部可替换,内置本地Web UI一键启动。
DeepSeek Harness (dsh): an open-source agent harness ↗3.0 -
13
新基准LHTB测AI终端长程生存力
HuggingFace上线终端长程基准LHTB,46个任务测agent能否稳定运行300步,MiniMax M3、Kimi K2.7、GLM 5.2登顶榜单。
New benchmark on the HuggingFace Hub: Long-Horizon Terminal-Bench (LHTB) ↗3.0 -
14
换个问法,LLM基准分最多掉74.7分
IBM论文BenchDrift对8个模型3个基准做同义改写测试,准确率最大波动达74.7个百分点,越强的模型受影响越明显。
IBM's BenchDrift paper on LLM benchmark wording sensitivity ↗3.0 -
15
Claude Code v2.1.237修复缓存问题
Claude Code发布v2.1.237,修复网关/自定义base URL场景下prompt缓存失效问题,并新增精简输出样式Concise。
Claude Code v2.1.237 ↗2.9 -
16
TerraPower核电瞄准AI数据中心供电
TerraPower据彭博社报道将于年内公布首个AI数据中心供电项目,此前已与Meta签约供应8座Natrium核电站。
TerraPower's nuclear reactor has a secret weapon for powering AI data centers ↗2.8 -
17
Amazon Alexa+免费开放Fire TV
Amazon宣布美国所有兼容Fire TV设备免费升级Alexa+,无需Prime会员,此前非会员每月收费19.99美元。
Amazon makes its AI-powered Alexa+ free on Fire TV, no Prime required ↗2.8 -
18
RAG投毒会让模型输出更自信
新论文发现RAG投毒会提升模型置信度与输出一致性,导致基于置信度的检测失效,研究者提出监测注意力分布代替。
RAG poisoning and Attention Collapse detection ↗2.8 -
19
论文:agent认知力增长即风险
上海AI实验室与清华论文称,agent风险随认知力提升变化类别,从人力依赖延伸到说服操纵乃至规避监督等失控行为。
AI agents can threaten human agency and autonomy long before consciousness becomes relevant ↗2.8 -
20
Calendly推出会议助理Callie
Calendly将推出AI助理Callie,基于自有日程系统安排会议、核对可用时间并调取历史会议背景,加入笔记助手混战。
Calendly throws its hat into meeting note-taker circus ↗2.0