-
1
Kimi K3代码基准超越Claude
Moonshot AI发布2.8T参数开放权重模型Kimi K3,DeepSWE基准从31分跃至69分升至第三,SpreadsheetBench 2登顶超越Claude Fable 5,全量权重承诺10天内开源。
Kimi: Threat or menace? ↗4.6 -
2
Codex用户破900万,限额频繁重置
第三方追踪站显示OpenAI Codex与ChatGPT Work日活跃用户已破900万,官方为应对扩容压力累计重置周使用限额35次,平均间隔8.9天。
Codex Resets — Usage Limit Reset Tracker ↗3.6 -
3
AI agent架构热议:从循环转向图
开发者Peter Steinberger一条9词推文引爆讨论,多位从业者跟进呼应,认为AI agent设计正从Loop范式转向Graph结构。
Loop Engineering is dead. Long live Graph Engineering! ↗3.2 -
4
华为开源92B模型,上下文达512K
华为开源openPangu-2.0-Flash,92B参数(A6B激活)、512K上下文,采用MLA-latent缓存与多头MTP,已提供GGUF量化版本。
openPangu-2.0-Flash (92B-A6B) ↗3.1 -
5
作家批评ChatGPT正压制年轻一代
作家Dave Eggers受邀在约200名OpenAI员工面前演讲,直言ChatGPT正在压制一整代人的创造力与思考能力,引发内部反思。
Dave Eggers told OpenAI staff that ChatGPT was 'silencing an entire generation' ↗3.0 -
6
开源框架给AI agent可靠性打分
开源项目ProofAgent-Harness用多裁判共识法,从角色清晰度、护栏覆盖、工具schema质量等七项指标给AI agent的上下文工程质量打分。
Agents Do Not Fail Alone ↗3.0 -
7
FastFlowLM团队加入AMD
开源本地LLM推理项目FastFlowLM团队正式并入AMD,将共同推进AI推理相关技术研发。
FastFlowLM Joins AMD to Advance AI Inference ↗2.8 -
8
uv包管理器新增恶意包检测开关
Astral为Python包管理器uv新增UV_MALWARE_CHECK=1环境变量,安装前可交叉比对开源漏洞数据库OSV拦截已知恶意包。
UV_MALWARE_CHECK=1 ↗2.5 -
9
DeepMind发布生物安全应对策略
Google DeepMind与Isomorphic Labs联合发布博客,阐述双方在AI辅助药物设计中应对生物安全风险(bioresilience)的整体方法。
Our Approach to Bioresilience: Isomorphic Labs and Google DeepMind ↗2.4