-
1
英伟达AVO拿下ARC-AGI-3满分
NVIDIA智能体系统AVO包裹Claude Opus 5,通关ARC-AGI-3全部183关(25个公开环境),裸模型此前仅30.2%,Chollet提醒这是公开示范题集而非完整基准。
NVIDIA AVO 在 ARC-AGI-3 拿下 100% 全部183关 ↗4.6 -
2
DeepSeek上新多模态视觉版
DeepSeek经API上线多模态模型DeepSeek-V4-Flash-Vision-Exp,多模态智能体表现逼近Opus-4.8,同步开放Files API支持图片复用;deepseek-harness v0.1.1同步跟进适配。
DeepSeek Harness v0.1.1 released ↗4.0 -
3
模型正在吞噬Agent Harness
Latent Space长文提出模型能力持续吸收harness功能(Claude Code已删除80%系统提示词),Harness-Bench显示同模型不同harness得分差达23.8分。
The Evolution of the Agent Harness ↗3.5 -
4
AI流程正被自己模拟接管
AINews梳理2022年至今AI管道八环节(奖励、数据、教师、课程、研究者、环境、人类样本)逐步被模型自身替代的脉络,称其为'差10%但快万倍、便宜百倍的模拟'。
[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over ↗3.3 -
5
TTS首字延迟破50ms成本仅2刀
Nari Labs公开Qwen3-TTS推理优化细节,单张H100在10RPS下p95首字延迟低于50ms,每百万字符成本约2美元,较ElevenLabs V3的100美元低约50倍。
How we made a text-to-speech model respond in sub-50 ms ↗3.3 -
6
FreeToken给消费卡推理提速4倍
UC Berkeley团队开源FreeToken,753B GLM-5.2在单张RTX PRO 6000上跑14.9 tok/s,Qwen3.6-35B在8GB RTX 4060笔记本上39.3 tok/s,称比Ollama快2-4倍。
FreeToken project is impressive ↗3.3 -
7
llama.cpp改用语义化版本号
llama.cpp v0.2.0引入vX.Y.Z稳定版与b[NUM] nightly双轨版本体系,同步更新CUDA/Metal/SYCL/Vulkan后端,新增Granite SWA、DSpark模型支持。
Llama.cpp version 0.2.0 is out! ↗3.1 -
8
开源Skill让Claude说人话
开源项目nobuzz(Claudette)用Claude Code skill /debuzz把回复转发给Gemini(Antigravity CLI)改写成大白话,登HN热帖311赞,已获155星。
Claudette: Make Claude stop talking like a BuzzFeed article ↗3.1 -
9
开源工具让CLI Agent组团上班
MIT开源多智能体框架Munder Difflin封装Claude Code、Codex、Gemini CLI等12种CLI agent,让其全天候协同办公、跨机端到端加密通信,登GitHub Trending日榜第一。
Munder Difflin – Agent harness to run an office of your clones ↗2.7 -
10
个人训出60MB可跑的250M模型
作者从零训练250M参数模型(30B tokens fineweb语料),量化至2bit以下,部署体积仅60MB、约需80MB内存,普通笔记本CPU可跑约400 tok/s。
I developed my own quantized LLM from scratch, trained on 30B tokens, deploys in 60 MB ↗2.5