-
1
水印反让模型更容易被越狱
为应对欧盟新法规,各平台开始给生成内容加水印;Anthropic 已披露未来 Claude 模型将采用谷歌的 SynthID-Text,而研究显示水印会让模型对对抗性提示更脆弱
加了 AI 水印后模型更易被有害提示撬动 ↗4.56 -
2
3.78
-
3
修掉走代理就全部 400 的回归
修复 2.1.275 引入的回归:当 ANTHROPIC_BASE_URL 指向代理或网关时,所有请求都会因 Input tag 'advisor_20260301' 报 400
Claude Code v2.1.276 ↗3.75 -
4
别让模型替你把转账金额填了
提出一个前置闸门:工具调用的每个参数都由模型填好且类型正确,但「金额、收款账号」这类关键值本不该由模型定义,应把定义权与裁决权移出模型
Reddit 讨论:执行前拦住 Agent 自行编参数 ↗3.69 -
5
蛋白质设计诺奖得主谈下一步
凭蛋白质设计获诺奖的 David Baker 谈生物设计的走向,以及把生物学推出自然边界之外的潜力与风险
诺奖得主 David Baker 用 AI 造自然界没有的分子 ↗3.6 -
6
3.38
-
7
3.15
-
8
用 LoRA 让模型记住内部代码规范
在 Huihui-Qwen3.8-27B-abliterated 上训 LoRA,让模型记住迁移规则、部署检查、密钥处理等内部约定,r=16、约 8000 万可训参数,不动基座权重
Reddit 实践:在 abliterated Qwen 上做 LoRA 记内部规范 ↗3.15 -
9
2.96
-
10
2.96
-
11
2.96