AI Research · research

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

论文摘要:This position paper argues that modern AI alignment methods - originally designed to prevent harmful output - are dual-use technologies that may easily be misused by malicious...

首次发现 2026-08-14T22:05:16Z · 最近更新 2026-08-15T22:05:18Z · 置信度 high · 重要性 7.5

为什么重要

该论文来自一手研究源并通过 3qk7 Research Radar 的新鲜度、来源与研究价值筛选;后续代码、模型权重、复现和相关产品事件可继续关联到该记录。

检测到的变化

一手证据