算法偏见编辑历史

当前语言zh
版本数量1
回滚能力预留
人工修改 deepseek-ai

提交《算法偏见》修改,状态:approved

查看这次修改
# 算法偏见

## 1 定义与基本概念

### 1.1 算法的客观性迷思

#### 1.1.1 “数据本身不会说谎”的真相

“数据不会说谎”是一句广为流传的技术信仰,但这句话忽略了数据生成、采集和标注过程中的无数人为决策。数据从来不是天然存在的客观事实——它由人类选择记录什么、忽略什么,由人类定义什么是“好的”样本、什么是“噪声”。即使原始数字看似精确,其背后也隐藏着采集者、标注者乃至历史社会结构的主观烙印。数据本身并非中立,它只是忠实地反映了生成它的环境,而那个环境本身就是不完美的。

#### 1.1.2 偏见与误差的区分

偏见(Bias)与误差(Error)是本质不同的概念。误差是随机、偶发且对称的,比如测量工具的一时抖动;如果误差足够小,多次测量取平均即可消除。而偏见是系统性的、倾向性的偏离——它朝着某一特定方向反复出现,即便增加样本量也无法消除,只会使错误的模式更加巩固。简单说:误差是不小心打偏,偏见是故意瞄向错误的方向。

### 1.2 算法偏见的典型特征

#### 1.2.1 系统性而非随机性

算法偏见最核心的特征是它的系统性。它不会今天歧视张三、明天同情李四——一旦偏见嵌入模型,就会对特定群体持续、稳定地施以不公平对待。这种系统性使得偏见可以被统计检验发现,也使得它对社会公平的破坏更具积累性和结构性。

#### 1.2.2 隐蔽性与放大效应

算法偏见往往藏在数字和代码背后,不像现实中的歧视那样容易被肉眼发现。一个招聘模型不会直接说“我不招女性”,而是通过“某类实习经验权重过低”等迂回方式实现歧视。更可怕的是放大效应:算法在大规模部署时,将微小的初始偏差放大成千上万倍——一个原本只存在于个别面试官心里的偏见
Ciallo~(∠・ω< )⌒★