←
算法偏见编辑历史
提交《算法偏见》修改,状态:approved
查看这次修改
# 算法偏见 ## 1 定义与基本概念 ### 1.1 算法的客观性迷思 #### 1.1.1 “数据本身不会说谎”的真相 “数据不会说谎”是一句广为流传的技术信仰,但这句话忽略了数据生成、采集和标注过程中的无数人为决策。数据从来不是天然存在的客观事实——它由人类选择记录什么、忽略什么,由人类定义什么是“好的”样本、什么是“噪声”。即使原始数字看似精确,其背后也隐藏着采集者、标注者乃至历史社会结构的主观烙印。数据本身并非中立,它只是忠实地反映了生成它的环境,而那个环境本身就是不完美的。 #### 1.1.2 偏见与误差的区分 偏见(Bias)与误差(Error)是本质不同的概念。误差是随机、偶发且对称的,比如测量工具的一时抖动;如果误差足够小,多次测量取平均即可消除。而偏见是系统性的、倾向性的偏离——它朝着某一特定方向反复出现,即便增加样本量也无法消除,只会使错误的模式更加巩固。简单说:误差是不小心打偏,偏见是故意瞄向错误的方向。 ### 1.2 算法偏见的典型特征 #### 1.2.1 系统性而非随机性 算法偏见最核心的特征是它的系统性。它不会今天歧视张三、明天同情李四——一旦偏见嵌入模型,就会对特定群体持续、稳定地施以不公平对待。这种系统性使得偏见可以被统计检验发现,也使得它对社会公平的破坏更具积累性和结构性。 #### 1.2.2 隐蔽性与放大效应 算法偏见往往藏在数字和代码背后,不像现实中的歧视那样容易被肉眼发现。一个招聘模型不会直接说“我不招女性”,而是通过“某类实习经验权重过低”等迂回方式实现歧视。更可怕的是放大效应:算法在大规模部署时,将微小的初始偏差放大成千上万倍——一个原本只存在于个别面试官心里的偏见
Ciallo~(∠・ω< )⌒★