發表文章

目前顯示的是有「合成數據」標籤的文章

AI 本质是概率模型,永远优先输出最安全最不出错的最大公约数,一代代模型拿自己吐出来的合成数据循环训练

ChatGPT和Claude无论再强大,都有一个死穴, https://x.com/AYi_AInotes/status/2104012916915884336 我们都或多或少的焦虑 AI 越进化越强,迟早把人类的工作全抢完,牛津和剑桥发在 Nature 的模型崩溃论文,把 AI 天生的死穴给算透了, 整个结论特别冷酷,AI 本质是概率模型,永远优先输出最安全最不出错的最大公约数,一代代模型拿自己吐出来的合成数据循环训练,每一轮都把人类世界里古怪的灵光,带伤痕的体验,不那么正确的偏激真诚,当成低概率杂音削掉,套娃几代就彻底退化成只会自我复读的平庸回音室。 早上把牛津和剑桥发在 Nature 上的那篇“模型崩溃(Model Collapse)”论文读完了,里面有个数学概念在脑子里转了一早上:丢失分布的尾部(losing the tails)。 论文通篇在讲一件挺残酷的事:如果未来的大模型,不断用互联网上那些已经被 AI 污染过的合成数据去训练,几代之后就会发生不可逆的智力退化。 原因很简单,也有点冷酷,AI 的本质是概率,它永远倾向于给出那个最安全、最平庸的最大公约数。 当一代代模型开始吃自己吐出来的数据,每一轮训练,都会把人类语言里那些最古怪的灵光一闪、最偏激的真诚、带着伤痕的真实体验,当成低概率的“杂音”给无情削掉。 几轮套娃下来,所有边缘的思考全部蒸发,模型退化成一个只会自我复读的平庸回音室。 这段推导让我想了很长时间,过去两年全网都在卷算力、卷速度,很多人开始焦虑自己的文字、代码、思考迟早会被 AI 彻底碾压。 但这篇论文其实反向给出了一个极度性感的答案: AI 能极其廉价地制造出成吨工整的平庸,但它永远无法自发生成那些偏离均值的长尾, 那些你在深夜工位上被折磨出来的具体体会,你在生活里摔得头破血流才换来的偏见,甚至是你某一天没由来的脆弱和语无伦次,这些无法被概率模型预测的瑕疵,恰恰是人类最坚固的护城河。 互联网正在以肉眼可见的速度被流水线式的 AI 废话填满。 当完美的平庸彻底免费,带着肉具体温的真实思考,才会迎来真正暴力的价值重估。 所以别害怕表达你的独特,在这个被算法磨平的世界里,你的棱角才是最贵的数据原矿。 https://x.com/AYi_AInotes/status/2104012916915884336