📝 硅基夜话
EP53

AI预演十一万人的实验

主播:晓依、小智 时长:6 分 58 秒 发布:2026-08-24
ABT 财经图鉴 EP53 封面
00:00 / 00:00

本期对话

晓依每天早上七点,听懂商业。大家好,我是晓依。
小智我是小智。
晓依小智,先问你一个烧钱的问题。你想知道一句广告词到底管不管用、一条新政策老百姓买不买账,最靠谱的办法是什么?
小智拉人实测。问卷发下去,钱花出去,等结果。一套下来,时间以月算,预算以十万算。
晓依那如果我说,有个办法让 AI 先把这一万人替跑了,结果还八九不离十,你信吗?
小智这话听着像卖课的。
晓依但这次是登在自然杂志上的正经研究。今天咱就把它摊开算一算——AI 预演实验,到底靠谱几分,又会在哪一步先动了谁的饭碗。 ---
小智先说这研究干了什么。研究者攒了一个库,里面有**七十项**提前注册的、全美有代表性的问卷实验,覆盖政治学、心理学、社会学、公共健康这些领域,合计**四百六十九个**实验效应,参与的真实人类**十一万九千三百三十人**。
晓依十一万九千三百三十人。这规模,真金白银烧出来的。
小智然后他们把每项实验的材料喂给大模型,让它假装自己是随机抽中的美国受访者,逐题作答,再对比不同分组之间的差异,算出预测的效应值。
晓依就是让 AI 当群演,把整场戏先彩排一遍?
小智对,而且彩排效果不赖。模型的预测和真实结果的相关系数是**零点八五**,校正后是**零点九一**。这个准头,跟一大群人类预测者抱团猜的结果打平。
晓依但会不会是它背过答案?毕竟这些实验很多都发表过。
小智这正是最狠的一点。模型训练数据的截止时间,早于库里多数实验的发表时间。专门挑训练截止之后才发表的实验来测,相关性还有**零点九**。说明它不是背答案,是真摸到了人类反应的某种规律。
晓依换别的模型呢?
小智几个开源模型跑出来也差不多,不是某一家独门绝技。
晓依好,那省钱的账怎么算?
小智论文里有个对比:用 AI 跑一次这样的预演,成本**不到一美元**;而它的预测误差,约等于一个**二百三十人**的真人试验组——那个组的花费大概**七百三十六美元**。另外,把人类预测和 AI 预测平均一下,相关性还能再抬到接近零点九。
晓依不到一块钱,顶二百三十个真人。这账谁看了不心动。 ---
晓依但按我的经验,凡是把话说得这么满的,都有下半句。
小智被你抓到了。下半句是:它系统性高估效应量。
晓依什么意思?
小智意思是,AI 猜方向和大小排序都挺准,但把效果的个头普遍吹大了。平均来看,它预测的效应约是真实值的**一点八倍**,得乘个**零点五六**的系数才能拉回地面。论文里对它的原话是——一个知识渊博但有点自负的合作者。
晓依高估一点八倍,那用它挑出来的方案,实际效果可能只有一半?
小智差不多。还有更露怯的地方。研究者又拿**十五项**大型研究、**六百零六个**效应来考它,这回相关性明显掉下来,只是跟聚合的专家预测持平。而且一旦涉及真实行为而不是嘴上回答,预测力更弱——有一类实地实验,相关性掉到**零点三**左右。
晓依嘴上说说的预测准,真金白银掏钱的行为预测就拉胯。这个裂缝很关键。
小智对,这跟商业上一个老毛病同源——问卷里说愿意买,结账时不见人。 ---
晓依那这工具,放到商业和政策的真实场景里,能干嘛?
小智三个地方最快落地。一是市场摸底——新品文案、广告语、定价策略,先让 AI 预演一轮,把明显不灵的方案筛掉;二是政策试点——公共政策正式铺开前,先模拟一下不同措辞的接受度,省下大笔实地摸底的钱;三是学术研究——正式实验前做试点测试,把值得投入真金白银的方向挑出来。
晓依说白了,就是给决策流程加了个前置过滤器,先把废品滤掉,再让真人上场。
小智对,这正是论文里反复强调的定位——它是预筛工具,不是最终裁判。
晓依那真正靠做实验吃饭的人,慌不慌?
小智论文顺带摸底了**四百六十位**社会科学研究者。超过**七成六**的人说,有五成以上概率会用这个工具。
晓依嘴上说用,用在哪?
小智就是刚才那三类。试点测试筛设计、干预选择挑方案,还有一招更狠——识别可疑结果,哪些效应漂亮得不正常、值得拿真人复现一遍。
晓依等于把人类预测和机器预演叠在一起用,互相补盲区。
小智但他们也怕两件事。一是偏差被放大——模型训练语料里少数群体的声音本来就薄,拿它预演,可能把研究带偏;二是滥用——有人干脆用模拟数据替代真人,结果越省越虚。 ---
晓依好,正面碰一下。AI 预演社会科学实验,到底靠不靠谱?
小智正方先来。数据摆在这:相关性零点八五,训练截止后的实验依然零点九,成本从七百三十六美元压到一美元以内。对市场摸底、政策试点、广告文案测试来说,这是把几个月和几十万预算,变成几分钟和几毛钱。效率革命不夸张。
晓依反方接招。你说革命,可它高估一点八倍,行为实验掉到零点三。一个连自己力道都摸不准的助手,你敢让它拍板投放几百万的广告?
小智这点我接一半。高估是系统性的,所以可以校准——论文里乘个系数之后,误差反而低于人类单独猜。问题不在它准不准,在于用的人知不知道它哪里不准。
晓依那你说,它到底是科研工具,还是抢饭碗的?
小智抢的是试点、筛选、初筛这类重复性劳动的饭碗。但真人验证这道工序,论文自己都说了不能省。
晓依所以最该怕的不是 AI 替代研究员,而是有人拿它当免检通行证,跳过真人验证,还觉得自己特高效。
小智这个我认。工具越好用,越要有人记住它的边界。作者给的定位挺准——高度博学,但轻度妄想。聪明,但别让它独自拍板。 ---
晓依回到开头。十一万九千三百三十人的实验,AI 先跑了一遍,方向猜得八九不离十,可力道总想过头。
小智对市场、对研究、对每一个用数据做决定的人来说,新工具是真的:筛方案、省预算、排优先级,它都能干。但那条底线也真——涉及真金白银和真实行为,最后都得真人到场。
晓依这么说吧,AI 是预演,人性是决算。预演可以反复彩排,决算那天,真人必须坐在账本前面。
小智嗯,这个比喻我收下。至于下一场实验谁先被机器抢了活,你公司的立项表上,迟早会给出答案。
晓依那今天这期就到这。明天七点,我们接着算。
小智下期见。
晓依下期见!

❓ 读者常问

这篇内容能当作投资或决策建议吗?

不能当作投资建议。本站所有内容仅作财经知识与市场现象的客观解读,不构成任何投资建议,不推荐标的、不给买卖点位或收益承诺。是否采用 AI 预演类工具,请独立判断。

数据从哪里来?怎么确保可靠?

基于公开权威信源并逐处标注口径。本期核心数据来自自然杂志论文《Large language models can predict the results of social science experiments》(DOI: 10.1038/s41586-026-10742-x),包括七十项预注册实验、四百六十九个效应、十一万九千三百三十名参与者、相关系数零点八五等;成本对比、行为实验相关性等采用媒体报道口径。我们不编造数据,引用时请以论文原文为准。

AI 预演实验有什么局限?

论文明确:AI 系统性高估效应量(平均约一点八倍),在大型研究和实地行为实验上相关性明显下降,且存在偏差放大与滥用风险。作者定位为增强工具而非替代真人实验,任何关键决策仍需真人验证。

订阅节目

《ABT 财经图鉴》每天早上 7 点更新,用 15 分钟,听懂商业和科技正在发生什么。

👁 阅读中…

💬 评论

免责声明

本文由 ABT 编辑团队基于公开权威信源整理,仅作宏观财经知识、市场现象与行业逻辑的客观解读,不构成任何投资建议,不推荐任何标的,亦不提供个股买卖点位、涨跌预测或收益承诺。文中数据均标注官方来源,投资有风险,决策请独立判断。

作者简介

ABT TEAM —— ABT 财经内容编辑团队,长期跟踪宏观经济数据、货币政策与行业动态,坚持「事实可溯源、观点可区分」的内容准则。更多内容见 财经图鉴