但现在,人们可能得给这位新来的“孩子”腾出位置了。
加州大学洛杉矶分校心理学家的研究表明,令人惊讶的是,当被要求解决通常出现在智力测试和SAT等标准化测试中的推理问题时,人工智能语言模型GPT-3的表现与大学本科生大致相当。该研究发表在《自然·人类行为》期刊上。
但论文作者写道,这项研究提出了一个问题:GPT-3究竟是作为其海量语言训练数据集的副产品而在模仿人类推理,还是它正在使用一种全新的认知过程?
由于无法访问GPT-3的内部运作机制——这些机制由其创造者OpenAI公司严密保护——加州大学洛杉矶分校的科学家无法确切说明其推理能力是如何运作的。他们还写道,尽管GPT-3在某些推理任务上的表现远超预期,但在其他任务上,这款流行的AI工具仍然表现极其糟糕。
“无论我们的结果多么令人印象深刻,重要的是要强调该系统存在重大局限性,”加州大学洛杉矶分校心理学博士后研究员、该研究的第一作者泰勒·韦伯说道。“它可以进行类比推理,但无法完成对人类来说非常容易的事情,例如使用工具解决物理任务。当我们给它这类问题时——其中一些孩子都能迅速解决——它给出的建议毫无道理。”
韦伯和他的同事测试了GPT-3解决一组问题的能力,这些问题灵感来自一种被称为瑞文渐进矩阵的测试,该测试要求受试者在复杂的形状排列中预测下一个图像。为了让GPT-3能够“看见”这些形状,韦伯将图像转换为GPT-3可以处理的文本格式;这种方法也保证了该AI以前从未遇到过这些问题。
研究人员让40名加州大学洛杉矶分校的本科生解决了相同的问题。
“令人惊讶的是,GPT-3不仅表现得和人类一样好,而且也犯了类似的错误,”加州大学洛杉矶分校心理学教授、该研究资深作者吕宏京说道。
GPT-3正确解决了80%的问题——远高于人类受试者略低于60%的平均分,但完全处于人类最高分的范围内。
研究人员还提示GPT-3解决一组他们认为从未在互联网上发布过的SAT类比题——这意味着这些问题不太可能成为GPT-3训练数据的一部分。这些问题要求用户选择具有相同类型关系的词对。(例如,在问题“‘爱’之于‘恨’正如‘富’之于哪个词?”中,答案将是“穷”。)
他们将GPT-3的分数与已公布的大学申请者SAT分数进行了比较,发现该AI的表现优于人类的平均分。
研究人员随后要求GPT-3和学生志愿者解决基于短篇故事的类比问题——提示他们阅读一段文章,然后找出传达相同含义的不同故事。在这些问题上,该技术的表现不如学生,尽管OpenAI技术的最新迭代版本GPT-4表现优于GPT-3。
加州大学洛杉矶分校的研究人员开发了自己的计算机模型,该模型受人类认知启发,他们一直在将其能力与商业AI进行比较。
“AI一直在进步,但直到去年12月,我们的心理AI模型在解决类比问题方面仍然是最好的,那时泰勒获得了GPT-3的最新升级版,它的表现一样好甚至更好,”加州大学洛杉矶分校心理学教授、该研究的合著者基思·霍利约克说道。
研究人员表示,迄今为止GPT-3无法解决需要理解物理空间的问题。例如,如果提供一套工具的描述——比如硬纸管、剪刀和胶带——让它用来将口香糖球从一个碗转移到另一个碗,GPT-3提出了离奇的解决方案。
“语言学习模型只是试图进行单词预测,所以我们对它们能进行推理感到惊讶,”吕宏京说。“在过去两年里,这项技术相比其之前的版本有了巨大的飞跃。”
加州大学洛杉矶分校的科学家希望探索语言学习模型是否真的开始像人类一样“思考”,还是在做一些完全不同的事情,仅仅是模仿人类思维。
“GPT-3可能有点像人类一样思考,”霍利约克说。“但另一方面,人类并不是通过吞噬整个互联网来学习的,所以训练方法完全不同。我们想知道它是否真的在用人类的方式做事,或者它是不是某种全新的东西——一种真正的人工智能——这本身就很了不起。”
为了找出答案,他们需要确定AI模型正在使用的底层认知过程,这需要访问软件以及用于训练软件的数据,然后实施他们确信软件以前没有做过的测试。他们说,那将是决定AI未来形态的下一步工作。
“对于AI和认知研究人员来说,能够访问GPT模型的后台将非常有用,”韦伯说。“我们只是在输入内容并获得输出,结果并不像我们希望的那样确切。”