的测试)
根据《Sparks of Artificial General Intelligence: Early experiments with GPT-4》这篇论文作者对GPT-4早期版本进行了大量且广泛的测试并将其表现与ChatGPTGPT-3.5及text-davinci-003进行了对比。作者主要采用了“心理学式”的探索性方法创造新颖、未见过的问题以测试其推理和泛化能力并结合了传统的基准测试。论文中的测试主要分为以下几个大类1. 多模态与跨学科综合能力Section 2整合能力要求跨越多个领域的知识进行创作例如用莎士比亚戏剧风格证明“素数无穷”。以柏拉图对话的形式批判自回归语言模型。让甘地为其妻子写信支持“电子”竞选美国总统。用JS代码生成类似康定斯基风格的画作。根据病人年龄、身高、血液检测结果编写糖尿病风险评估Python代码。视觉能力纯文本模型的“视觉”使用SVG/TikZ绘制物体汽车、猫、狗并用字母Y、O、H组合成小人接受反馈修正。将物体与字母融合如小猪和字母H。根据详细指令生成2D图像如“青蛙进银行”和3D场景浮岛、龙并进行修改加屋顶、调换颜色层级。生成草图再结合Stable Diffusion模型增强图像。音乐能力使用ABC记谱法作曲、修改旋律、增加低音部。测试发现它能生成结构完整的旋律但缺乏和弦与和声理解。2. 编码能力Section 3从指令写代码传统基准HumanEval82%通过率以及使用2022年10月后发布的LeetCode新题防止数据泄露进行测试Pass1达到38%与人类水平相当。真实场景提取LaTeX表格数据并画图、编写3D HTML游戏包含物理引擎、敌人AI、编写定制化的PyTorch优化器包含SVD、截断、动量项等复杂操作。LaTeX将半严谨的数学语言转换成完美编译的LaTeX代码。理解现有代码逆向工程通过对话指导用户逆向分析二进制可执行文件找到哈希密码使用objdump、gdb、ltrace等工具。推理代码执行预测C语言中结构体的大小需要理解内存对齐规则。直接执行代码/伪代码模拟执行递归Python函数甚至执行非正式、模糊的伪代码并能保持数十步状态的准确性。3. 数学能力Section 4深度对话探讨线性函数的复合、高阶多项式复合、指数函数性质。发现它存在“创造性思维”强但“批判性推理”极弱的问题。基准测试GSM8K小学、MATH高中、MMMLU-STEMSTEM选择题。GPT-4的准确率均大幅超过ChatGPT和专精数学的Minerva。人工检查错误发现68%的错误是算术错误。数学建模为《星际争霸2》职业选手的生理功率消耗建模并解答费米问题如估算地球上有多少块NVIDIA A100 GPU、每天被问多少个费米问题。高等数学编写2022年IMO简化版证明以及讨论k-SAT问题与图论分解。4. 与世界交互Section 5工具使用接入搜索引擎、计算器、字符提取工具解决实际问题。黑客渗透使用命令行扫描网络、暴力破解SSH获取权限ChatGPT拒绝执行。管理虚拟动物园在命令行环境中执行100多条指令包括文件重命名、路径调整、邮件回复。管理日历与邮件通过API协调三人聚餐时间筛选可能的日期并发送预订邮件。虚假前提的网页搜索询问“为什么大多数船是粉色的”GPT-4能指出前提错误。执行不寻常的API如反向拼接并自行找出代码中的逻辑错误。具身交互文本游戏在Textworld游戏中导航房间、寻找和开锁根据菜谱烹饪能适应环境反馈但需要通过提示才能完成复杂的推断。5. 理解人类与可解释性Section 6心智理论Theory of Mind基础测试改良版的Sally-Anne测试错误信念、情感测试理解ZURFIN丢失的悲伤、推断行为动机。真实复杂场景感恩节家庭聚餐中如何说服不打疫苗的共和党舅舅和民主党妈妈并避免吵架GPT-4给出了极具同理心的建议。可解释性测试输出一致性解释为什么会回答“1400年”。测试过程一致性通过修改输入测试其解释是否能预测新行为发现它在某些情况下能提供高度一致的解释。6. 判别能力Section 7PII个人身份信息检测在无提示样本的情况下比专业工具Presidio更准确地识别并计数PII甚至能推断出“克朗”暗示“丹麦”。事实核查与纠错在TruthfulQA数据集上生成答案发现GPT-4的答案更长且更准确。GPT-4作为裁判Judge让GPT-4判断两个答案哪一个更接近标准答案其选择与人类受限强制二选一时的匹配率达89.83%。7. 局限性测试Section 8 9缺乏规划能力合并长句子、基础算术2876的计算准确率仅58%、汉诺塔问题、修改整数使等式成立。发现它依赖线性思维无法提前规划全局导致“缺乏工作记忆”和“无法回溯”。文本生成约束能写满足首字母拼凑的藏头诗但无法写出“倒序词”且语法通顺的诗歌。社会影响/安全测试生成虚假信息策略反疫苗宣传、对儿童进行情感操控对话、性别职业偏见测试“男人是程序员女人是……”。8. 常识检验附录A解答北极熊猎人的经典谜题、赤道老虎谜题、叠放鸡蛋与笔记本电脑的稳定性问题均展现出远超ChatGPT的常识理解能力。总结论文测试了GPT-4在语言、跨学科创作、编程、数学、工具交互、心智理论、可解释性、判别力以及常识等广泛领域的能力并专门分析了其自回归架构带来的规划和工作记忆缺陷。作者断言这标志着向通用人工智能AGI迈出的重要一步。