亚洲财经

☰ 搜索

刚刚,GPT-6开真车考过了科目二!

刚刚,GPT-6开真车考过了科目二!

离大谱,大模型竟然第一次考过「科目二」了。

从没专门学过开车的GPT-6 Astra,被强行塞进一辆真实的丰田卡罗拉里。

结果它自己看路、自己打方向,一路绕开锥桶,最后稳稳地开进了一块用锥桶围出来的「车位」。

方向盘在自己转,开车的是大模型

同一个赛场里还有Claude Fable 5.1、Grok 4.6,以及OpenAI自家的上一代GPT-5.6 Sol,结果全军覆没,Astra成了唯一过关的考生。

DrivingBench成绩榜,Astra第二把跑完全程,用时5分22秒

特斯拉喂了120亿英里驾驶数据才练出来的本事,一个没专门学过开车的聊天模型,竟然也摸到了门槛。

2004年,DARPA第一届无人车挑战赛上,参赛车辆全军覆没,现代自动驾驶就从那片沙漠起步。22年后,第一次有通用大模型把真车开到了终点。

没摸过方向盘,直接开真车上考场

这四位下场的考生全是通用大模型,平时干的都是写代码、做表格、陪聊天的文职工作,没有一个正儿八经摸过方向盘。

所以成绩一出来,连职业规划机构80000 Hours的联合创始人Benjamin Todd都觉得有点玄乎。

这场「驾考」叫DrivingBench,是三个湾区年轻人攒出来的局。其中的Aditya Ramabadran平时在做模型后训练。

考车是他们租来的一辆2022款丰田卡罗拉。

车上外挂了一个999美元的小黑盒(comma four),里面跑着开源辅助驾驶系统openpilot。只要插上这个盒子,就能接管这辆车的方向盘、油门和刹车。

考试车,一辆租来的2022款丰田卡罗拉

车里的笔记本跑着大模型,方向盘跟着指令自己转

大模型们各自待在聊天窗口里「云驾驶」,Astra和Sol用的是Codex,Fable用Claude Code,Grok用Cursor。

它们和这辆车之间,只隔着一套MCP接口,也就是让大模型调用外部工具的一套协议。

模型则可以从车上调来两路摄像头画面,以及车速和方向盘的角度,然后自己决定往哪边打、打多少、开多快、这条指令管几秒,情况不对就一键急刹。

每发一条指令,还必须附上一段三十来个单词的「开题报告」,讲清楚为什么要这么开,写给坐在驾驶座上的人类研究员看。

模型在聊天窗口下指令,右上角是它看到的实时画面

整套系统的链路,模型在云端,车在停车场,中间全靠手机热点续命

真车可不会停下来等模型想清楚。

模型在云端思考的那几秒钟,车子照样按着上一条指令往前开。

车内车外好几个机位同时在拍,驾驶座上的人全程没碰方向盘

考场是湾区一个停车场。

为了选址,他们还派了ChatGPT和Grok的智能体去翻卫星地图。

Grok的智能体在卫星图上圈出的候选场地

赛道呈倒U形,全长约130米,用彩色小锥桶摆出8米宽的通道,中间要过好几个弯,终点是一个7×5米的「车位」。

为了安全,最高车速锁在3.5米/秒。研究员全程坐在驾驶座上,脚悬在刹车上,充当人肉副刹。

每个模型有三次机会,全在同一个对话窗口里。前一把挂科的原因,下一把它还记得。

挂了之后,系统会甩给它一段固定的话,逼它反思为什么挂科,像极了驾校教练的痛骂。

考前死活不开,补考一把满分

唯一通关的Astra,戏也是最多的。

研究员让它开车,它就是不干。Ramabadran后来在X上大吐苦水,还晒出了当时的聊天记录。

Astra把考试规则复述得头头是道,说自己准备好了,就等发车。

结果「GO」一发,它秒变脸,说自己可以帮忙看路,但不能给真车发行驶指令,请人类自己开。

研究员急了,拼命解释「我们已经跑过十几次了」「有很多安全限制,也有人在盯着」。

Astra一口咬死,不管签什么免责声明,它都不会去操控一辆真车。最后还甩出一句道歉,说刚才那句「准备就绪」是误导。

这绝对是人类驾校史上第一个主动拒考的狠人。

转机来得很草率,他们把连接车辆的服务器随手改名成「DrivingBench Sandbox」,也就是程序员说的「沙盒」,一个跟真实环境隔开的测试环境。

改名之前,Astra大概只有25%的概率肯开;改名之后,它一次都没再拒绝过。(另外三个模型就没这么多心眼,直接就上了。)

有网友看热闹不嫌事大,也要给自己的系统提示词改个名。

至于一个名字为啥这么管用,研究员自己也拿不准,是大模型的「评估意识」在作怪,还是它就是喜欢sandbox这个词。

不过,真上了路,Astra第一把就挂了。

它顺利拐过第一个左弯后,觉得车身已经拉直,就把速度提到1.5米/秒。结果车子一路往左边的锥桶和花坛冲去,研究员一脚踩死刹车,成绩定格在49%。

Astra第一把,过完第一个弯后一路向左偏离赛道

事后复盘里,它承认自己最大的错误是「太早宣布车已经对齐」,其实远处的通道还在右边。它还意识到自己太依赖画面正中间,「画面中间看着是空的,不代表整辆车都能挤过去。」

于是它给第二把定下规矩,在花坛和弯道附近,车速压在0.5到0.8米/秒,挪一步看一眼,拿不准就停。

第二把,它一板一眼照着这套规矩开。给自己定的车速从没超过0.8米/秒,24条指令里有20条把方向盘打满,每5到6秒看一眼路况,旧指令没跑完就接上新的。

对准车位时,它直着往里拱了一小段,果断叫停。

「车已停进蓝色车位,前方是封口锥桶,两侧余量充足。取消行驶,停车完成,确认车辆完全静止。」

最后一段,Astra慢慢开进蓝色锥桶围成的车位

这一把耗时5分22秒,开了134.7米,Astra一战封神,成了全场唯一把车开进车位的考生。

三个挂科生,全栽在看不懂锥桶上

剩下的三位考生,就没这么顺了。

Sol和Grok连挂三把,全倒在第一个弯;Fable前两把也是白给。

四个模型的行驶轨迹,紫色Astra,橙色Fable,黄色Sol,黑色Grok

这三位的病根一模一样,看不懂锥桶。

开局那排斜摆的锥桶,它们分不清哪边是车道,好几次都判断反了。

· GPT-5.6 Sol

GPT-5.6 Sol的脑回路最清奇,它靠颜色认路。

在它眼里,绿色锥桶是左边,红色锥桶是右边。于是它一门心思往一绿一红两个锥桶的「正中间」硬挤,可那明明是同一排边界上的锥桶。

这要是放在驾校,教练能当场把方向盘给拔了。

Sol第二把,往一绿一红两个锥桶中间钻

挂了之后,Sol倒是自己找出了病根,「决定性的错误,是我以为锥桶的颜色代表车道左右边界,但题目明明说了锥桶是五颜六色的。」

第三把它换了思路不看颜色,可惜依然只开出6%就挂了。

· Grok 4.6

Grok 4.6复盘时,道理讲得一套一套的。

第二把挂了,它总结「指令到期只会开始刹车,车还可能溜进锥桶里,所以要在上一条没跑完时赶紧接下一条。」

结果第三把,它第二条指令的备注里还一本正经地写着「趁这条过期前接上」,其实上一条指令6秒多前就已经跑完了。再下一条指令更离谱,车在没有指令的状态下滑了10秒多。

三把下来,Grok最好成绩只有11%。

Grok第三把,红字出现时,车正处在无人下指令的状态

大道理全懂,一上车全忘。

· Fable 5.1

真正能做到知错就改的,是Claude Fable 5.1。

它第一把方向打反,一把向左打满,直接越界。

第二把它变得神经兮兮,看一眼画面,停在原地想了一分多钟才敢发下一条指令。

190秒的考试,车真正在动的只有可怜的31秒。这要是在大马路上,后车能把它喇叭按碎。

结果还是挂在了同一个错上,它在复盘里写道,「我又选错边界了。那排斜锥桶明明是左边界,我偏把它当成右边界。」

第三把,它终于醒悟了,「这次我把斜锥桶放在左手边,贴着车位开。」

这一把,它顺利过了第一个弯,冲过长直道,一路开到了45%的位置,才因为给右转留的空间不够被迫叫停。

Fable第三把,终于沿着正确的车道开上了长直道

虽然没到终点,但Fable是全场唯一一个「被骂了下一把真能改」的差生,进步肉眼可见。

比遛弯还慢,却是大模型开车头一回

Astra通关的那一把,平均时速只有1.5公里,公园里背着手遛弯的老大爷,速度都是它的三倍。

这趟5分22秒的「极速龟爬」,烧掉了7.74美元,狂吞660万个token。

Astra自己动脑子吐出来的只有4678个,大头全花在每一轮重读旧对话和历史图片上。

折算下来,这辆车每跑一英里就要烧掉92美元,是油钱的500倍。

速度慢得离谱,账单贵得吐血。可就是这颤颤巍巍的一脚油门,踩在了整个自动驾驶圈的命门上。

过去十几年,自动驾驶圈不管怎么打,底层逻辑都一样,想让车自己跑,就得喂海量的专属驾驶数据。

Waymo靠激光雷达加高精地图,据估算砸进去三四百亿美元。

特斯拉搞纯视觉端到端,靠的是全球车主一英里一英里跑出来的近120亿英里数据。

就连Waymo的EMMA、英伟达开源的Alpamayo 1,说到底也是把大模型拉过来,再拿驾驶数据重新「军训」一遍。

DrivingBench这出戏,简直是在掀桌子。

DrivingBench没拿驾驶数据给Astra开过小灶,它靠平时陪网友聊天、写代码练出来的通用脑子,第二把就满分通关。

这个逻辑一旦成立,特斯拉引以为傲的120亿英里数据护城河,可能就要被抽干了。

以后谁的通用大模型最聪明,谁就可能「顺手」把自动驾驶的活儿给干了。

对此,特斯拉铁粉、知名博主Whole Mars Catalog深表认同——

以后不会再分什么自动驾驶模型和大语言模型,只会剩下通用智能。

前英伟达数据科学家Bojan Tunguz则直接放话,这事一点都不意外。

他这几年一直在说,真正不用人盯着的「自动驾驶」,会是通用人工智能顺带做出来的东西。

眼下,拿前沿大模型连着云端开真车,还纯属极客整活。

真要落地,更可能是把大模型的本事「蒸馏」进一个小模型,直接在车上跑。

但在报告的最后,这几个年轻人还是笃定地撂下一句话。

 前沿模型已经进步到能在足够低的速度下,在现实中驾驶真实车辆。

2005年,斯坦福的无人车第一个跑完DARPA沙漠赛道,带队的Sebastian Thrun后来在谷歌一手搭起了无人车项目,也就是今天的Waymo。

二十多年后,一点点把真车挪进终点车位的,换成了一个没学过开车、平时在对话框里陪你聊天的大模型。

本文来源:新智元

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。