实测Opus 5.5和GPT-6 Sol,提示词越短,差距越大。

作者用五个前端与游戏向的 HTML 生成任务,对比了 Claude Opus 5.5 和 GPT-6 Sol 的实际表现:提示词写得越细,两者越接近;提示词越短、需求越模糊,Opus 5.5 的优势越明显。文章完整给出了五个任务的提示词,并记录了两款模型的额度消耗情况,最后给出了按需求明确程度选模型、看性价比的建议。

大家好,我是萝卜哥~

最近的大模型领域可是真热闹啊,Anthropic 先发了 Claude Opus 5.5,大概一个半小时之后,OpenAI 就甩出了 GPT-6 Sol 和 Luna。两家前后脚,连降价都撞在一起了。

Opus 5.5 是 Anthropic 这次的主力,官方说法是大部分工作能达到自家顶配 Fable 5.1 的水平,但是价格却比 Opus 5 便宜了 40% 左右。

Sol 是 OpenAI 的中档大模型,定位是给写代码、干技术活用的,上面还有着一个更贵的 GPT-6 Astra。

Opus 5.5 与 GPT-6 Sol 的价格和定位对比表

Luna 是便宜货,专门接那种量大、目标明确的活,比如总结文档、抽信息、快问快答,免费用户在桌面端就能用。

Luna 与另外两款模型的价格和定位对比表

光看这张表,Sol 刚好是 Opus 5.5 的半价,但是现在的大模型,光是便宜可不行,咱们还要看效果。

下面根据萝卜哥的几个测试案例,来看看两个大模型到底怎么样吧~

让粒子拼出“萝卜哥”

先来个热身题,但这题其实挺考细节。

我给的提示词是这样的。

用一个单独的 HTML 文件做一个粒子文字动画,不要引用任何外部库,只用原生 Canvas。
要求如下。
1. 几千个发光粒子在黑色背景上聚合成文字"萝卜哥"。
2. 每隔 4 秒自动切换到下一个词,依次是"萝卜哥""OPUS 5.5""GPT-6""谁更强",切换时粒子先炸开再重新聚合。
3. 鼠标移过去时,附近的粒子会被推开,移走后再慢慢弹回原位。
4. 粒子颜色随位置和时间渐变,运动快的粒子更亮。
5. 点击页面可以手动切换文字。
6. 窗口缩放后文字自动居中重排,手机上用手指滑动也能拨开粒子。

Opus 5.5 交出来的效果是这样的,真的好棒啊。

几个细节我都挺满意的,切换文字的时候每个粒子随机领一个新坐标,所以炸开再聚合的路线都不一样,看着很自然。拖尾用的是半透明背景覆盖,没有额外算轨迹,性能很省,用浏览器打开没有一点卡顿的感觉。

再来看 GPT-6 SOL 的效果,同样很棒,我个人觉得这个案例,甚至 SOL 更打动我。

不知道大家觉得哪个更好呢?

这一题我觉得两边的差距,更多是风格上的偏好。提示词写得这么细,两个模型基本都是照着单子一条条交作业,能拉开的空间本来就不大。

所以谁更打动你,很大程度上看你喜欢哪种手感。粒子推开以后是软软地弹回去,还是干脆利落地归位,颜色是偏冷还是偏艳,这些提示词里都没写死,全靠模型自己拿主意。

一个会跟着鼠标转的玻璃播放器

这题开始上难度了,考的是审美。

用一个单独的 HTML 文件做一个音乐播放器界面,不要引用任何外部库。
要求如下。
1. 背景是缓慢流动的极光色块,粉、紫、青三种颜色,要有呼吸感。
2. 中间是一张毛玻璃卡片,圆角大一点,边缘有细细的高光。
3. 卡片上方是一个环形频谱,一圈彩色的柱子围着一张旋转的唱片,唱片中间画一个小萝卜当 logo。
4. 没有真实音频也要动起来,用算法模拟节拍,有明显的重拍。
5. 下面是歌名 Midnight Radish、副标题"萝卜哥 · Lo-fi 写稿专用"、进度条、上一首、播放暂停、下一首。
6. 点暂停后频谱慢慢落下去、唱片停转,背景的色块也变暗。
7. 鼠标在页面上移动时,卡片跟着做 3D 倾斜,表面有一块光斑跟着鼠标走。

Opus 5.5 的版本。

Opus 5.5 还是很稳定的,提示词里面要求的都满足的很不错。

频谱那圈柱子从粉色一路过渡到青色,每隔一会儿会有一次重拍,所有柱子一起往外顶一下,挺有节奏感的。

最让我惊喜的是它对于暂停的处理,按下去以后频谱柱子一根根落回去,背景的色块也慢慢暗下来,整个页面像是跟着安静了。

来看看 GPT-6 SOL 的效果

说实话这个就差很多,可以说是被全面碾压了,看来对于纯前端的任务,GPT 还是不太行啊。

我觉得提示词里面那几个形容词,比如“呼吸感”“细细的高光”“慢慢落下去”,这些词没法直接翻译成代码,模型得自己去想,呼吸感到底是多快的节奏,高光到底要多细,落下去要花几秒,GPT-6 SOL 理解的不到位。

凡是做过设计的朋友都知道,从能用到好看,中间那段路最难走。所以以后你要做落地页、产品展示页这种门面活,审美这一关我建议优先交给 Opus 5.5。

写一个能玩的小游戏

这是一个比较能拉开差距的地方,页面好看可以靠堆特效,游戏能不能玩一上手就知道。

用一个单独的 HTML 文件做一个横版跑酷小游戏,名字叫"萝卜快跑",不要引用任何外部库,所有角色都用 Canvas 代码画出来,不用图片。
要求如下。
1. 主角是一根戴墨镜的粉色萝卜,头上三片叶子,跑的时候叶子会晃,脚会交替动。
2. 障碍物是白色的兔子,一跳一跳地迎面过来,眼神要凶一点。
3. 按空格或点击屏幕起跳,支持二段跳,起跳时身体被压扁,落地时再弹一下。
4. 空中会出现旋转的金币,吃到加 50 分,并且炸出金色的小颗粒。
5. 背景是夕阳,有两层不同速度的山做视差滚动。
6. 速度随分数慢慢变快。撞到兔子时屏幕震动,萝卜炸成粉色和绿色的碎片,显示"被兔子逮住了"。
7. 右上角显示当前分数和最高分,按空格重新开始。

Opus 5.5 的版本。

每次跳跃的时候,萝卜脚下那些淡紫色的小点是起跳时扬起的灰,右上角那颗金色的小圆点就是金币。

手感方面,第一跳高、第二跳矮一点,节奏挺舒服。兔子是一蹦一蹦过来的,每只蹦的节奏还不一样,判断起跳时机需要一点反应。

被兔子逮住的那一下,屏幕会抖,萝卜炸成一片粉绿色的碎片,看着有点惨,又有点好笑。

SOL 的效果

其实也不错,跳跃的感觉没有 Opus 5.6 好,但是整体游戏元素要更好一些,萝卜人的四肢也比较明显。

对于这个案例,我觉得两个大模型能打个平手吧~

Opus 赢在手感,SOL 赢在卖相。

如果你是想做个小游戏自己玩,或者拿给小朋友玩,我会选手感好的那个,因为玩几把以后你根本不会盯着萝卜的胳膊看。要是拿来做演示、录视频,那 SOL 这版反而更上镜。

其实上面的提示词,我觉得还是约束太多了,对于 Opus 和 SOL 这样的顶级大模型,反而束缚了它们的手脚,所以下面两个案例,我的提示词是越来越简单,但是效果还是很惊艳。

复刻暴力摩托

现在我们在测试一个大模型水平的时候,总是喜欢让它画鹈鹕骑自行车,我这次没有这么做,直接让它们复刻经典游戏,来看看它们的理解能力怎么样。

帮我制作一个3D暴力摩托HTML游戏,把你所能用到的能力都用上

Opus 5.5 的效果如下,它的首页是动图,立刻就感觉高大上了不少啊。

GPT-6 SOL,相对来说就差了不少,各种细节都比不过,人物的出圈,赛场上的干扰因素,比如逆向的车辆等等,全方位被碾压了。

这一题最能看出两个模型的差别,因为提示词只有一句话,剩下的全靠它们自己脑补。

“把你所能用到的能力都用上”,这句话其实是在考主动性。Opus 5.5 的理解是,一个完整的游戏该有的东西都得有,所以它先做了动态首页,赛道上还主动加了逆行的车辆当干扰。这些我一个字都没提,它自己补上了。

从成品来看,SOL 更像是把题目的字面意思做完就收工,能跑能玩,但也就到这儿了。

我的判断是,需求越模糊,越需要模型自己拿主意,Opus 5.5 的优势就越明显。需求写得清清楚楚、按单子干活的时候,两边的差距会小很多,前面三个案例已经说明了这一点。

一句话生成视频

在网上还看到有网友一句话生成科普视频,真的是太强了,我稍微做了一下优化,使用的是下面的提示词。

做一个动画,快速回顾中国古代三国的历史。风格轻松有趣,动画风格为手绘风格,需要添加合适的背景音乐,,整体要做到足够吸引人

Opus 5.5 的作品,它是生成了 HTML 页面,有背景音乐,但是没有旁边。

可是这个效果是真的牛啊,画面精美,各个人物也很精良,对于历史事件的描述也很准确,囊括了史实和演义的内容,我觉得足可以称得上精品了,就算直接发到短视频平台也没问题。

SOL 的产物,它生成的不是 HTML,是直接给出了 MP4 文件,而且带有旁边,这一点还不错。

SOL 生成的三国历史动画 MP4 的画面

可是其他的就没法比了,虽然说整体事件没有问题,但是画面还是太粗糙了,完全没有 Opus 那种寓教于乐的感觉,整体画面就是一些图片的简单拼接,动效太简单。

这五个案例测试下来,我本来以为自己的 GPT 和 Claude 额度会见底,结果没想到异常的坚挺。

我的 GPT plus 账号五小时额度还有 66%,Claude Pro 账号五小时额度还有 76%,你敢信?

而且这些任务我跑下来,前前后后总共也就花了不到3个小时,这真的是又快又好又耐用啊。

这个额度表现,我觉得比任何跑分都更实在。

写在最后

总体来说,我觉得简单的任务交给 SOL 还是完全没有问题的,它的额度现在也是比较抗用的,但是如果是比较复杂的编码工作,那有条件一定要上 Opus 5.5,确实是强啊,关键还不贵。

五个案例排下来,其实能看到一条很清楚的脉络。提示词写得细的时候,粒子和跑酷两题基本打平,只有考审美的播放器拉开了差距,因为审美那部分恰恰是提示词写不死的。提示词越短、需求越模糊,差距就拉得越开,暴力摩托和三国动画这两题,Opus 5.5 几乎是一边倒的优势。

这条脉络对我们自己用模型也有参考价值,你要是习惯把需求写得清清楚楚,一条一条列出来,那 SOL 性价比更高,API 价格只有 Opus 5.5 的一半。你要是经常一句话丢过去,希望模型自己把事情想周全,那多花的钱花在 Opus 身上就更合适。

提示词我都完整放在文章里了,最简单的那两句一共也没几个字,复制过去就能跑。

挑一个你最想要的,丢给两个模型试试,跑出来的效果欢迎在评论区晒一晒。

挑一个你最想要的,丢给两个模型试试,跑出来的效果欢迎在评论区晒一晒

内容核验说明

五个前端与游戏任务的对照过程写得比较具体,提示词全文附上,复制过去就能自己做平行对比,这是它最实在的地方。作者按需求明确程度给出了一条选型线,需求列得细时两家接近,一句话丢过去时 Opus 5.5 的差距拉得更开,常写短提示词的人可以据此判断要不要多花钱。效果描述和额度剩余比例都出自作者自述,模型版本信息也需自行核对,结论只对应他的测试场景。

文中效果对比、额度剩余数据(GPT 账号五小时 66%、Claude Pro 五小时 76%)均来自原作者公开披露,诀.com 未独立验证;案例结果依赖具体提示词与账号状态,不保证复现。

原始来源

原作者:zhouluobo(@zhouluobo)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文