Hacker News 中文摘要

RSS订阅

卡帕西的鹈鹕 -- Karpathy’s Pelican

文章摘要

Andrej Karpathy用《指环王》首段测试Opus 5,花费约2小时和10美元生成了5500行代码,以3D形式呈现故事。他认为LLM能完成这种没人愿意做的繁琐工作,并展望了按需创建沉浸式虚拟世界的可能性,但也指出LLM在自我审计方面存在弱点。

文章总结

我们正逐渐超越用“生成一个骑自行车的鹈鹕SVG”来测试大语言模型(LLM)的阶段。作为泛化思路之一,我好奇如果给Opus 5《指环王》第一段文字、100万token预算(约10美元),并让它用Three.js渲染出来会怎样。Opus花了约2小时,写了5500行代码,程序化地呈现了这个故事。效果虽有些粗糙,但很有趣。令人惊叹的是,LLM需要将各种多边形资产放置在(x,y,z)坐标中,并编写代码让它们动起来,而且它居然真的做到了。我喜欢这类例子,因为正常人绝不会花时间写如此定制化的东西,但LLM拥有无限的耐力和耐心,所以我们从“没人会这么做”变成了“当然可以,反正几乎免费”。未来可能还有更多类似应用。我兴奋的是,可以创建超定制化的世界,让玩家沉浸其中,比如作为旁观NPC参与《指环王》故事,或扮演其中一个角色等。这有点像按需生成的临时版《侠盗猎车手》。最后一点思考是,世界/游戏领域暴露了LLM的弱点:它们无法高效地原生感知视频或玩游戏,因此难以审计自己的工作。在这里,Opus 5不得不缓慢而费力地在不同节点截取屏幕截图,还多次出错,产生了一些粗糙效果。这体现了多模态和游戏能力等原始能力仍然相当欠缺。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 对AI生成游戏和3D内容的质疑:多位评论者认为,当前AI生成的游戏和3D动画缺乏实际娱乐价值。例如,评论15指出“AI slop games have literally zero engagement”,评论16补充“None of them are any fun... All have the same cel-shader”。这些观点获得一定认可,强调AI生成内容在用户体验上的不足。

  2. 对基准测试的批评:评论1认为这是“perfect benchmark to burn more tokens”,评论3则希望“never ever had to see the pelican SVG test ever again”。评论14质疑“pelican test”是否应被视为严肃基准。这些评论反映了对现有测试方法的不满。

  3. 对AI模型能力的怀疑:评论5批评Andrej Karpathy从“reasonable, trusted”变为“peddling marketing slop”,评论8指出模型可能“know the first paragraph for any novel... verbatim”。评论17提到版权问题,称“opus 5 would refuse based on copyright grounds”。这些观点质疑AI的真实能力和透明度。

  4. 对AI生成内容的积极看法:评论4认为这展示了“a couple orders of magnitude away from generating 1:1 hyper-personalized entertainment”,评论29指出“models have moved beyond generating images to a new kind of benchmark”。评论6分享了个人成功案例,称“it does a pretty amazing sequence”。这些观点认可AI的进步潜力。

  5. 对技术实现的讨论:评论25好奇模型如何“convert the latent representation of those images into coordinates for a 3D mesh”,评论27建议探索“using a game engine and a coding agent”。评论18认为模型“specifically trained to be good at generating three.js code”,暗示测试局限性。

平衡性总结:评论呈现明显分歧。一方批评AI生成内容质量低、缺乏娱乐性,并质疑基准测试的有效性;另一方则看到技术进步和未来潜力,认为这是衡量物理世界理解的新方式。多数评论对当前AI能力持谨慎或批评态度,但少数认可其作为基准的价值。