Hacker News 中文摘要

RSS订阅

LLM批评者是对的,但我仍在使用LLM -- The LLM Critics Are Right. I Use LLMs Anyway

文章摘要

尽管我认同大多数对LLM的批评,我仍大量使用它们。在Local-First Conf上,连构建LLM工具的工程师也被自己的创造物淹没,不得不自动关闭大量PR。这种矛盾普遍存在。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。


标题:LLM批评者说得对,但我仍然使用LLM

我几乎同意所有对LLM的批评,但我仍然大量使用它们。这种认知失调让我自己也觉得矛盾,但我并非个例。

在最近的一次会议上,这种矛盾随处可见。例如,一位知名工程师(Flask创建者)正在开发一个LLM工具,但他的公司却自动关闭了几乎所有由LLM生成的PR。他们的宗旨是“人类是最好的代理”,这本身就是一种矛盾。观众一边用着Claude Code,一边为台上批评LLM的演讲热烈鼓掌。

LLM的弊端

我认同LLM的诸多问题:它产生大量“垃圾内容”,破坏了开源社区的信任基础——过去一个像样的PR需要投入时间,现在任何人都能轻易生成大量低质PR。这可能导致开源项目消亡,除非我们找到重建信任的方法。

此外,LLM还影响了初级工程师的培养。资深开发者无法判断初级代码是十分钟“氛围编程”的产物,还是经过深思熟虑的成果。同时,许多基础工作已可外包给LLM,削弱了雇佣和培养新人的动力。

还有地缘政治风险,比如美国政府曾一夜之间切断非美国公民对Anthropic最新模型的访问。最后,LLM会潜移默化地输出训练数据中的主流观点,如同朋友间会互相影响用词一样。

LLM的价值

尽管问题重重,但LLM已无法被忽视。与其逆流,不如顺势而为并加以引导。例如,确保模型能在本地运行,这能让我们摆脱对大公司的依赖,避免被政府切断。当泡沫破裂时,开源模型将是程序员的退路。

关键在于,使用LLM的人需要以自己的信誉做担保。他们不会让LLM代替思考,而是用它来放大和加速自己已有的想法、结构和框架。LLM擅长头脑风暴、语法检查、充当“魔鬼代言人”。如果你没有想法,它只会流畅地输出空洞内容。

对我而言,LLM的价值在于提升质量。我会消耗大量token只为打磨几句话。我认为,区分“AI垃圾”和“好内容”的标准,在于背后是否有人的思考。但问题在于,从外部无法判断这一点。一句“我用AI来更好地思考”,可能出自深思熟虑者,也可能出自技术布道者。最终只能依赖信任,而信任在LLM时代很难建立,却极易失去。

我的使用模式

我使用LLM的关键是,它必须理解真实问题和需求。它不会告诉你它没理解,只会直接执行。因此,我采用“拷问”模式:让LLM像面试官一样,一个问题接一个问题地追问,直到我们达成共识。这迫使我形成自己的思考。

对于编码,我会遵循“问题-交付内容-不交付内容”的简短框架,强迫自己写出三句话的问题陈述。这迫使我去真正阅读和审视它。对于PR描述,我也会投入大量精力,确保其清晰、简洁,并附上截图,给审查者一个明确的信号。

我还使用“反向循环”技术:让LLM的子代理不断攻击和拆解我已有的计划或代码,直到它们被迫开始“幻觉”出不存在的问题。这时,我就知道我的方案已经足够扎实。

甚至可以利用LLM的“幻觉”特性:让它先“猜测”一个API或用户体验设计,这通常反映了大多数人的直觉。然后,我根据它的猜测来调整我的设计,以此作为低成本的设计测试。

所有这些模式都有一个前提:我必须能判断结果的好坏。我只会在我熟悉的领域使用LLM,或者用它来帮助我学习新领域。如果无法区分好坏,就会产出垃圾。在结果有明确对错(如代码能否编译)的领域,我可以和LLM一起学习。但在充满主观意见的领域(如编程风格),LLM只会输出最流行的观点,这时需要人类来指引方向。

结语

我并非孤例。通过会议和网络交流,我发现很多人都有类似的认知失调。写作本身没有让我意识到这一点,但与人交流让我看到了这一点。LLM是一个能丰富你思考的好工具,但它永远无法取代你的思考。

评论总结

以下是对评论内容的总结,涵盖主要观点、论据及不同立场的平衡性,并保留关键引用:

1. LLM对技能的影响:提升 vs. 萎缩

  • 支持提升:LLM能加速熟悉领域的产出,并帮助快速入门新领域。
    • “I am noticing a speedup in areas I was already familiar with, and a quicker introduction to new ones.” (msdz)
    • “LLMs have made my work easier and faster... they've made my side projects easier and faster.” (post-it)
  • 担忧萎缩:长期依赖可能导致编程或思考能力退化,如同肌肉不锻炼会萎缩。
    • “constant use of ‘agent’ harnesses will lead to an atrophy of the software engineering muscles.” (msdz)
    • “Criticizing use of agents for skill atrophy is valid, it definitely atrophies blank slate coding ability.” (CuriouslyC)

2. 信任与代码质量:AI辅助的争议

  • 信任问题:AI生成的代码若缺乏可审查性(如巨大且不透明的diff),无论来源如何都难以信任。
    • “A small, reproducible change with clear tests is reviewable; a huge opaque diff is not, regardless of who typed it.” (Ellis_dev)
  • 微观质量 vs. 宏观混乱:AI在微观代码层面可靠,但易导致代码库混乱,责任在开发者。
    • “They produce shitty codebase organization, but at a micro level their code is solid... If you let them turn your codebase into a spaghetti mess, that's on you.” (CuriouslyC)

3. 开源社区与新人培养的冲击

  • 低质量PR泛滥:AI生成的PR缺乏讨论和背景,增加维护者负担,甚至导致屏蔽外部贡献。
    • “a lot of people are throwing low quality PRs that should have been an issue or even a discussion.” (a1o)
    • “Before LLMs... creating a proper PR would require at least some human time... now it's all just slop.” (mschuster91)
  • 教学与成长:AI取代了初级开发者通过琐碎任务学习的机会,削弱了师徒传承。
    • “The teaching... ‘the junior does some pretty mundane tasks, but for this the senior reviews it together with him and helps him to grow’.” (mschuster91)
    • “Master craftsmen didn't take on apprentices to give them chores.” (mohamedkoubaa)

4. 认知与思考的异化

  • 思考外包风险:LLM可能替代真正的思考,导致“思想腹泻”和同质化输出。
    • “It leads to ‘thought diarrhea’... An LLM will always praise your shower thoughts and gladly turn them into multi-page essays.” (skippyfish)
    • “The alternatives, the counterexamples, the sentence structure... that part gets outsourced.” (jdw64)
  • 长期影响未知:类似智能手机成瘾,LLM可能削弱而非丰富思考能力。
    • “Will LLMs enrich my thinking in the long run, or will they ruin it?” (markandsweep)

5. 批评者的矛盾与合理性

  • 批评者并非全盘否定:许多批评者同时使用LLM,但警惕其风险。
    • “The implication is that LLM critics don't use LLMs at all... both of those things are incorrect.” (happytoexplain)
    • “I use them every day for the benefits, fully aware of the faults, and I watch those faults like a hawk.” (glasffordd)
  • 批评的时效性:AI快速进化,部分批评可能过时。
    • “A lot of the criticism can become outdated in a year or six months.” (threethirtytwo)

6. 伦理与环境争议

  • 成本与价值观冲突:高额token消耗(如月耗1万美元)与环境关切形成矛盾。
    • “10k USD in a month for AI tokens? After talking about the environmental cost of AI?” (adamas)
  • 伦理立场:若基于道德原则拒绝AI,则批评与使用难以调和。
    • “If you're concerned about their ethics then this becomes a much more challenging position to have.” (trescenzi)

7. 实用主义与中间路线

  • 谨慎使用:将AI视为“草稿0”,验证后采用,避免盲目信任。
    • “I basically consider the AI draft of anything to be ‘draft 0’... I don't ever blindly trust it.” (RIMR)
  • 尊重差异:无论支持或反对,应承认AI的潜力与风险并存。
    • “Love it, hate it - I don't care, but at least respect it.” (tibordp)

总结:评论呈现了LLM在效率提升、技能影响、信任危机、社区冲击及认知异化等方面的复杂辩论。支持者强调其加速产出与学习,批评者担忧长期依赖导致能力退化、思考同质化及伦理问题。多数人主张谨慎使用,平衡工具优势与个人判断。