文章摘要
GLM 5.2模型在小型英国企业季度增值税申报任务中表现接近人类会计水平,处理59笔交易耗时68分钟,成本仅2.73美元,净误差仅7便士,准确率极高且成本远低于传统会计服务。
文章总结
我们评估了开源AI模型GLM 5.2为一家英国小企业准备季度增值税申报表的表现。在英国,中小型企业(SME)每季度必须完成增值税申报,通常由外部会计事务所处理,费用约为每季度750至2100英镑(约1000至2800美元)。法定要求是在季度结束后5周内提交申报,逾期将面临高额罚款。
测试中,GLM 5.2在68分钟内处理了59笔交易,原始代币成本仅为2.73美元,生成了近乎完美的季度增值税申报表。模型通过命令行工具将每笔交易输入会计软件,我们根据每笔交易的6项标准评分,最终净增值税额(Box 5)与人工准备的结果仅差7便士(约10美分)。
测试方法
我们从会计软件中提取了Vineyard Finance公司2026年第一季度的交易数据和收据,这些账目由人工准备并复核。人类会计的工作范围更广,包括查找发票和处理无法从银行流水直接推断的情况,而模型则通过“用户备注”获取这些信息。
GLM 5.2运行在隔离的Google Cloud实例上,可访问互联网和云端会计软件,但无法接触真实数据。模型使用Fireworks AI的无服务器层,量化精度未公开,但推测为FP16或FP8。审计未发现作弊行为,模型仅因操作需要连接互联网,例如查询会计软件中反向征收增值税的记录。
模型表现
每笔交易根据6项标准评分:交易类型、类别、增值税处理、增值税金额(误差容忍0.02英镑)、反向征收增值税和收据附件。整个季度共354项检查,模型在18笔交易中失败20项,其中仅1项严重错误:模型将创始股份错误归类为“资本账户”,而非正确的“未缴股份”,这涉及法律和审计风险,但未影响增值税申报。
其余错误中,14项混淆了“零税率”和“免税”类别,尽管两者均不涉及增值税支付,但专业会计通常不会混淆。最后3项错误涉及Wise账户的货币余额拆分问题,模型在3月正确处理了类似情况,但评分仍将其视为错误。
模型优势
模型始终正确分类交易账户(除股份资本错误外),从未错误附加发票,并能区分同金额、同供应商、同日的交易,以及处理银行间转账、拆分交易等复杂情况。这些能力此前仅由昂贵的前沿AI模型或高技能人工会计实现。
结论
记账问题正迅速被解决,当前重点是为英国初创企业和中小企业构建合适的应用框架。我们正在开发相关解决方案,欢迎通过toot-books.com测试公开测试版,或联系adam@vineyard-finance.com了解更多信息。
评论总结
根据评论内容,总结如下:
主要观点与论据:
LLM在记账任务上接近人类水平,但存在争议
- 支持者认为,在受限问题中LLM表现可靠(评论4、5、7)。例如,评论4提到“You can really constrain this problem... get pretty reliable and reproducible results”,评论5称“it seems considerably more accurate than when my wife was doing it”。
- 反对者强调“nearly”一词的误导性,认为税务申报必须完美(评论13、14、17)。评论13指出“For a tax return it has to be perfect every time or someone is at best getting a fine or at worst going to prison”,评论14批评“being 'essentially' correct is not good enough for the IRS”。
责任与风险是关键问题
- 多位评论者指出,LLM无法承担法律责任(评论3、10、13)。评论10写道“it also matters who ultimately goes to prison... the gun did it, but you were the one holding the gun”,评论13引用Toot的服务条款,强调“humans take accountability... Until an AI company CEO is willing to go prison... these tools are worthless”。
- 评论3提出核心问题:“will they take responsibility for the output if HMRC come calling? Without that users are adopting the risk”。
实际应用案例与局限性
- 评论9分享了成功使用Claude Code处理复杂税务申报的经历,但承认“the only error was in some way where I allocated a small amount of my wife's tax-free disability payments”。
- 评论11指出基准测试的局限性:“The job performed by the humans was broader than what was requested of the model”,并警告LLM可能“make something up arbitrary, then compound on the error”。
对数据隐私和公司背景的担忧
- 评论6对初创公司缺乏透明度表示警惕:“There is just a pretty website, a video, and a blog post. No info on the founders... I'd rather keep paying the small amount I pay to have my accounts done”。
平衡性总结:
评论呈现明显分歧:技术乐观派(如评论4、5、9)强调LLM在受控环境下的高效与准确性,而风险警惕派(如评论10、13、14)则聚焦于法律责任、完美性要求和实际应用中的不可靠性。中间立场(如评论3、11)承认潜力,但指出责任归属和任务复杂性是核心障碍。