Hacker News 中文摘要

RSS订阅

Show HN:任意HuggingFace模型的交互式动画架构 -- Show HN: Interactive, animated architecture of any HuggingFace models

文章摘要

该网站提供Hugging Face模型的可视化网络结构图,无需下载权重即可查看。页面展示了当前热门模型(如Qwen、DeepSeek等)及其参数规模与架构类型。

文章总结

modelmap

modelmap 暗黑模式?

modelmap

粘贴一个 Hugging Face 模型 ID,即可获得该网络的实时结构图——无需下载任何权重。

Hugging Face 当前热门模型 · 无限制访问、支持 Transformers 加载

1 Qwen/Qwen3.8-27B 图像-文本-文本 · ↓ 100万 · ♥ 1.1万 273.6亿 参数 · Qwen35ForConditionalGeneration ▶ 流程图
_2
Qwen/Qwen3.8-2.4T-A95B 文本生成 · ↓ 1.3万 · ♥ 1000 2.42万亿 参数 · Qwen35MoeForCausalLM ▶ 流程图
_3
deepseek-ai/DeepSeek-V4-Pro-0813 文本生成 · ↓ 3.8万 · ♥ 619 1.573万亿 参数 · DeepseekV4ForCausalLM ▶ 流程图
4 meta-models/Muse-Glimmer-30B 图像-文本-文本 · ↓ 43万 · ♥ 2000 297.8亿 参数 · MuseGlimmerForConditionalGeneration ▶ 流程图
5 deepseek-ai/DeepSeek-V4-Flash-0731 文本生成 · ↓ 230万 · ♥ 4000 2840亿 参数 · DeepseekV4ForCausalLM ▶ 流程图
6 dots-studio/dots3-note-prev 图像-文本-文本 · ↓ 1000 · ♥ 227 2880亿 参数 · 权重查看 · 权重
7 moonshotai/Kimi-K3 图像-文本-文本 · ↓ 230万 · ♥ 1.1万 1.504万亿 参数 · 权重查看 · 权重
8 LiquidAI/LFM2.5-VL-3B 图像-文本-文本 · ↓ 1.1万 · ♥ 180 31.2亿 参数 · Lfm2VlForConditionalGeneration ▶ 流程图

经典参考架构,即时可用

openai-community/gpt2 经典1.24亿参数解码器——最清晰的入门读物 1.24亿 参数 · GPT2LMHeadModel ▶ 流程图
Qwen/Qwen3-8B 现代密集大语言模型:分组查询注意力、均方根层归一化、门控多层感知机、36层 81.9亿 参数 · Qwen3ForCausalLM ▶ 流程图
Qwen/Qwen3-235B-A22B 混合专家模型:每层128个专家,2350亿参数 2350亿 参数 · Qwen3MoeForCausalLM ▶ 流程图
deepseek-ai/DeepSeek-V3.1 6710亿参数混合专家模型,采用多头潜在注意力 6710亿 参数 · DeepseekV3ForCausalLM ▶ 流程图
google-bert/bert-base-uncased 仅编码器:原始双向Transformer 1.1亿 参数 · BertForMaskedLM ▶ 流程图
Qwen/Qwen2.5-VL-3B-Instruct 视觉语言模型:视觉塔连接大语言模型 37.5亿 参数 · Qwen25VLForConditionalGeneration ▶ 流程图

比较

⌘K

对比

⌘K

例如 Qwen2.5-7B 对比 Qwen3-8B
结构来自元设备实例化;形状来自追踪的虚拟前向传播。任何公开仓库均可使用——添加令牌后也可访问受限仓库。

评论总结

根据评论内容,总结如下:

主要观点与认可度:

  1. 正面评价(高认可度):多数评论者赞赏该工具能可视化模型架构并估算服务成本。

    • "extremely cool... this is delightful" (mojosmojo)
    • "Love it... turns out it also estimates the cost of serving that model" (alansml)
  2. 功能询问(中性):有用户询问技术实现细节,如如何从配置生成架构图,以及是否计划展示张量形状或层参数。

    • "How are you generating the architecture graph from model configs... do you plan to surface tensor shapes or layer-level parameter counts?" (xms17189)
  3. 对比与问题(低认可度):有评论指出类似工具存在(hfviewer.com),并提到搜索功能可能有问题。

    • "I saw a similar page a month back... design aesthetics are bit different" (srvmshr)
    • "I think search is broken" (virajk_31)

平衡性总结: 整体以正面反馈为主,强调可视化与成本估算的实用性;同时存在功能询问和对比批评,但未形成强烈争议。