文章摘要
该网站提供Hugging Face模型的可视化网络结构图,无需下载权重即可查看。页面展示了当前热门模型(如Qwen、DeepSeek等)及其参数规模与架构类型。
文章总结
modelmap
modelmap 暗黑模式?
modelmap
粘贴一个 Hugging Face 模型 ID,即可获得该网络的实时结构图——无需下载任何权重。
Hugging Face 当前热门模型 · 无限制访问、支持 Transformers 加载
1 Qwen/Qwen3.8-27B 图像-文本-文本 · ↓ 100万 · ♥ 1.1万 273.6亿 参数 · Qwen35ForConditionalGeneration ▶ 流程图
_2 Qwen/Qwen3.8-2.4T-A95B 文本生成 · ↓ 1.3万 · ♥ 1000 2.42万亿 参数 · Qwen35MoeForCausalLM ▶ 流程图
_3 deepseek-ai/DeepSeek-V4-Pro-0813 文本生成 · ↓ 3.8万 · ♥ 619 1.573万亿 参数 · DeepseekV4ForCausalLM ▶ 流程图
4 meta-models/Muse-Glimmer-30B 图像-文本-文本 · ↓ 43万 · ♥ 2000 297.8亿 参数 · MuseGlimmerForConditionalGeneration ▶ 流程图
5 deepseek-ai/DeepSeek-V4-Flash-0731 文本生成 · ↓ 230万 · ♥ 4000 2840亿 参数 · DeepseekV4ForCausalLM ▶ 流程图
6 dots-studio/dots3-note-prev 图像-文本-文本 · ↓ 1000 · ♥ 227 2880亿 参数 · 权重查看 · 权重
7 moonshotai/Kimi-K3 图像-文本-文本 · ↓ 230万 · ♥ 1.1万 1.504万亿 参数 · 权重查看 · 权重
8 LiquidAI/LFM2.5-VL-3B 图像-文本-文本 · ↓ 1.1万 · ♥ 180 31.2亿 参数 · Lfm2VlForConditionalGeneration ▶ 流程图
经典参考架构,即时可用
openai-community/gpt2 经典1.24亿参数解码器——最清晰的入门读物 1.24亿 参数 · GPT2LMHeadModel ▶ 流程图
Qwen/Qwen3-8B 现代密集大语言模型:分组查询注意力、均方根层归一化、门控多层感知机、36层 81.9亿 参数 · Qwen3ForCausalLM ▶ 流程图
Qwen/Qwen3-235B-A22B 混合专家模型:每层128个专家,2350亿参数 2350亿 参数 · Qwen3MoeForCausalLM ▶ 流程图
deepseek-ai/DeepSeek-V3.1 6710亿参数混合专家模型,采用多头潜在注意力 6710亿 参数 · DeepseekV3ForCausalLM ▶ 流程图
google-bert/bert-base-uncased 仅编码器:原始双向Transformer 1.1亿 参数 · BertForMaskedLM ▶ 流程图
Qwen/Qwen2.5-VL-3B-Instruct 视觉语言模型:视觉塔连接大语言模型 37.5亿 参数 · Qwen25VLForConditionalGeneration ▶ 流程图
比较
⌘K
对比
⌘K
例如 Qwen2.5-7B 对比 Qwen3-8B
结构来自元设备实例化;形状来自追踪的虚拟前向传播。任何公开仓库均可使用——添加令牌后也可访问受限仓库。
评论总结
根据评论内容,总结如下:
主要观点与认可度:
正面评价(高认可度):多数评论者赞赏该工具能可视化模型架构并估算服务成本。
- "extremely cool... this is delightful" (mojosmojo)
- "Love it... turns out it also estimates the cost of serving that model" (alansml)
功能询问(中性):有用户询问技术实现细节,如如何从配置生成架构图,以及是否计划展示张量形状或层参数。
- "How are you generating the architecture graph from model configs... do you plan to surface tensor shapes or layer-level parameter counts?" (xms17189)
对比与问题(低认可度):有评论指出类似工具存在(hfviewer.com),并提到搜索功能可能有问题。
- "I saw a similar page a month back... design aesthetics are bit different" (srvmshr)
- "I think search is broken" (virajk_31)
平衡性总结: 整体以正面反馈为主,强调可视化与成本估算的实用性;同时存在功能询问和对比批评,但未形成强烈争议。