笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友
先说说背景。TensorSharp 是个纯 .NET 的 LLM 推理引擎,跑在 .NET 10 上,直接读 GGUF 权重。它提供 CLI、交互式 REPL、ASP.NET Core Web UI,还有 Ollama / OpenAI 兼容的 HTTP API。对 .NET 团队来说,核心价值在于推理栈从"旁边起一个 Python/C++ 进程、走 HTTP 请求"变成了进程内的一等公民。后端矩阵覆盖 GGML CUDA / Vulkan / Metal、直写 CUDA/cuBLAS、MLX,以及一条 100% 托管代码的纯 C# CPU 路径——零原生依赖,可单步调试、可审计。
项目最近的几个动作能说明它的定位:7 月 31 日让 284B 的 DeepSeek V4 Flash 在纯 .NET 上服务化(OpenAI 兼容接口 + continuous batching),8 月 19 日合入 GLM-5.2(744B)支持,在 3× RTX PRO 6000 上长上下文 prefill 反超 llama.cpp 最高 1.5 倍。
这次要聊的是 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 的接入。先给结论:GLM-5.3-Flash 在 decode 阶段跑出了 llama.cpp 的 2 倍速度,而且是在同机同权重、背靠背测出来的。
GLM-5.3-Flash:decode 2.0× llama.cpp
先澄清一个容易误读的点:GLM-5.3-Flash 不是旗舰 5.3 的蒸馏版,而是重新训练的基座——GLM-5 系列首个原生多模态模型,320B 总参、18B 激活的 MoE,AA 综合智能指数 57 分,定价为旗舰的 1/10。
架构换得很彻底:45 层主干中 34 层用 KDA 线性注意力,11 层用 NoPE MLA + 稀疏注意力(pool 化的 lightning indexer),残差是 ×4 流形约束超连接。落到工程上的直接收益是 KV 缓存较 GLM-5.3 降约 4.4 倍。
TensorSharp 的实现方式是复用:与 GLM-5.2 共用同一个原生执行器、同一个 GlmDsaModel,架构差异(288 路由专家、KDA/MLA 层混合、池化 indexer)在模型层被抽象掉。
性能数据是同机同权重背靠背测的:2× RTX PRO 6000 Blackwell(96 GB)、UD-Q2_K_XL(101 GiB)、层切分、两侧 n_ubatch 均为 2048:
- tg64 decode:73.5 tok/s vs llama.cpp 的 36.6 tok/s,2.0 倍。
- prefill 互有胜负:pp2048 2014 vs 2070,pp16384 1692 vs 1690,pp32768 1446 vs 1483。
prefill 持平、decode 翻倍,符合"KV 缓存大幅缩小"的理论预期——这组数字自洽,可信度比单点宣传高得多。
工程边界也写得清楚,这点我个人很看重:
--tp张量并行被干净地拒绝(该架构不切权重,请用层切分)。- NextN/MTP 投机解码尚未实现。
- 层切分、
--n-cpu-moe offload、per-sequence slot 并发均可用。 - 多模态通过 GLM-OCR ViT 的
mmproj-BF16.gguf接入,支持多图与多轮会话。
Qwen 3.8 Flash Next:一个 token,一张捕获图
Qwen3.8-Flash-Next 是 Qwen4 架构的先导预览:125B MoE(512 专家、激活约 6B)+ 51B N-gram 嵌入块,原生 262K 上下文。Gated DeltaNet 递归层与全注意力层交错(部分挂在 Qwen Sparse Attention 的 indexer 后面),外加 ×4 超连接残差流——对现有 GGUF 引擎来说,几乎处处都是非标件。
TensorSharp 的实现思路值得展开,因为它体现了这个项目的工程哲学:
融合到图级
嵌入、图内 PLE、全部 48 层、最终 mixer、LM head——整 token 前向组成(几乎)一张 CUDA graph,按形状键控缓存、逐 token 重放。TS_Q4E_TOKEN_GRAPH=0 可逐级回落到逐层融合 kernel、再到逐算子路径,用于调试和 A/B。
并发不做假
GDN 递归状态 + QSA indexer 缓存 + PLE 历史没有分页布局可言,所以走 per-sequence state holder:每个在途请求持有自己的全套状态,切换请求只是引用交换,不搬状态字节、不重建图。
多卡输出逐字节一致
--tp N 在该架构上实际是层切分(容量特性,不是速度特性)。2× A100-80GB 实测:73.4 GiB 拆成 24.2 + 26.2 GB,prefill 约 1520–1550 tok/s、decode 约 56 tok/s,单双卡贪心输出 SHA-256 相同。作为对照,llama.cpp 的 -sm row 直接拒绝加载这个架构,-sm layer 也只换来约 10% 的 prefill 提升。
为什么这对 .NET 团队重要
把这两次支持放在一起,我认为有三个信号值得 .NET 架构师注意。
第一,架构跟进速度
GLM-5.3-Flash(KDA+DSA+mHC)和 Qwen3.8-Flash-Next(GDN+QSA+门控残差)高度同构——前沿模型正在集体转向"线性+稀疏注意力混合"范式。TensorSharp 三天内接入两个新架构 id,说明它的模型层抽象经受住了范式切换的考验,而不是为每个模型打补丁。
第二,正确性验收标准
这个项目有个一以贯之的传统:
- 用记录下来的 token id 做前向对比,与同后端 llama.cpp 逐 token 对齐。
- 并发 slot 输出与单流温度 0 的结果逐字节一致。
- 批量 decode 会改变 GEMM 形状、进而在 2-bit 权重上放大路由分歧——所以默认关闭。
把"并发是否正确"变成可自动回归的精确断言,这是生产级软件的做法。
第三,部署形态
全程不需要 Python 环境、不需要 WSL、不需要容器套娃。--cpu-moe 可以把占 checkpoint 92% 的路由专家放在系统内存,让显存不足的机器也能跑(GLM-5.2 上 pp2048 从 915.9 掉到 94.7 tok/s,是"能跑"和"跑得快"的取舍,文档写得很诚实)。对金融、政企这类有合规审计要求的场景,整条链路可读的托管代码比 10% 的性能差距值钱。
旗舰 GLM-5.3 本体的权重仍在安全评估流程中。以 5.3-Flash 复用 GlmDsaModel 的先例看,落地那天的适配成本大概率接近零。
如果你的 .NET 团队正在评估本地推理方案,现在可以把 TensorSharp 放进 PoC 清单了。
参考资料(截至 2026-08-29):
- TensorSharp 仓库与架构卡片(glm.md / qwen38-flash-next.md):https://github.com/zhongkaifu/TensorSharp
- GLM-5.3-Flash 官方文档:https://docs.bigmodel.cn
- Qwen3.8-Flash-Next:https://github.com/QwenLM/Qwen3.8-Flash-Next
- 把 284B 的 DeepSeek V4 Flash 装进纯 .NET:https://www.cnblogs.com/shanyou/p/22138494