墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Hy3:腾讯混元295B参数推理与智能体模型,以极致性价比重塑大模型落地

2026-07-08人工智能

Hy3(295B A21B)是腾讯混元推出的一款高性价比推理与智能体模型,在同等参数规模下展现出领先的推理能力和智能体任务表现,旨在以更低成本实现更优效果。

一、项目背景与痛点分析

当前大模型领域正经历从“参数竞赛”到“效率竞赛”的转变。一方面,超过万亿参数的巨型模型虽然在复杂推理任务上表现优异,但其训练和推理成本极高,普通企业和开发者难以承受;另一方面,小参数模型虽然部署灵活,但在逻辑推理、多步规划、工具调用等智能体任务上往往力不从心。

Hy3 的定位正是填补这一空白——它拥有 295B 的总参数,但通过A21B(Activate 21 Billion) 的混合专家架构(MoE),实际推理时仅激活约 210 亿参数,在保持高性能的同时,大幅降低了计算开销和部署门槛。

二、核心亮点与技术解析

1. 混合专家架构(MoE)的精巧设计

Hy3 采用了 MoE 架构,总参数量 295B,但每次推理仅激活 21B 参数。这意味着:

  • 推理速度更快:激活参数少,计算量小,延迟低。
  • 显存占用更友好:单次推理需要的显存远低于同规模 Dense 模型。
  • 训练效率更高:MoE 的稀疏激活设计使得在相同 FLOPs 下可以容纳更多专家,提升模型容量。

2. 推理与智能体双强能力

根据官方报告,Hy3 在多个推理基准(如 GSM8K、MATH、HumanEval)和智能体任务(如 ToolBench、WebShop)上,均超越了同参数规模的 Llama-3-70B、Qwen-2.5-72B 等开源模型,甚至在某些任务上逼近了 GPT-4 的水平。

3. 极致成本效率

这是 Hy3 最核心的卖点。相比于同等推理能力的千亿级模型,Hy3 的推理成本可降低 5-10 倍。对于需要大规模部署 AI 应用的团队,这意味着可以用同样的预算服务更多用户,或提供更复杂的推理链。

三、安装与使用

环境要求

  • Python 3.8+
  • PyTorch 2.0+
  • CUDA 11.7+(推荐 12.1)
  • 建议显存:单次推理至少 40GB(A100-40G 或同等),推荐 80GB 以获得更大 batch size。

安装步骤

bash

1. 克隆仓库

git clone https://github.com/Tencent-Hunyuan/Hy3.git
cd Hy3

2. 创建虚拟环境(推荐)

python -m venv hy3_env
source hy3_env/bin/activate # Linux/Mac

或 hy3_env\Scripts\activate # Windows

3. 安装依赖

pip install -r requirements.txt

4. 下载模型权重(需申请权限,具体见仓库说明)

模型文件较大,建议使用 huggingface_hub 或官方提供的下载脚本

快速推理示例

python
from hy3 import Hy3ForCausalLM, Hy3Tokenizer

加载模型(以半精度为例)

model = Hy3ForCausalLM.from_pretrained(
"Tencent-Hunyuan/Hy3-295B",
torch_dtype=torch.bfloat16,
device_map="auto"
)
tokenizer = Hy3Tokenizer.from_pretrained("Tencent-Hunyuan/Hy3-295B")

推理示例:数学问题

prompt = "问题:小明有 5 个苹果,小红有 3 个苹果,他们一共有几个苹果?"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(
inputs.input_ids,
max_new_tokens=128,
temperature=0.7,
top_p=0.9
)
response = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(response)

智能体调用示例

Hy3 原生支持工具调用格式,可以轻松集成到 LangChain 或自定义 Agent 框架中:

python

定义工具函数(示例:计算器)

def calculator(expression: str) -> str:
try:
result = eval(expression)
return str(result)
except Exception as e:
return f"错误: {e}"

构建包含工具描述的系统提示

system_prompt = """你是一个智能助手,可以使用以下工具:

  • calculator:输入数学表达式,返回计算结果。
    请根据用户问题调用合适的工具。
    """

user_query = "计算 (23 + 45) * 2 的结果"
full_prompt = f"{system_prompt}\n用户:{user_query}\n助手:"

inputs = tokenizer(full_prompt, return_tensors="pt").to(model.device)
outputs = model.generate(
inputs.input_ids,
max_new_tokens=256,
temperature=0.3
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

四、同类项目对比

模型 参数规模 激活参数 推理能力 智能体能力 推理成本(相对) 开源程度
Hy3 (295B) 295B 21B ★★★★★ ★★★★★ 低 部分开源
Llama-3-70B 70B 70B ★★★★ ★★★★ 中 完全开源
Qwen-2.5-72B 72B 72B ★★★★ ★★★★ 中 完全开源
Mixtral 8x22B 141B 39B ★★★★ ★★★ 中低 完全开源
GPT-4 未公开 未公开 ★★★★★ ★★★★★ 高 闭源

关键差异:

  • 相比 Llama-3-70B 和 Qwen-2.5-72B:Hy3 在推理和智能体任务上领先,且推理成本更低。
  • 相比 Mixtral 8x22B:Hy3 的激活参数更少(21B vs 39B),但总参数更大,专家更丰富,性能更强。
  • 相比 GPT-4:Hy3 在部分任务上接近,但完全开源可控,且成本低得多。

五、适用场景

  1. 复杂推理应用:数学解题、代码生成、逻辑分析、科学计算等需要多步推理的场景。
  2. 智能体系统:需要模型调用外部工具、进行多轮对话、执行任务规划的 Agent 应用。
  3. 企业级部署:对成本敏感但要求高性能的企业,如客服系统、文档分析、自动化办公。
  4. 科研与教育:用于研究 MoE 架构、推理机制或作为教学案例。

六、局限性说明

  • 模型权重需要申请,并非完全开放下载。
  • 部署仍需较高硬件(至少 40GB 显存),不适合个人开发者单机玩耍。
  • 社区生态尚在建设,第三方工具集成不如 Llama 系列成熟。

七、总结评价

Hy3 是腾讯混元在“效率优先”理念下交出的一份亮眼答卷。它用 21B 的激活参数实现了超越 70B Dense 模型的性能,同时将推理成本控制在一个极具竞争力的水平。对于需要高性能推理和智能体能力的企业级用户,Hy3 是一个值得重点关注的选项。

项目链接:https://github.com/Tencent-Hunyuan/Hy3

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭