墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

如何构建你自己的本地AI智能体:工具调用与记忆功能

2026-07-07人工智能

好的,直接进入正题。今天这篇文章我会手把手带你用 LangChain v1、Ollama、Qwen 和 Python 搭建一个本地的 AI 智能体,它具备工具调用和短期记忆能力。所谓“智能体”,就是它能自己判断什么时候该调用工具,而且能记住对话上下文,方便你自然地问后续问题。所有代码和数据都在你自己的机器上跑,既保护隐私,也没有 API 费用。


背景:为什么需要本地智能体?

先聊聊为什么我们要折腾这个。本地的大语言模型(LLM)有一个硬伤:它们没法自己接触到外部世界。你问它“现在几点”,或者“这句话有多少个词”,它通常只能瞎猜,或者直接说“我不知道”。因为模型只有训练数据里的知识和你输入提示里的内容,它没有实时获取信息的能力。

第二个问题是:模型没有记忆。你发一条消息,它回复你;你再发一条,它就把刚才的对话忘得一干二净。每轮对话都是从零开始。Cloud 上的 Claude、ChatGPT 已经支持这些功能了,但本地模型默认没有。

这个教程就是来解决这两个问题的。我会构建一个本地 AI 智能体,它能:

  • 在需要的时候自己调用 Python 函数(工具调用)
  • 记住对话历史,让你能自然地问后续问题
  • 全程跑在本地,保护隐私,零 API 成本

你需要先安装好 Ollama。这个例子在 macOS、Windows、Linux 上都能跑。我用的是 MacBook Pro 32GB RAM,但如果你内存小,选一个小一点的 Qwen 模型就行。


什么是工具调用(Tool Calling)?

工具调用是一种模式:不是你在代码里预先调用函数,而是让 LLM 自己决定何时运行你的 Python 函数。

一个“工具”就是一个普通的 Python 函数,模型被允许去调用它。模型自己决定调用哪个工具、传什么参数。你只负责定义工具具体做什么。

底层原理是这样的:模型不直接执行代码,而是生成一个结构化的请求,告诉你的代码“调用这个工具,参数是这些”。你的代码执行函数,把结果返回给模型,模型再决定下一步:要么再调一个工具,要么直接给出最终答案。

不是所有模型都支持工具调用,而且支持的程度也参差不齐。Qwen 是一个在本地工具调用方面表现不错的开源模型,所以我这里选它。LangChain v1 的 create_agent 帮我们处理了工具调用的循环逻辑:你给它模型、工具列表、系统提示,它自动处理“模型请求 → 调用工具 → 返回结果 → 模型再决策”的循环,直到模型认为可以给出答案。


什么是 LLM 的“记忆”?

LLM 本质上是无状态的。每次调用你都要把完整的对话历史当成输入传给模型,模型只根据输入里的内容来回复。所谓“记忆”,其实就是你选择在下次调用时把哪些内容重新发给模型。

实际中有两种记忆:

  • 短期记忆:当前会话的对话历史。把它在下次调用时重新发回去,就能让多轮对话感觉连贯。会话结束,记忆就没了。
  • 长期记忆:跨会话保留的事实和过往交流。存在数据库或向量存储里,需要时加载出来。

本教程我们只用短期记忆,这是最简单的实用形式,也是让智能体能进行真正对话的关键。LangChain v1 通过 checkpointer 支持短期记忆。checkpointer 是一个状态对象,用线程 ID(thread ID)来标识不同会话,在每次 invoke() 调用之间存储对话历史。我们直接用内置的 InMemorySaver。


动机与架构

这个项目的动机很简单:让本地 LLM 更接近 Claude/ChatGPT 那样的体验。通过给本地模型添加工具调用和记忆能力,大大扩展了它的实用性。

架构是这样的:

  • Ollama:运行本地 Qwen 模型
  • LangChain v1:把一切粘合起来
  • InMemorySaver:提供短期记忆的 checkpointer

工作流程:

  1. 用户发送消息
  2. checkpointer 根据当前线程 ID 加载之前的对话历史,并把它前置到输入中
  3. 模型要么直接生成答案,要么发出工具调用请求
  4. 工具调用走标准的“调用 → 返回 → 再决策”循环
  5. 当本轮对话结束时,checkpointer 把新消息保存回线程,下一轮就有完整上下文了

步骤 1:安装 Ollama 并拉取模型

先安装 Ollama:去 ollama.com 下载对应平台的安装包。

然后拉取模型。我推荐用 qwen3.5:4b,它原生支持工具调用。如果你内存小,可以用 qwen3.5:0.8b 代替。

ollama pull qwen3.5:4b

步骤 2:安装 Python 依赖

创建一个虚拟环境,然后安装依赖:

python3 -m venv venv
source venv/bin/activate  # Windows 上用 venv\Scripts\activate
pip install langchain langchain-core langchain-ollama langgraph

注意:本教程需要 langchain>=1.0.0。


步骤 3:编写智能体代码

代码分成三部分:

  1. 配置:定义模型和系统提示
  2. 工具:用 @tool 装饰器定义两个工具函数
  3. 主循环:构建智能体,连接 checkpointer,运行交互循环

工具函数详解

current_time() 返回当前本地日期和时间。word_count(text) 返回一段文本的单词数。注意:每个工具的 docstring 就是模型决定是否调用它的依据,所以措辞很重要。模型会读这些 docstring 来理解工具的功能。

完整代码

把下面的代码保存为 agent.py:

from datetime import datetime
from langchain.agents import create_agent
from langchain_core.tools import tool
from langchain_ollama import ChatOllama
from langgraph.checkpoint.memory import InMemorySaver

CHAT_MODEL = "qwen3.5:4b"  # Ollama 聊天模型,必须支持工具调用

SYSTEM_PROMPT = (
    "你是一个有用的助手,可以获取当前时间和统计文本中的单词数。"
    "当用户请求需要工具时,请使用工具。"
    "如果问题不需要工具,直接回答。"
    "如果工具返回错误,请清晰地解释错误。"
)

# ----- 工具定义 -----
@tool
def current_time() -> str:
    """返回当前本地日期和时间。当用户询问当前时间或日期时使用。"""
    return datetime.now().strftime("%Y-%m-%d %H:%M:%S")

@tool
def word_count(text: str) -> int:
    """统计一段文本中的单词数量。当用户询问一段文字的长度,或让你统计他们分享的内容中的单词数时使用。返回单词数(整数)。"""
    return len(text.split())

TOOLS = [current_time, word_count]

# ----- 智能体构建 -----
def build_agent():
    model = ChatOllama(model=CHAT_MODEL, temperature=0)
    # InMemorySaver 在内存中保存对话历史,通过线程 ID 标识。
    # 进程退出后,历史就没了——这就是短期记忆。
    checkpointer = InMemorySaver()
    return create_agent(
        model=model,
        tools=TOOLS,
        system_prompt=SYSTEM_PROMPT,
        checkpointer=checkpointer,
    )

def main():
    agent = build_agent()
    # 线程 ID 告诉 checkpointer 加载和保存哪个对话
    config = {"configurable": {"thread_id": "thread"}}
    print("准备好了!问智能体一些问题吧。它能记住对话内容。\n")
    
    # 记录上一轮结束时已有的消息数量,这样我们只取本轮新增的消息
    prev_message_count = 0
    
    while True:
        question = input("你: ").strip()
        if not question or question.lower() == "exit":
            break
        
        result = agent.invoke(
            {"messages": [{"role": "user", "content": question}]},
            config=config,
        )
        
        # 只取本轮新增的消息(工具调用和最终答案),而不是全部历史
        new_messages = result["messages"][prev_message_count:]
        prev_message_count = len(result["messages"])
        
        # 打印智能体的回复
        for msg in new_messages:
            if msg.type == "ai":
                print(f"智能体: {msg.content}")
            elif msg.type == "tool":
                print(f"   [工具 {msg.name} 返回: {msg.content}]")

步骤 4:运行智能体

在终端里运行:

python agent.py

然后就可以开始对话了。试试这些:

你: 现在几点了?
你: 帮我统计一下 "Hello world this is a test" 有多少个词。
你: 刚才那两句话里,第一句问了什么?

你会看到模型自动调用工具,而且能记住之前聊过的内容。


关于长期记忆的思考

这个例子只用了短期记忆,会话结束就没了。如果想实现长期记忆,你可以用 SqliteSaver 或 PostgresSaver 替代 InMemorySaver,把历史持久化到数据库。更进一步,你还可以做一个“记忆总结”机制:每几轮对话后,让模型把关键信息总结成几句话,存到向量数据库里,下次对话时根据用户问题检索相关记忆,加载到提示中。这就是一篇新文章的内容了。


总结

我们做成了几件事:

  1. 工具调用:模型能自己判断什么时候调用 current_time() 和 word_count(),而不是我们硬编码调用逻辑
  2. 短期记忆:通过 LangChain 的 checkpointer,模型能记住之前聊了什么,后续问题可以自然衔接
  3. 完全本地运行:所有代码和数据都在你自己的机器上,零 API 费用,隐私有保障

你可以在这个基础上扩展:加更多工具(比如搜索、计算器、文件读写),换更好的模型(比如 Qwen 的更大版本),或者实现长期记忆。本地智能体的潜力很大,这只是个开始。

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭