
本文介绍如何通过提示工程与函数调用机制,使本地部署的llm(如ollama运行的模型)理解用户指令、结构化提取意图,并自动触发智能家居api,无需微调即可实现“说即执行”的交互体验。
本文介绍如何通过提示工程与函数调用机制,使本地部署的llm(如ollama运行的模型)理解用户指令、结构化提取意图,并自动触发智能家居api,无需微调即可实现“说即执行”的交互体验。
在构建具备行动能力的智能家庭聊天机器人时,核心挑战并非训练模型“学会开关灯”,而是建立一套可靠、可解释、可扩展的指令解析与执行管道。幸运的是,现代大语言模型(尤其是经过指令微调的开源模型,如Phi-3、Llama 3 或 Qwen2)已具备出色的结构化输出能力,配合恰当的提示设计与轻量级编排逻辑,即可高效完成意图识别与动作调度——完全无需全参数微调或重训练。
✅ 推荐方案:提示驱动 + JSON Schema 输出 + 后端执行
最简洁且生产就绪的方式是采用确定性提示模板 + JSON格式约束输出,引导模型将自然语言指令转化为机器可解析的动作指令。例如:
请严格按以下JSON格式响应,仅输出JSON,不加任何额外说明或标记:
{
"action": "操作类型(如 'light-on', 'light-off', 'thermostat-set')",
"device": "设备标识符(如 'living-room-light', 'bedroom-ac')",
"params": { "temperature": 26 } // 可选,用于带参数的操作
}
示例输入:把客厅的灯打开
示例输出:{"action": "light-on", "device": "living-room-light"}
现在处理以下指令:
Human:关掉厨房的排气扇
Response:当模型返回类似 {"action": "fan-off", "device": "kitchen-fan"} 的响应后,你的服务端只需做三件事:
- JSON解析校验(建议用 Pydantic 模型确保字段存在且类型合法);
- 映射到真实API调用(如 call_device_api(device="kitchen-fan", action="off"));
- 合成自然语言回复(如 "已关闭厨房排气扇"),再返回给用户。
? 提示技巧:在 Ollama 中,可通过 --format json 参数强制启用 JSON 模式(部分模型支持),或在系统提示中强调“只输出有效JSON,无任何包裹文本”。
? 集成建议:LangChain + Pydantic(轻量级推荐)
若需更高鲁棒性与可维护性,可引入 LangChain 的 StructuredOutputParser 或原生 JsonOutputParser,配合 Pydantic 模型定义动作协议:
from pydantic import BaseModel
from langchain.output_parsers import JsonOutputParser
from langchain.prompts import PromptTemplate
class DeviceAction(BaseModel):
action: str
device: str
params: dict = {}
parser = JsonOutputParser(pydantic_object=DeviceAction)
prompt = PromptTemplate(
template="你是一个智能家居控制助手。\n{format_instructions}\n用户说:{input}",
input_variables=["input"],
partial_variables={"format_instructions": parser.get_format_instructions()}
)
# 使用 Ollama LLM(如 llama3:8b)
llm = Ollama(model="llama3", format="json")
chain = prompt | llm | parser
result = chain.invoke({"input": "把主卧空调调到27度"})
# → {'action': 'thermostat-set', 'device': 'master-bedroom-ac', 'params': {'temperature': 27}}⚠️ 关键注意事项
- 绝不信任原始LLM输出:必须始终进行 JSON schema 校验、设备白名单检查、权限鉴权及超时熔断,防止恶意指令注入或误触发。
- 优先使用函数调用(Function Calling)范式:OpenAI 的 Function Calling 文档虽面向其API,但其设计理念(工具描述 + 模型自主选择调用)已被 LiteLLM、Ollama(via llama.cpp 工具调用插件)等广泛借鉴,值得深入学习。
- 本地模型选型建议:在 Ollama 中,优先选用明确支持工具调用/JSON模式的模型,如 phi3:mini, qwen2:7b, 或 llama3:8b-instruct-q8_0;避免使用纯基础权重模型。
- 用户体验优化:执行动作后,应同步返回确认语句(如“正在开启客厅灯光…”),并在后台异步完成硬件操作,避免用户等待。
综上,让LLM“执行动作”的本质,是将其作为高阶意图解析器,而非代码执行引擎。通过清晰的接口契约(JSON Schema)、严谨的后端调度和最小化提示工程,你可以在数小时内搭建出稳定、可审计、易扩展的智能家庭对话控制系统。

















