A method for distributed deployment and low-latency invocation of a large model for intelligent mobile carrier reasoning service and related apparatus

CN122420135APending Publication Date: 2026-07-17XI AN JIAOTONG UNIV

Patent Information

Authority / Receiving Office
CN · China
Patent Type
Applications(China)
Current Assignee / Owner
XI AN JIAOTONG UNIV
Filing Date
2026-04-27
Publication Date
2026-07-17

Smart Images

  • Figure CN122420135A_ABST
    Figure CN122420135A_ABST
Patent Text Reader

Abstract

本发明公开了一种面向智能移动载体推理服务的大模型分布式部署与低时延调用方法及相关装置,属于实验室大模型部署技术领域。包括将待部署的大模型以vLLM兼容的格式存储于本地服务器端;通过环境变量配置和命令行启动参数搭建并运行vLLM推理服务,并指定端口持续监听推理请求;在智能移动载体创建远程调用客户端并执行服务等待逻辑,确认连接完成后发送配置请求;构造包含用户查询指令的推理请求消息,以异步调用方式发送至vLLM推理服务,并同步等待接收返回的推理结果。本发明解决现有公网大模型API调用方式存在的网络延迟高以及无法适配自研专用模型的问题,能够显著降低推理响应时延,提升模型适配性和系统稳定性。
Need to check novelty before this filing date? Find Prior Art