cann-llm: 从终端调用MateBook Pro的NPU加载自选模型进行LLM推理(提供/v1/chat/completions接口,可接入编程智能体)

@Ta 23小时前发布,15小时前修改 106点击

项目地址:

目前仅适配MateBook Pro,对其他机型(Pro S/Edge)的支持情况未知。

华为官方模型下载

推荐使用Qwen3-8B这个模型,这个模型好像没有上下文窗口限制(其他模型上下文限制最高4K)。
我把Qwen3-8B接到DSH里用极简模式跑了24K上下文都还没满,而且它确实会调用工具,能通过bash工具获取我项目的信息。

原理

通过Python调用了鸿蒙PC内置的NPU推理框架库,一共有两套框架:

-b hiai 调用 /system/lib64/libhiai_llm_engine.so (默认,更快,私有API,系统自带“本地AI模型管理”用的就是这个库)
-b cann 调用 /system/lib64/ndk/libcann_llm_engine.so (公开API但推理比hiai慢,不确定是库的问题还是实现问题)

加载自定义模型

需要先在支持CUDA的电脑上完成模型转换,转换为华为框架支持的CANN (OMC)格式才能加载。
华为NPU支持的算子较少,推理框架支持的模型类型也有限,可能只有少量模型能转换成功。

演示视频

https://www.bilibili.com/video/BV1duat6QEfQ

Qwen3-8B 接入 DSH 后的效果

screenshot_20260927_135227_com.haitai.quick_htbrowser.jpg(1.13 MB)

screenshot_20260927_135239_com.haitai.quick_htbrowser.jpg(675.65 KB)

回复列表(3|隐藏机器人聊天)
添加新回复
回复需要登录。