AI Agent知识获取管道:RAG混合检索与重排实战指南
2026/9/29 18:59:28
LFM2.5-1.2B-Thinking是一款专为边缘设备优化的文本生成模型,基于LFM2架构升级而来。这个1.2B参数的模型在保持轻量级的同时,通过创新的训练方法实现了超越参数规模的性能表现。
核心优势:
在麒麟/UOS系统上部署前,请确保满足以下条件:
打开终端执行以下命令安装基础依赖:
# 麒麟系统 sudo yum install -y git cmake gcc-c++ python3-devel # UOS系统 sudo apt-get update sudo apt-get install -y git cmake g++ python3-dev通过以下命令一键安装Ollama:
curl -fsSL https://ollama.ai/install.sh | sh安装完成后验证版本:
ollama --version执行模型拉取命令:
ollama pull lfm2.5-thinking:1.2b下载完成后启动模型服务:
ollama serve针对麒麟/UOS系统的特殊配置:
export OLLAMA_MAX_MEMORY=2048export OLLAMA_NUM_THREADS=$(nproc)export OLLAMA_USE_COMPAT=1启动交互式会话:
ollama run lfm2.5-thinking:1.2b输入测试提示:
>>> 请用中文介绍一下国产操作系统的发展现状使用内置benchmark工具:
ollama benchmark lfm2.5-thinking:1.2b --prompt "测试" --length 128典型输出结果:
Tokens generated: 128 Time elapsed: 0.53s Tokens per second: 241.5 Memory usage: 872MB启动API服务:
ollama serve --api使用curl测试:
curl http://localhost:11434/api/generate -d '{ "model": "lfm2.5-thinking:1.2b", "prompt": "如何评价国产芯片的现状", "stream": false }'症状:进程被OOM Killer终止
解决方案:
ollama serve --max-memory 1536症状:非法指令错误
解决方案:
OLLAMA_USE_COMPAT=1 ollama servegit clone https://github.com/ollama/ollama cd ollama && make优化建议:
taskset -c 0-3 ollama serveollama pull lfm2.5-thinking:1.2b-q4LFM2.5-1.2B-Thinking模型在国产信创环境中的部署展示了出色的适应性。通过Ollama的标准化部署流程,我们实现了:
对于希望在企业环境中部署的开发者,建议:
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。