惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 三生石上(FineUI控件)
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
月光博客
月光博客
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
S
SegmentFault 最新的问题
博客园_首页
雷峰网
雷峰网
量子位
有赞技术团队
有赞技术团队
博客园 - 叶小钗
博客园 - 聂微东
V
V2EX
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 司徒正美
小众软件
小众软件
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
人人都是产品经理
人人都是产品经理

博客园 - jiftle

GGUF ggml通用文件 格式详解 llama.cpp 启用 Vulkan 后端:编译与测试工作记录 华为镜像站 JDK下载 opencode系统提示词加载机制 Qoder CN版本v1.4.2 (2026-06-27) 提供套餐余量查看 清理宝塔面板 桌面 AI 应用技术栈深度对比:腾讯元宝 vs WorkBuddy 【转载】编辑器之神与神的编辑器:Vim 与 Emacs 的传奇 OpenCode 源码解读报告 linux双网卡默认路由问题 通过4种方法来重置 UOS 操作系统中的用户密码 统信服务器系统【重置登录密码】解决方案 vscode插件Git Graph 怎么只提交单个文件 opencode 配置本地ollama模型编程 opencode编程工具 【转载】从源码看 Qwen Code 的设计思路 Qwen Code 代码分析 模型性能评测 职场真相:不是赏饭吃,是价值交换 vim插件AI结对编程辅助编程插件 千问网页版生成的代码不支持语法高亮 linux检查显存大小(集成显卡) golang测试模型的token输出速度 Go 实现本地 Ollama 模型基准测试工具 使用golang编写大语言模型的输出速度性能 ollama v0.18.2手工部署安装,linux, deepin 20.9 树莓派pico使用无源蜂鸣器播放小星星 树莓派pico播放玛丽有只小羊羔 树莓派pico蜂鸣器播放音乐 树莓派 pico W(创客版)RP2020 W代码示例温度检测+液晶显示屏+HTTP服务器页面控制灯光
ollama模型导出
jiftle · 2026-04-15 · via 博客园 - jiftle

Ollama 本地模型可通过 ollama export 命令导出为 .gguf 格式文件,该文件支持跨设备离线部署。 以下是具体操作步骤和注意事项:

一、导出模型

  1. 确认模型已安装
    使用以下命令查看已安装的模型列表:

    ollama list
    
  2. 执行导出命令
    使用 ollama export 命令将模型导出为 .gguf 格式文件。例如,导出名为 llama2 的模型:

    ollama export llama2 /path/to/export/directory
    
    • /path/to/export/directory 为导出目录路径,需替换为实际路径。
    • 导出后的文件名为 llama2.gguf(或类似名称,具体取决于模型版本)。
  3. 验证导出文件
    检查导出目录是否生成 .gguf 文件,并确认文件大小合理(避免因导出中断导致文件损坏)。

二、离线部署准备

  1. 目标设备环境要求

    • Ollama 运行环境:目标设备需安装与导出环境相同版本的 Ollama。
    • 依赖库:确保目标设备已安装所有必要的依赖库(如 CUDA、cuDNN 等,若使用 GPU 加速)。
    • 操作系统兼容性:目标设备的操作系统和架构(如 AMD64、ARM)需与导出环境一致。
  2. 传输导出文件

    • 将导出的 .gguf 文件通过 U 盘、网络共享或 SCP 命令传输至目标设备。
    • 示例(使用 SCP 命令):
      scp /path/to/llama2.gguf user@remote_host:/path/to/destination
      

三、目标设备导入与运行

  1. 导入模型(可选)

    • 若需通过 ollama run 直接加载模型,无需额外导入步骤,直接使用 .gguf 文件路径即可。
    • 若需通过 Modelfile 导入(如修改模型配置),可参考以下步骤:
      1. 创建 Modelfile 文件,内容示例:
        FROM /path/to/llama2.gguf
        TEMPLATE """{{ .Prompt }}"""
        PARAMETER stop ["<|endoftext|>"]
        
      2. 使用以下命令创建模型:
        ollama create my_llama2 -f /path/to/Modelfile
        
  2. 运行模型

    • 直接加载 .gguf 文件:
      ollama run --model /path/to/llama2.gguf
      
    • 若通过 Modelfile 导入,则运行:
      ollama run my_llama2
      

四、注意事项

  1. 文件完整性

    • 导出前确保模型完整下载,避免因网络中断导致文件损坏。
    • 传输过程中使用校验和(如 sha256sum)验证文件完整性。
  2. 性能优化

    • 若模型较大,建议使用压缩工具(如 tar)减少传输成本。
    • 在目标设备上,可通过调整批次大小(batch_size)和线程数(n_threads)优化推理性能。
  3. 兼容性

    • 确保目标设备的 Ollama 版本与导出环境一致,避免因版本差异导致兼容性问题。
    • 若需跨平台部署(如从 Linux 迁移到 Windows),需确认 .gguf 文件格式兼容性(通常无问题,但需测试验证)。
  4. 安全

    • 导出模型文件可能包含敏感数据,传输时建议使用加密通道(如 SCP、HTTPS)。
    • 在目标设备上,限制模型文件的访问权限,避免未授权访问。