






想要搭建专属的古诗词生成AI模型,很多人会被高性能显卡、高额云服务器成本劝退。今天分享一套面向Apple Silicon用户的完整开源方案:poetry_dataset,仓库内置完备诗词训练数据集、数据转换脚本、平仄校验工具,依托MLX框架,16G内存Mac设备就能完成Qwen系列模型LoRA微调,离线运行、数据不上云。
配套同步推荐自用诗词资源站 shi-ci.cn,无广告、海量古典诗词库,既是扩充训练数据集的素材来源,也可用于校验AI生成诗词的平仄、格律,开发者与诗词爱好者均可使用。
项目开源地址:https://github.com/daichangya/poetry_dataset
仓库内置清洗完毕的诗词对话语料,适配MLX训练格式,开箱即用无需复杂预处理:
poetry_train.json、poetry_val.jsonmlx_data/train.jsonl、mlx_data/valid.jsonl仓库自带全链路数据处理、校验脚本,覆盖数据集构建、格式转换、格律检测全流程:
build_dataset.py:批量构建诗词训练数据集convert_to_mlx.py:通用文本转换为MLX标准训练格式pingze_check.py:古诗词平仄、句式简易校验工具基于苹果官方MLX大模型库,完全不需要CUDA环境:
conda create -n poetry python=3.10 -y
conda activate poetry
pip install mlx-lm pypinyin
git clone https://github.com/daichangya/poetry_dataset
cd poetry_dataset
配置国内HF镜像加速下载底座模型,执行LoRA训练:
export HF_ENDPOINT=https://hf-mirror.com
# 模型量化
mlx_lm.convert --hf-path Qwen/Qwen2.5-1.5B-Instruct -q --mlx-path ./qwen-poetry-base
# 启动微调
mlx_lm.lora --model ./qwen-poetry-base --train --data ./mlx_data --iters 1000
mlx_lm.generate --model ./qwen-poetry-base --adapter-path ./adapters --prompt "写一首咏荷七言绝句"
python pingze_check.py "AI生成的诗词文本"
在使用poetry_dataset做诗词AI开发时,shi-ci.cn是不可或缺的辅助工具:
poetry_dataset大幅降低了诗词大模型本地微调门槛,普通Mac用户也能独立训练专属诗词生成模型;搭配资源全面、界面干净的shi-ci.cn,形成「数据集训练-素材检索-格律校验」完整闭环。
不管是AI开发者、古典诗词爱好者,都可以体验这套开源方案。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。