Files
llama-cmd-gen/README.md
T

106 lines
3.3 KiB
Markdown
Raw Normal View History

2026-07-19 18:50:43 +08:00
# 🦙 llama.cpp 命令生成器
> 一个用于生成 llama.cpp 执行命令的 Web 工具,支持参数可视化配置、自然语言生成、实时显存估算。
## ✨ 功能特性
### 命令生成
- **多版本支持**:内置 b6310 和 b10068 两个版本的参数定义,可按版本精准匹配参数
- **GPU 模式 / GPU+CPU 模式**:默认 GPU 模式,可切换混合模式查看系统内存占用
- **多 GPU**:最多支持 4 张显卡,每张可选不同型号,自动计算总显存
- **智能输出**:仅输出非默认值的参数,生成干净可用的命令
### 自然语言生成
输入自然语言描述,自动解析为参数配置:
```
用RTX 4090跑70B模型, 上下文8192, 温度0.7, flash attention
```
支持中文和英文关键词,涵盖 GPU 型号、数量、上下文、温度、Top-K/P、线程数、端口等。
### 实时显存估算
- 选择模型和 GPU 后实时计算显存占用
- 分项显示:模型权重 / KV缓存 / 计算开销 / CUDA开销
- 进度条颜色预警:绿(正常) → 黄(警告) → 红(超限)
- GPU+CPU 模式额外显示 CPU 侧权重和 KV 缓存占用
### 参数管理
- 参数按分类标签页组织:通用 / 采样 / 服务器 / 模型来源 / LoRA / 日志 / 高级
- 重要参数直接显示,次要参数点击展开
- 影响显存的参数标记 ⚡ 标识
- 支持参数搜索(按键名、标志、描述)
### 模型选择
- 内置 26 个常见模型预设(Llama 3/3.1、Qwen2.5、DeepSeek V2/R1、Mistral、Gemma2、Phi-3、GLM-4 等)
- 支持搜索过滤
- 后台可增删改
### 后台管理
- **GPU 管理**:增删改查显卡型号、显存、计算能力
- **版本管理**:增删改查 llama.cpp 版本
- **参数管理**:按版本增删改查参数定义
- **模型管理**:增删改查模型预设
- **系统设置**:修改管理密码等配置
## 🚀 部署
### 环境要求
- Python 3.8+
- Flask
- flask-cors
### 安装
```bash
cd llama-cmd-gen
pip install flask flask-cors
```
### 启动
```bash
python3 app.py
# 或
./start.sh
```
服务默认监听 `0.0.0.0:16052`
### 访问
- **主界面**`http://<host>:16052/`
- **后台管理**`http://<host>:16052/admin`(需密码登录,默认 `admin123`
## 📁 项目结构
```
llama-cmd-gen/
├── app.py # Flask 主应用 + API
├── db.py # 数据库初始化 + 默认数据
├── data.db # SQLite 数据库(运行时生成)
├── start.sh # 启动脚本
├── requirements.txt # Python 依赖
├── logs/
│ └── app.log # 运行日志
└── static/
├── index.html # 主界面
├── admin.html # 后台管理界面
├── css/
│ └── style.css # 样式
└── js/
├── main.js # 主界面逻辑
└── admin.js # 后台逻辑
```
## 🛠️ 技术栈
- **后端**Python / Flask / SQLite
- **前端**:原生 HTML / CSS / JavaScript(无框架依赖)
- **数据**SQLite 本地存储,包含 GPU、版本、参数、模型等表
## 📝 版本历史
- **v1.1.0** — 修复输入焦点丢失、加参数搜索、模型选择器、后台密码登录、复制兼容性
- **v1.0.0** — 初始版本:命令生成、自然语言解析、显存估算、多 GPU、后台管理
## 📄 License
MIT