llama.cpp Spark-X2.5 Windows CUDA build
=======================================

这是 llama.cpp fork (XHToken/llama.cpp) 的 Windows x64 CUDA 预编译版,
增加了对 iFlytek Spark-X2.5 (spark2_5 架构) 的推理支持。

源码仓库: https://github.com/XHToken/llama.cpp
基于上游: https://github.com/ggml-org/llama.cpp
许可证: MIT (见 LICENSE 文件)

系统要求
--------
- 64 位 Windows 10/11
- NVIDIA 显卡, RTX 20 系或更新 (支持 sm_75 / sm_80 / sm_86 / sm_89 / sm_120)
- 显卡驱动建议更新到较新版本
- AMD / Intel / 核显用户无法使用本 CUDA 版本

文件说明
--------
- llama-server.exe  启动 OpenAI 兼容的本地 API 服务 (推荐新手使用)
- llama-cli.exe     命令行对话
- llama-bench.exe   性能测试
- llama-quantize.exe 模型量化
- 其余 .dll 为运行必需的库文件, 必须和 exe 放在同一目录

使用方法
--------
1. 下载模型: 到 https://huggingface.co/XHToken 下载 Spark-X2.5 模型的
   GGUF 文件 (如果只有原始权重, 可用源码仓库中的转换脚本自行转换)。

2. 启动 Web 服务 (会在浏览器打开一个聊天界面):

   llama-server.exe -m 路径\Spark-X2.5-1.7B.gguf

   默认监听 http://127.0.0.1:8080

3. 或用命令行直接对话:

   llama-cli.exe -m 路径\Spark-X2.5-1.7B.gguf -p "你好"

更多参数说明请参考上游文档: https://github.com/ggml-org/llama.cpp

注意事项
--------
- 请自行确认所下载模型权重的许可条款, 本包不含任何模型权重。
- 本构建由第三方编译, 未被 llama.cpp 上游合并, 问题请优先到源码仓库反馈。
