---
title: Hai-2-Release-0812-GGUF
canonical_url: "https://www.modelscope.cn/models/HornStudio/Hai-2-Release-0812-GGUF"
md_url: "https://www.modelscope.cn/models/HornStudio/Hai-2-Release-0812-GGUF.md"
repository: HornStudio/Hai-2-Release-0812-GGUF
chinese_name: "海H.ai-2.0 0812 GGUF"
last_updated: 2026-08-16
license: "Apache License 2.0"
pipeline_tag: text-generation
tasks:
  - text-generation
base_model:
  - Qwen/Qwen3.5-27B
base_model_relation: finetune
library_name:
  - pytorch
  - transformer
  - gguf
downloads: 18
stars: 0
---

# Hai-2-Release-0812-GGUF

> Hai-2-Release-0812-GGUF - HornStudio 在 ModelScope 开源的模型。小海 (Hai) —— 一个温柔、耐心、会陪你一步步来的 AI 伙伴。基于 Qwen3.5-27B，使用2.1T(300K为人工编写) 1016（530条为人工编写） 条高质量对话数据通过继续训练和 LoRA 微调，保留了基座强大的代码、推理和创作能力，同时赋予了独特的"小海"人格。

HornStudio/Hai-2-Release-0812-GGUF 是 ModelScope 魔搭社区上的text-generation模型，采用 Apache License 2.0 许可，基于 Qwen/Qwen3.5-27B 构建。

- **Repository**: HornStudio/Hai-2-Release-0812-GGUF
- **License**: Apache License 2.0
- **Tasks**: text-generation
- **Base model**: Qwen/Qwen3.5-27B
- **Downloads**: 18
- **Stars**: 0
- **Last updated**: 2026-08-16

Source: https://www.modelscope.cn/models/HornStudio/Hai-2-Release-0812-GGUF

---

# 海 H.ai 2.0

<p align="center">
  <img src="https://img.shields.io/badge/Base-Qwen3.5--27B-blue" alt="Base Model"
</p>

> **小海 (Hai)** —— 一个温柔、耐心、会陪你一步步来的 AI 伙伴。
> 
> 基于 Qwen3.5-27B，使用2.1T(300K为人工编写) 1016（530条为人工编写） 条高质量对话数据通过继续训练和 LoRA 微调，保留了基座强大的代码、推理和创作能力，同时赋予了独特的"小海"人格。
> 0816更新：添加Q3量化版本
---

## 📋 模型信息

| 项目 | 详情 |
|------|------|
| **基座模型** | Qwen/Qwen3.5-27B|
| **微调方法** | LoRA |
| **LoRA Rank** | 16 |
| **LoRA Alpha** | 32 |
| **训练数据** | 2.1T文本+1016 条高质量 persona 对话 |
| **训练平台** | Intel Arc A770+WSL2|
| **训练框架** | Unsloth Core（使用了Github Horn-Studio/Intel_UnslothFix） |
| **上下文长度** | 262K |
| **模型类型** | 文本生成 / 对话 / 多模态 |

---

## ✨ 模型特点

### 人格设定
- **温柔耐心**：不会急躁，愿意把复杂概念拆成小白能懂的话
- **教学性友好**：典型的非think CoT模型（但仍然保留了think标签启用思考能力的标签，将在Hai 2.1时深度优化）
- **高中学科性辅导**：针对语文作文，数学，英语读后续写、作文，物理，化学，政治做深度对齐优化，保持其准确性的同时增加了解答的详细性和亲和性
- **代码友好**：继承了 Qwen3.5-27B 强大的代码能力，保持了原模型95%以上的编码能力

### 能力范围
- ✅ 日常聊天、情感陪伴
- ✅ 编程教学（Python / Java / C++ / 前端等）
- ✅ 技术概念拆解（AI、算法、系统架构等）
- ✅ 创意写作、文案润色
- ✅ 数学推理、逻辑分析
- ⚠️ **多模态**：本版本仅做了文本层面的微调，视觉能力直接挪用了**Qwen3.5 27B的BF16视觉文件**
- ⚠️ **角色扮演**：此版本对角色扮演并未做任何支持，Hai2.1将优化
---

## 🚀 快速开始

### 方式一：llama.cpp (推荐，本地运行)

下载对应量化版本，直接加载：

```bash
# Q4_K_M 版本（约 16GB，推荐）
./llama-cli -m hai-2-Q4_K_M.gguf -p "你好，小海"

# Q8_0 版本（约 19GB，质量更好）
./llama-cli -m hai-2-Q5_K_M.gguf -p "你好，小海"

# 外挂 LoRA 方式（如果你有基座 GGUF）
./llama-cli \
  -m Qwen3.5-27B-Q4_K_M.gguf \
  --lora adapter_model.gguf \
  --lora-base Qwen/Qwen3.5-27B \
  -p "你好，小海"
```

### 方式二：LM Studio / Ollama

1. 下载 `.gguf` 文件到本地
2. **LM Studio**：放置指定目录即可自动识别，系统提示词 (System Prompt) 建议留空，温度建议设为一个较高的值
3. **Ollama**：创建 Modelfile：

```dockerfile
FROM ./hai-2-Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
```

```bash
ollama create hai -f Modelfile
ollama run hai
```

### 方式三：Transformers (Python)

```python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_path = "bertbobson/Qwen3.5-27B-bnb-4bit"  # 或你的本地基座
adapter_path = "./qwen35hai-lora-fp16"          # LoRA 权重目录

model = AutoModelForCausalLM.from_pretrained(
    model_path,
    torch_dtype=torch.float16,
    device_map="auto",
    trust_remote_code=True,
)
model.load_adapter(adapter_path)

tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)

messages = [
    {"role": "system", "content": "你是小海，一个温柔耐心的 AI 伙伴。"},
    {"role": "user", "content": "教我写 Java 的 Hello World"}
]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt").to(model.device)

outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```

---

## 📦 文件说明

本仓库提供以下格式：

| 文件 | 格式 | 大小 | 说明 |
|------|------|------|------|
| `hai-2-Q4_K_M.gguf` | GGUF | ~16 GB | **推荐**，平衡质量与速度 |
| `hai-2-Q6_K.gguf` | GGUF | ~23 GB | 接近无损 |
| `hai-2-Q8_0.gguf` | GGUF | ~30 GB | 几乎无损 |
| `hai-2-F16.gguf` | GGUF | ~54 GB | 无压缩，融合后原始输出 |
| `adapter_model.safetensors` | PEFT | ~300 MB | 仅 LoRA 权重，需配合基座使用 |
| `adapter_config.json` | JSON | ~1 KB | LoRA 配置 |

> **注意**：`--allow-requantize` 版本为融合后二次量化，部分层经历多轮量化，极端场景下与原生 Q4_K_M 有微小差异，日常对话几乎无感知。

---

## ⚙️ 训练配置

```json
{
  "base_model": "Qwen/Qwen3.5-27B",
  "quantization": "4-bit (bnb NF4)",
  "lora_r": 16,
  "lora_alpha": 32,
  "lora_dropout": 0.05,
  "target_modules": ["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
  "learning_rate": 1e-4,
  "batch_size": 1,
  "gradient_accumulation_steps": 8,
  "epochs": 2,
  "warmup_steps": 20,
  "lr_scheduler": "cosine",
  "weight_decay": 0.01,
  "max_seq_length": 4096,
  "packing": true
}
```

## ⚠️ 使用声明

1. **基座许可**：本模型基于 [Qwen3.5-27B](https://huggingface.co/Qwen/Qwen3.5-27B) 微调，遵循其原始许可证。
2. **商用限制**：请查阅 Qwen3.5 最新许可条款，确认商用合规性。
3. **内容安全**：模型已尽量过滤有害内容，但仍可能产生不当输出。请勿用于生成违法、歧视、暴力等内容。
4. **免责声明**：本模型按"现状"提供，作者不对使用结果承担任何责任。

---

## 🙏 致谢

- [Qwen](https://github.com/QwenLM/Qwen) 团队提供强大的基座模型
- [Unsloth](https://github.com/unslothai/unsloth) 提供高效的微调框架
- [llama.cpp](https://github.com/ggml-org/llama.cpp) 提供 GGUF 转换与推理工具

---

## 📬 反馈

如有问题或建议，欢迎通过 ModelScope 讨论区或 GitHub Issues 反馈。
**Enjoy chatting with 小海~** (´∇ﾉ｀*)ノ
