---
title: AnyWord-lmdb
canonical_url: "https://www.modelscope.cn/datasets/Yesianrohn/AnyWord-lmdb"
md_url: "https://www.modelscope.cn/datasets/Yesianrohn/AnyWord-lmdb.md"
repository: Yesianrohn/AnyWord-lmdb
last_updated: 2024-12-13
license: "Apache License 2.0"
storage_size: "168 GB"
downloads: 632
stars: 0
---

# AnyWord-lmdb

> AnyWord-lmdb - Yesianrohn 在 ModelScope 开源的数据集。数据集文件元信息以及数据文件，请浏览“数据集文件”页面获取。

Yesianrohn/AnyWord-lmdb 是 ModelScope 魔搭社区上的数据集，存储大小 168 GB，采用 Apache License 2.0 许可。

- **Repository**: Yesianrohn/AnyWord-lmdb
- **License**: Apache License 2.0
- **Storage size**: 168 GB
- **Downloads**: 632
- **Stars**: 0
- **Last updated**: 2024-12-13

Source: https://www.modelscope.cn/datasets/Yesianrohn/AnyWord-lmdb

---

数据集文件元信息以及数据文件，请浏览“数据集文件”页面获取。

您可以通过如下GIT Clone命令，或者ModelScope SDK来下载数据集

#### 下载方法 
:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}

### 使用方法

#### 第一步：合并切分文件生成一个 `zip` 文件

以下代码将分割的文件合并为一个完整的 `zip` 文件：

```python
import os

def merge_zip(output_zip, chunk_prefix, chunk_count, output_dir='./AnyWord-lmdb'):
    """将分割的zip文件合并为一个完整的zip文件。"""
    with open(output_zip, 'wb') as output:
        for i in range(1, chunk_count + 1):
            chunk_file_name = os.path.join(output_dir, f"{chunk_prefix}_part{i}.zip")
            with open(chunk_file_name, 'rb') as chunk_file:
                output.write(chunk_file.read())
            print(f"合并文件: {chunk_file_name}")

# 示例使用
merge_zip('AnyWord-lmdb.zip', 'AnyWord-lmdb', 17, output_dir='./AnyWord-lmdb')
```

#### 第二步：解压 `AnyWord-lmdb.zip` 文件

将合并的 `AnyWord-lmdb.zip` 文件解压。
