首批通过分布式安全可靠测评,为关键业务系统打造
OBLOADER 支持导入的文件格式
更新时间:2024-11-04 11:11
适用版本
OBLOADER 所有版本。
OBLOADER 支持导入的文件格式见下表:
| 格式(命令行选项) | 相关的命令行选项 | 适用的业务场景 |
|---|---|---|
| CSV (--csv) CSV(Comma-Separated Values)格式是一种常用的文本文件格式,用于存储和交换数据。具有以下两大显著特性:
|
|
适用于几乎所有的业务场景。 |
| CUT (--cut) CUT 格式又称 Delimited Text,与 CSV 格式类似。其与 CSV 格式的区别:
|
|
参考 CSV。多用于导入由某些老式平台导出的较为灵活的数据交换格式。 |
| POS(--pos) POS 格式即 Fixed-Length (固定长度)格式。与 CSV 格式不同,其使用固定长度的字段来存储数据,每个字段的长度为预定义。 需要配合控制文件使用。 |
须与控制文件配合使用。 | 与某些仅支持定长格式的卸数平台进行交互。 |
| SQL(--sql) 用于导入 SQL 数据文件。 注意该格式仅支持一种 SQL 语法,即单条插入语句,不支持批量插入语句或其他任意 DML, DDL 等语句。 |
--line-separator:换行符,类 UNIX 系统下默认为 '\n';Windows 上默认为 '\r\n'。 | 适用于仅导入数据而非结构的场景。仅支持一种 SQL 写法,但性能较好。 |
| MIX (--mix) 用于导入 SQL 混合格式的文件,文件内容可以为任意 OceanBase 支持的 SQL 语法。 也可以以兼容性转换的方式处理 mysqldump 导出的 SQL 文件格式。 |
|
适用于导入任意格式的 SQL 文件。兼容性更强,但对比 --sql 性能相差较大。 目前的实现是将文本全部读取进内存再解析,不适合处理数据量较大的文件。 |
| Parquet(--par) Parquet 是一种二进制文件格式(不可读),采用了列式存储,专为高效存储和处理大规模数据而设计。其在大数据领域中被广泛采用,并支持 Apache Hadoop、Apache Spark、Apache Hive 等流行的大数据处理框架。 |
|
由 Hive, Spark 或其他能导出标准 Parquet 格式的数据源进行数据迁移。 |
| ORC(--orc) 与 Parquet 类似,ORC 格式也是一种二进制文件格式(不可读),旨在提供更好的查询性能和压缩率,并且被广泛应用于大数据处理领域。 |
|
由 Hive, Spark 或其他能导出标准 ORC 格式的数据源进行数据迁移。 |
说明
命令行选项详情请参见 OBLOADER 命令行选项。