- 确保你的主机满足 QPL 所需的前置条件
- 在 cmake 构建过程中,deflate_qpl 默认已启用。如果你不小心改动了它,请再次确认构建标志:ENABLE_QPL=1
- 关于通用要求,请参阅 ClickHouse 的通用构建说明
文件列表
benchmark_sample 文件夹提供了使用 Python 脚本运行基准测试的示例:
client_scripts 包含用于运行典型基准测试的 Python 脚本,例如:
client_stressing_test.py:用于在 [1~4] 个服务器实例上执行查询压力测试的 Python 脚本。queries_ssb.sql:该文件列出了 Star Schema Benchmark 的所有查询。allin1_ssb.sh:此 shell 脚本会自动执行一体化的基准测试工作流。
database_files 表示将按 lz4/deflate/zstd 编解码器 存储数据库文件。
自动运行 Star Schema 基准测试:
./output/
如果运行失败,请按照以下各节手动运行基准测试。
定义
环境
生成原始数据
dbgen 并通过以下参数生成 1 亿行数据:
-s 20
像 *.tbl 这样的文件应输出到 ./benchmark_sample/rawdata_dir/ssb-dbgen 目录下:
数据库设置
Connected to ClickHouse server,这表示客户端已成功与服务器建立连接。
完成下方 Star Schema Benchmark 中提到的三个步骤:
- 在 ClickHouse 中创建表
- 插入数据。此处应使用
./benchmark_sample/rawdata_dir/ssb-dbgen/*.tbl作为输入数据。 - 将 “star schema” 转换为反规范化的 “flat schema”
单实例基准测试
- 在开始基准测试之前,请禁用 C6,并将 CPU 频率调控器设置为
performance
- 为了消除跨套接字内存绑定带来的影响,我们使用
numactl将服务器绑定到一个套接字上,并将客户端绑定到另一个套接字上。 - 单实例表示单个服务器连接单个客户端
QPS_Final 并收集统计信息
使用多实例进行基准测试
- 为了减轻线程过多导致的内存瓶颈影响,我们建议使用多实例运行基准测试。
- 多实例是指多个 (2 个或 4 个) 服务器实例分别连接各自的客户端。
- 需要将一个 CPU 插槽上的核心平均划分,并分别分配给各个服务器实例。
- 对于多实例,必须为每个 编解码器 创建新的文件夹,并按照与单实例类似的步骤导入数据集。
- 在客户端侧,你需要在创建表和插入数据时,使用分配好的端口启动 ClickHouse。
- 在服务器侧,你需要使用指定的 XML 配置文件启动 ClickHouse,其中已分配好端口。多实例所需的所有自定义 XML 配置文件均已在 ./server_config 下提供。
- [TBL_FILE_NAME] 表示文件名,需匹配以下正则表达式:*. tbl,文件位于
./benchmark_sample/rawdata_dir/ssb-dbgen。 --port=9001表示为服务器实例分配的端口,该端口也在 config_lz4_s2.xml/config_zstd_s2.xml/config_deflate_s2.xml 中定义。若要使用更多实例,需要将其替换为 9002/9003,分别对应 s3/s4 实例。如果不指定,默认端口为 9000,而该端口已被第一个实例占用。
2 表示实例数量。若需更多实例,请将其替换为 3 或 4。此脚本最多支持 4 个实例/
现在应会按预期输出三条日志:
QPS_Final 并收集统计信息
4 个实例的基准测试配置与上述 2 个实例类似。
我们建议使用 2 个实例的基准测试数据作为最终报告供评审。