1个T的文本是多大呢?1TB = 1000GB,1GB是10亿,1TB就是1万亿字节。如果是英文字符,1TB文本就是1万亿个英文字符,如果是中文字符而且都是UTF8格式,1个中文字符占3个字节,1TB文本是3333亿中文字符,相当于1亿篇3300字的文章。
现在要对1TB文本进行实时全文检索,希望检索任何内容都能实时返回(要达到毫秒级响应才能成为实时),需要什么样的服务器配置呢?需要服务器集群吗?
是否需要服务器集群一是看数据量,二是看访问量。
不考虑访问量,仅从数据量上考虑,1TB文本的实时全文检索系统是不需要服务器集群的,普通单机双路服务器即可支持2000在线用户的实时搜索。
服务器配置:普通双路服务器
硬盘:Intel p4510 8T SSD
内存:3T(满配)
软件系统:
Ubuntu 22.04
搜索引擎:最常见的是ElasticSearch,是java系统,还需要配置java及jvm,这里采用了小唐搜索引擎,c 开发的,安装简单,什么依赖都不需要。
文本数据:
CodeParrot数据集(该数据集采集自github),123万个项目,1.15亿个代码文件
Android 13源代码
OpenHarmony鸿蒙源代码
总文本量接近1T,基本上是英文。
为了达到实时搜索,文本内容及索引需要进入内存,需要修改linux的默认的max locked memory,默认是不会有那么大的:
sudo nano /etc/security/limits.conf
加上两行
* soft memlock 3072000000
* hard memlock 3072000000
这就把可锁定内存扩大到3T,硬盘内容可以常驻内存了。
系统上线: www.tanglib.com 28种程序语言源代码全文检索
经过实测,系统响应基本上在毫秒级,达到了实时搜索要求。