记一次MongoDB性能问题
最近忙着把一个项目从MySQL迁移到MongoDB,在导入旧数据的过程中,遇到了些许波折,犯了不少错误,但同时也学到了不少知识,遂记录下来。
公司为这个项目专门配备了几台高性能务器,清一色的双路四核超线程CPU,外加32G内存,运维人员安装好MongoDB后,就轮到我了,我习惯于在使用新服务器前先看看相关日志,了解一下基本情况,当我浏览MongoDB日志时,发现一些警告信息:
WARNING: You are running on a NUMA machine. We suggest launching mongod like this to avoid performance problems: numactl --interleave=all mongod [other options]
当时我并不太清楚NUMA是什么东西,所以没有处理,只是把问题报告给了运维人员,事实证明运维人员也没有处理,所以问题的序幕就这样拉开了…
迁移工作首先要导入旧数据。开始一切倒还正常,不过几小时之后,我无意中发现不知道什么时候开始数据导入的速度下降了,同时我的PHP脚本开始不停的抛出异常:
cursor timed out (timeout: 30000, time left: 0:0, status: 0)
我一时判断不出问题所在,想想先在PHP脚本里加大Timeout的值应付一下:
MongoCursor::$timeout = -1;
可惜这样并没有解决问题,错误反倒变着花样的出现了:
max number of retries exhausted, couldn\'t send query couldn\'t send query: Broken pipe
无奈之下用strace跟踪了一下PHP脚本:
shell> strace -p
发现进程卡在了recvfrom操作上:
recvfrom(,
通过如下命令查询recvfrom操作的含义是:receive a message from a socket
shell> apropos recvfrom
还可以按照下面的方式确认一下:
shell> lsof -pshell> ls -l /proc/ /fd/
此时查询MongoDB当前操作,发现几乎每个操作会消耗大量的时间(secs_running):
shell> echo "db.currentOp()" | /path/to/mongo
同时运行mongostat显示很高的locked值。
…
重复做了很多工作,但始终无法找到问题的症结在哪里,只好求助官方论坛,那里的技术支持都很热心,在我描述了问题后,没过多久就有了回复,建议我检查一下是不是索引不佳所致,为了验证这种可能,我激活了Profiler记录慢操作:
mongo> usemongo> db.setProfilingLevel(1);
不过结果显示基本都是insert操作(因为我是导入数据为主),本身就不需要索引:
mongo> usemongo> db.system.profile.find().sort({$natural:-1})
…
问题到了这里,似乎已经走投无路了,为了死马当活马医,我又重复了几次迁移旧数据的过程,结果自然是次次都出问题,但幸运的是我发现每当出问题的时候,在top命令的结果中,总有一个名叫irqbalance的进程居高不下,搜索了一下,结果很多介绍irqbalance的文章中都提及了NUMA,让我一下子记起之前在日志中看到的警告信息,于是乎按照信息里介绍的,重新启动了一下MongoDB:
shell> numactl --interleave=all /path/to/mongod
一切都正常了。为了解决这个问题,浪费了很多精神,实在没有力气再解释NUMA到底是什么东西了,又想了解的网友可以参考相关文章,里面的介绍很翔实。
建议继续学习:
- MongoDB与内存 (阅读:5459)
- Nodejs和MongoDB初体验 (阅读:5084)
- 我为什么选择MongoDB (阅读:3936)
- 白话MongoDB(一) (阅读:3703)
- MySQL和MongoDB设计实例对比 (阅读:3764)
- 也来玩玩MongoDB (阅读:3399)
- MySQL Cluster 与 MongoDB 复制及分片设计及原理 (阅读:3305)
- 在MongoDB中模拟auto_increment (阅读:3063)
- 白话MongoDB(二) (阅读:2718)
- MySQL MongoDB SQL 对应 (阅读:2840)
扫一扫订阅我的微信号:IT技术博客大学习
- 作者:老王 来源: 火丁笔记
- 标签: MongoDB
- 发布时间:2011-08-14 15:59:30
-
[82] memory prefetch浅析
-
[57] 转载:cassandra读写性能原理分析
-
[53] 深入浅出cassandra 4 数据一致性问
-
[49] 基本排序算法的PHP实现
-
[45] 字符引用和空白字符
-
[44] Inline Form Labels
-
[42] JS中如何判断字符串类型的数字
-
[41] MySQL半同步存在的问题
-
[39] 获取Dom元素的X/Y坐标
-
[38] javascript插入样式