有人从网上搜集了52 条 SQL 语句性能优化策略,在各大技术网站和公众号广为流传, 我对其中的一些观点有不同看法(其中一些规则本身就没有描述清楚,或者是自相矛盾), 下面内容黑色部分是原文,以tiger开头并标红的内容是我的点评,大家可以参考一下:
本文会提到 52 条 SQL 语句性能优化策略,建议收藏下来,慢慢看,不管你是开发、运维、还是 DBA,本文都会对你有所帮助,文中主要是以 MySQL 为主,但 SQL 不管是哪种数据库基本上都适用,当然有些不敢苟同的优化建议我个人也有一点儿不同建议,可以一起看看。(这段话也是网文的一部分,不是老虎刘所写)
1、对查询进行优化,应尽量避免全表扫描,首先应考虑在 WHERE 及 ORDER BY 涉及的列上建立索引。
tiger:
这个要看具体业务, 如果是统计分析业务,需要访问大量数据, 全表扫描没问题; 如果是OLTP业务, 处理少量记录, 就要尽量使用索引; 索引的创建也需要根据数据分布,谓词条件写法,order by等规则并加以分析, 不能简单的把where 条件和order by涉及的列都创建索引, 这个有较大的误导倾向.
很多人对索引技术了解不够深入, 可以说掌握了索引技术,基本上就掌握了80%以上的OLTP优化技术.
2、应尽量避免在 WHERE 子句中对字段进行 NULL 值判断,创建表时 NULL 是默认值,但大多数时候应该使用 NOT NULL,或者使用一个特殊的值,如 0,-1 作为默认值。
tiger:
对索引列用not null+默认值是一个好的设计习惯;对于非索引列, 使用null也没问题.
3、应尽量避免在 WHERE 子句中使用 != 或 <> 操作符。MySQL 只有对以下操作符才使用索引:<,<=,=,>,>=,BETWEEN,IN,以及某些时候的 LIKE。
4、应尽量避免在 WHERE 子句中使用 OR 来连接条件,否则将导致引擎放弃使用索引而进行全表扫描,可以使用 UNION ALL 合并查询:
select id from t where num=10 union all select id from t where num=20;
tiger:
这种简单的num = 10 or num =20 , 如果适合走索引, 优化器都会自动识别, 不会使用全表扫描,相当于num in(10,20) ; 如果num in (100个或更多)的值, 难道要写100个union all?
5、IN 和 NOT IN 也要慎用,否则会导致全表扫描。对于连续的数值,能用 BETWEEN 就不要用 IN:
select id from t where num between 1 and 3;
6、下面的查询也将导致全表扫描:
select id from t where name like‘%abc%’;
或者
select id from t where name like‘%abc’;
tiger:
这种百分号在前的情况, oracle可以通过改写+函数索引, 也能使用索引.
若要提高效率,可以考虑全文检索。下面情况才能用到索引:
select id from t where name like‘abc%’;
tiger:
注意,全文检索并不能做到像like 一样精准匹配, 二者不是等价的.
7、如果在 WHERE 子句中使用参数,也会导致全表扫描。
tiger: 这个不知道如何理解?
8、应尽量避免在 WHERE 子句中对字段进行表达式操作,应尽量避免在 WHERE 子句中对字段进行函数操作。
9、很多时候用 EXISTS 代替 IN 是一个好的选择:
select num from a where num in(select num from b);
用下面的语句替换:
select num from a where exists(select 1 from b where num=a.num); --注:当然这里我不敢苟同,in 和 exists 没有孰优孰劣,同等情况下还是需要看执行计划,执行计划才具有参考性,2020 DTC 嘉年华罗老师《SQL等价改写核心思想》里有说明“不要脱离执行计划和数据量来评价 in 和 exists 谁快谁慢”。《SQL等价改写核心思想》 PDF 可在公众号【JiekeXu之路】后台回复“SQL等价改写核心思想”获得。
10、索引固然可以提高相应的 SELECT 的效率,但同时也降低了 INSERT 及 UPDATE 的效率。因为 INSERT 或 UPDATE 时有可能会重建索引,所以怎样建索引需要慎重考虑,视具体情况而定。一个表的索引数最好不要超过 6 个,若太多则应考虑一些不常使用到的列上建的索引是否有必要。
--注:这里我不敢苟同,也说一句吧,在 Oracle 里一个表的索引数最好不要超过 5 个,只能仁者见仁仁智者见智无非对错,不过 索引高度也不要超过 4,对于太多的索引应该要进行索引监控,对不使用的索引及时清理。
tiger:
索引个数是根据需要创建的, 用最少的索引覆盖更多的SQL为最佳, 但没有5个6个的限制, 如果需要, 10个20个也是可以创建的,对于一些DML不频繁的静态表, 根据不同的查询组合,创建更多的索引也是没问题的; 索引会影响insert 速度, 但是否影响update和delete的, 就要看具体的SQL了,大部分情况索引是会提高效率的.
11、应尽可能的避免更新 clustered 索引数据列, 因为 clustered 索引数据列的顺序就是表记录的物理存储顺序,一旦该列值改变将导致整个表记录的顺序的调整,会耗费相当大的资源。若应用系统需要频繁更新 clustered 索引数据列,那么需要考虑是否应将该索引建为 clustered 索引。
12、尽量使用数字型字段,若只含数值信息的字段尽量不要设计为字符型,这会降低查询和连接的性能,并会增加存储开销。
13、尽可能的使用 varchar, nvarchar 代替 char, nchar。因为首先变长字段存储空间小,可以节省存储空间,其次对于查询来说,在一个相对较小的字段内搜索效率显然要高些。
14、最好不要使用返回所有:select * from t ,用具体的字段列表代替 “*”,不要返回用不到的任何字段。
tiger:
这里没有做解释, 我简单总结了一下, 这种写法影响性能主要体现在5个方面.
15、尽量避免向客户端返回大数据量,若数据量过大,应该考虑相应需求是否合理。
16、使用表的别名(Alias):当在 SQL 语句中连接多个表时,请使用表的别名并把别名前缀于每个 Column 上。这样一来,就可以减少解析的时间并减少那些由 Column 歧义引起的语法错误。
tiger:
别名最好也要有一定的识别度, 比如order 别名为O, order_detail 别名为OD; 另外,别名也不宜过长.
17、使用“临时表”暂存中间结果 :
简化 SQL 语句的重要方法就是采用临时表暂存中间结果。但是临时表的好处远远不止这些,将临时结果暂存在临时表,后面的查询就在 tempdb 中了,这可以避免程序中多次扫描主表,也大大减少了程序执行中“共享锁”阻塞“更新锁”,减少了阻塞,提高了并发性能。
18、一些 SQL 查询语句应加上 nolock,读、写是会相互阻塞的,为了提高并发性能。对于一些查询,可以加上 nolock,这样读的时候可以允许写,但缺点是可能读到未提交的脏数据。
使用 nolock 有3条原则:
19、常见的简化规则如下:
MySQL 中不要有超过 5 个以上的表连接(JOIN),考虑使用临时表或表变量存放中间结果。少用子查询,视图嵌套不要过深,一般视图嵌套不要超过 2 个为宜。
tiger:
mysql的优化器还是相对比较弱, oracle 10几个表做关联的情况也不少见.
20、将需要查询的结果预先计算好放在表中,查询的时候再 Select。这在 SQL7.0 以前是最重要的手段,例如医院的住院费计算。
21、用 OR 的字句可以分解成多个查询,并且通过 UNION 连接多个查询。他们的速度只同是否使用索引有关,如果查询需要用到联合索引,用 UNION all 执行的效率更高。多个 OR 的字句没有用到索引,改写成 UNION 的形式再试图与索引匹配。一个关键的问题是否用到索引。
tiger:
到底是用union 还是union all? 一般情况不需要改写, 优化器会自动做查询转换; 用union 改写是错误的, 用union all改写, 也要避免结果集重复的问题.
22、在 IN 后面值的列表中,将出现最频繁的值放在最前面,出现得最少的放在最后面,减少判断的次数。
tiger: 这个对性能影响微乎其微, 还会影响写SQL的效率.
23、尽量将数据的处理工作放在服务器上,减少网络的开销,如使用存储过程。存储过程是编译好、优化过、并且被组织到一个执行规划里、且存储在数据库中的 SQL 语句,是控制流语言的集合,速度当然快。反复执行的动态 SQL,可以使用临时存储过程,该过程(临时表)被放在 Tempdb 中。
24、当服务器的内存够多时,配制线程数量 = 最大连接数+5,这样能发挥最大的效率;否则使用配制线程数量< 最大连接数,启用 SQL SERVER 的线程池来解决,如果还是数量 = 最大连接数+5,严重的损害服务器的性能。
tiger:
并发数与CPU个数有关, 与内存关系不大; 需要根据CPU数量, 控制并发数, 而不是连接数; 数据库服务器会为每个连接创建服务进程, 连接数越多, 服务进程越多, 消耗的内存也越多.
25、查询的关联同写的顺序 :
select a.personMemberID, * from chineseresume a,personmember b where personMemberID = b.referenceid and a.personMemberID = 'JCNPRH39681'; (A = B, B = '号码') select a.personMemberID, * from chineseresume a,personmember b where a.personMemberID = b.referenceid and a.personMemberID = 'JCNPRH39681' and b.referenceid = 'JCNPRH39681'; (A = B, B = '号码', A = '号码') select a.personMemberID, * from chineseresume a,personmember b where b.referenceid = 'JCNPRH39681' and a.personMemberID = 'JCNPRH39681'; (B = '号码', A = '号码')
tiger:
这个没看懂想说明什么, 用第一种写法就挺好.
26、尽量使用 EXISTS 代替 select count(1) 来判断是否存在记录。count 函数只有在统计表中所有行数时使用,而且 count(1) 比 count(*) 更有效率。
tiger:
count(1) 效率比count(*) 高效的理论是从哪里来的? 一般用limit 1或rownum<=1来判断是否存在记录, 跟exists没有关系.
27、尽量使用 “>=”,不要使用 “>”
tiger:
想怎么写就怎么写, 如果有区别, 也可以忽略不计.
28、索引的使用规范:
tiger:
根据实际需要重建索引, 大部分索引并不需要定期重建; 重建索引不需要重新编译存储过程.
29、下列 SQL 条件语句中的列都建有恰当的索引,但执行速度却非常慢:
SELECT * FROM record WHERE substrINg(card_no, 1, 4) = '5378'; --13秒 SELECT * FROM record WHERE amount/30 < 1000; --11秒 SELECT * FROM record WHERE convert(char(10), date, 112) = '19991201'; --10秒
分析:
WHERE 子句中对列的任何操作结果都是在 SQL 运行时逐列计算得到的,因此它不得不进行表搜索,而没有使用该列上面的索引。
如果这些结果在查询编译时就能得到,那么就可以被 SQL 优化器优化,使用索引,避免表搜索,因此将 SQL 重写成下面这样:
SELECT * FROM record WHERE card_no like '5378%' -- < 1秒 SELECT * FROM record WHERE amount < 1000*30 -- < 1秒 SELECT * FROM record WHERE date = '1999/12/01' -- < 1秒
tiger:
这个与第8条重复了, 应该算是第8条的示例.
30、当有一批处理的插入或更新时,用批量插入或批量更新,绝不要一条条记录的去更新。
31、在所有的存储过程中,能够用 SQL 语句的,我绝不会用循环去实现。
例如:列出上个月的每一天,我会用 connect by 去递归查询一下,绝不会去用循环从上个月第一天到最后一天。
32、选择最有效率的表名顺序(只在基于规则的优化器中有效):
Oracle 的解析器按照从右到左的顺序处理 FROM 子句中的表名,FROM 子句中写在最后的表(基础表 driving table)将被最先处理,在 FROM 子句中包含多个表的情况下,你必须选择记录条数最少的表作为基础表。
如果有 3 个以上的表连接查询,那就需要选择交叉表(intersection table)作为基础表,交叉表是指那个被其他表所引用的表。
tiger:
在当前oracle以11g及以上版本为主流的背景下, 就不要再提RBO的规则了(RBO优化器是淘汰了10几年的东西), 很多程序员不了解什么叫"基于规则的优化器", 如果还按照上面的规则, 写SQL的时候还有考虑表的书写顺序, 大大影响开发进度.
33、提高 GROUP BY 语句的效率,可以通过将不需要的记录在 GROUP BY 之前过滤掉。下面两个查询返回相同结果,但第二个明显就快了许多。
低效:
SELECT JOB, AVG(SAL) FROM EMP GROUP BY JOB HAVING JOB = 'PRESIDENT'OR JOB = 'MANAGER';
高效:
SELECT JOB, AVG(SAL) FROM EMPWHERE JOB = 'PRESIDENT'OR JOB = 'MANAGER'GROUP BY JOB;
34、SQL 语句用大写,因为 Oracle 总是先解析 SQL 语句,把小写的字母转换成大写的再执行。
tiger:
忽略不计, 建议以提高可读性为主, 不建议写全是大写字母的SQL,不要再误导程序员!
35、别名的使用,别名是大型数据库的应用技巧,就是表名、列名在查询中以一个字母为别名,查询速度要比建连接表快 1.5 倍。
tiger:
什么是建连接表? 别名还有这么大的作用, 从来没有听说.
36、避免死锁,在你的存储过程和触发器中访问同一个表时总是以相同的顺序;事务应尽可能地缩短,在一个事务中应尽可能减少涉及到的数据量;永远不要在事务中等待用户输入。
37、避免使用临时表,除非却有需要,否则应尽量避免使用临时表,相反,可以使用表变量代替。大多数时候(99%),表变量驻扎在内存中,因此速度比临时表更快,临时表驻扎在 TempDb 数据库中,因此临时表上的操作需要跨数据库通信,速度自然慢。
tiger:
第17条建议使用"临时表"存放中间结果, 这里有点自相矛盾.
38、最好不要使用触发器:
tiger:
合理使用触发器,没问题.
39、索引创建规则:
tiger: 列举的规则过于简单,索引是OLTP的核心, 需要深入了解并应用.
40、MySQL 查询优化总结:
使用慢查询日志去发现慢查询,使用执行计划去判断查询是否正常运行,总是去测试你的查询看看是否他们运行在最佳状态下。
久而久之性能总会变化,避免在整个表上使用 count(*),它可能锁住整张表,使查询保持一致以便后续相似的查询可以使用查询缓存,在适当的情形下使用 GROUP BY 而不是 DISTINCT,在 WHERE、GROUP BY 和 ORDER BY 子句中使用有索引的列,保持索引简单,不在多个索引中包含同一个列。
有时候 MySQL 会使用错误的索引,对于这种情况使用 USE INDEX,检查使用 SQL_MODE=STRICT 的问题,对于记录数小于5的索引字段,在 UNION 的时候使用LIMIT不是是用OR。
为了避免在更新前 SELECT,使用 INSERT ON DUPLICATE KEY 或者 INSERT IGNORE;不要用 UPDATE 去实现,不要使用 MAX;使用索引字段和 ORDER BY子句 LIMIT M,N 实际上可以减缓查询在某些情况下,有节制地使用,在 WHERE 子句中使用 UNION 代替子查询,在重新启动的 MySQL,记得来温暖你的数据库,以确保数据在内存和查询速度快,考虑持久连接,而不是多个连接,以减少开销。
基准查询,包括使用服务器上的负载,有时一个简单的查询可以影响其他查询,当负载增加在服务器上,使用 SHOW PROCESSLIST 查看慢的和有问题的查询,在开发环境中产生的镜像数据中测试的所有可疑的查询。
41、MySQL 备份过程:
42、查询缓冲并不自动处理空格,因此,在写 SQL 语句时,应尽量减少空格的使用,尤其是在 SQL 首和尾的空格(因为查询缓冲并不自动截取首尾空格)。
43、member 用 mid 做标准进行分表方便查询么?一般的业务需求中基本上都是以 username 为查询依据,正常应当是 username 做 hash 取模来分表。
而分表的话 MySQL 的 partition 功能就是干这个的,对代码是透明的;在代码层面去实现貌似是不合理的。
44、我们应该为数据库里的每张表都设置一个 ID 做为其主键,而且最好的是一个 INT 型的(推荐使用 UNSIGNED),并设置上自动增加的 AUTO_INCREMENT 标志。
45、在所有的存储过程和触发器的开始处设置 SET NOCOUNT ON,在结束时设置 SET NOCOUNT OFF。无需在执行存储过程和触发器的每个语句后向客户端发送 DONE_IN_PROC 消息。
46、MySQL 查询可以启用高速查询缓存。这是提高数据库性能的有效MySQL优化方法之一。当同一个查询被执行多次时,从缓存中提取数据和直接从数据库中返回数据快很多。
47、EXPLAIN SELECT 查询用来跟踪查看效果:
使用 EXPLAIN 关键字可以让你知道 MySQL 是如何处理你的 SQL 语句的。这可以帮你分析你的查询语句或是表结构的性能瓶颈。EXPLAIN 的查询结果还会告诉你你的索引主键被如何利用的,你的数据表是如何被搜索和排序的。
48、当只要一行数据时使用 LIMIT 1 :
当你查询表的有些时候,你已经知道结果只会有一条结果,但因为你可能需要去 fetch 游标,或是你也许会去检查返回的记录数。
在这种情况下,加上 LIMIT 1 可以增加性能。这样一来,MySQL 数据库引擎会在找到一条数据后停止搜索,而不是继续往后查少下一条符合记录的数据。
49、选择表合适存储引擎:
50、优化表的数据类型,选择合适的数据类型:
原则:更小通常更好,简单就好,所有字段都得有默认值,尽量避免 NULL。
tiger:
所有字段都得有默认值, 这个说法有点太武断了. 一般只要求索引列尽量避免null.
例如:数据库表设计时候更小的占磁盘空间尽可能使用更小的整数类型。(mediumint 就比 int 更合适)
比如时间字段:datetime 和 timestamp。datetime 占用8个字节,timestamp 占用4个字节,只用了一半。而 timestamp 表示的范围是 1970—2037 适合做更新时间。
MySQL可以很好的支持大数据量的存取,但是一般说来,数据库中的表越小,在它上面执行的查询也就会越快。 因此,在创建表的时候,为了获得更好的性能,我们可以将表中字段的宽度设得尽可能小。
例如:在定义邮政编码这个字段时,如果将其设置为 CHAR(255),显然给数据库增加了不必要的空间。甚至使用VARCHAR 这种类型也是多余的,因为 CHAR(6) 就可以很好的完成任务了。
同样的,如果可以的话,我们应该使用 MEDIUMINT 而不是 BIGIN 来定义整型字段,应该尽量把字段设置为 NOT NULL,这样在将来执行查询的时候,数据库不用去比较 NULL 值。
对于某些文本字段,例如“省份”或者“性别”,我们可以将它们定义为 ENUM 类型。因为在 MySQL 中,ENUM 类型被当作数值型数据来处理,而数值型数据被处理起来的速度要比文本类型快得多。这样,我们又可以提高数据库的性能。
51、字符串数据类型:了解char, varchar, text 三者的区别。根据不同需要选择不同类型.
52、任何对列的操作都将导致表扫描,它包括数据库函数、计算表达式等等,查询时要尽可能将操作移至等号右边。
tiger: 与第8条和第29条重复了. 这个问题确实被很多初级程序员所忽视,重要的问题说三遍也挺好. 操作移到等号右边的说法不是太严谨, 严谨的说法应该是"尽量避免对列(字段)使用函数和表达式计算,最好让函数和表达式计算发生在变量上"
因文章与网文大部分内容重复,无法声明原创!
本文分享自 老虎刘谈oracle性能优化 微信公众号,前往查看
如有侵权,请联系 cloudcommunity@tencent.com 删除。
本文参与 腾讯云自媒体同步曝光计划 ,欢迎热爱写作的你一起参与!