沈阳网站seo排名优化百度收录最快的网站
news/
2025/10/5 2:23:08/
文章来源:
沈阳网站seo排名优化,百度收录最快的网站,全国各大网站,佛山免费建站怎样这篇文章详细介绍一下MySQL中的字符集和字符序相关的问题#xff0c;里里外外地了解一下字符集和字符序的方方面面#xff0c;同时重点说明一下开发中需要注意的问题。 文章基于MySQL 8.0#xff0c;也会涉及到5.7版本。主要参考MySQL手册#xff1a;https://dev.mysql.com…这篇文章详细介绍一下MySQL中的字符集和字符序相关的问题里里外外地了解一下字符集和字符序的方方面面同时重点说明一下开发中需要注意的问题。 文章基于MySQL 8.0也会涉及到5.7版本。主要参考MySQL手册https://dev.mysql.com/doc/refman/8.0/en/
1. 太长不爱看版
字符集(Character Set)是字符的编码规则字符序(Collation)是字符的排序规则每一个字符集都包含一定范围的字符每一个字符集都有一个或多个字符序其中一个字符序为默认字符序每一个字符序都有一个相关联的字符集两个不同的字符集没有相同的字符序相同数据使用不同的字符序排序结果可能会不同MySQL支持服务(server)、数据库(database)、表(table)、字段(column)以及字符串字面量(string literal)等多个级别的字符集与字符序的设置库表创建以及程序中尽可能使用utf8mb4字符集可支持emojiMySQL中的utf8字符集是utf8mb3字符集的别名避免使用MySQL 5.7的服务默认字符集是latin1而8.0中是utf8mb4通过SHOW CHARACTER SET查看当前服务器所支持的字符集通过SHOW COLLATION查看所有的字符序MySQL中有多个关于字符集和字符序的系统变量可以针对全局以及当前session进行设置通过SHOW VARIABLES LIKE character_set%查看当前服务以及数据库的字符集设置使用client客户端连接数据库时如果编码有问题可以通过SET NAMES charset_name来设置和数据库一致的字符集库表内容在不同字符集之前转换可能会发生数据丢失问题。
2. 什么是字符集与字符序
在大多数情况下我们并不需要了解字符集与字符序但是在涉及到不同字符集的转换时可能会出现问题这时了解一下相关的知识还是有帮助的。
我们首先了解一下字符集的原理。
2.1 字符与字符集
字符是我们经常接触到的东西比如a、中、ß以及等都是字符。
我们知道计算机是通过bit来存储数据的将人类可识别的字符转换成计算机可存储的形式这个过程就是编码字符编码的结果就是内存编码。
一个字符需要用多少个bit来存储那就需要知道一共有多少个字符。
所有的字符放在一起就是字符集。
显然由于使用范围不同就出现了不同的字符集。比如
汉语中的所有字符构成一个字符集也包括不是汉字的字符比如标点符号等英语中的所有字符构成一个字符集等等
对于字符集中的每个字符来说都有两个属性
一个是这个字符在所属字符集中的位置可以叫做字符序号或码点code point第二个就是这个字符在计算机中的数据表示即内存编码。
比如ASCII码只需要8个bit就可以存储所有需要使用的字符了。
但对于汉语来说显然是不够的因此汉语字符需要更多的bit来将每个字符进行编码。
这样对于每个国家来说都可能需要一个将自己使用的字符集编码成计算机内存编码的规则。
那么同一个内存编码对于不同的字符集来说就可能代表不同的字符 比如GB18030字符集中的“地球”两个字符的内存编码分别是0xB5D8和0xC7F2但这两个内存编码在字符集BIG5中代表的字符却是“華⑩”。
这将对我们的程序有很大的影响。
2.2 Unicode字符集与UTF-8
为了解决不同语言编码之间不兼容的问题Unicode出现了。
Unicode字符集致力于为全世界每一个语言的每一个字符都有统一且唯一的编码 Unicode字符序号的范围是0x000000到0x10FFFF可以容纳110多万个字符。
那么如何将Unicode中的字符映射到内存编码呢主要有UTF-8、UTF-16和UTF-32等其中最常用的就是UTF-8。
UTF-8使用1到4个不等的字节来表示所有的字符其中前128个字符与ASCII一致。
关于Unicdoe的详细信息可以参考https://home.unicode.org/
2.3 字符序
一个字符集中有多个字符那么如何对其中的字符进行排序呢这就是字符序。
简单来说字符序就是字符排序的规则集合。比如一个字符集有下面几个字符以及内存编码
字符内存编码A00B01a10b11
当然我们可以直接按照ABab的规则来进行排序这就是这个简单字符集的一个字符序。
如果想让小写字母放在前面比如abAB这又是一种字符序。
如果还想加上大小写无关或大小写相关那么排序的规则集就会有相应的编码这就产生了不同的字符序。
字符序主要对字符的排序有影响。
3. MySQL中的字符集与字符序
了解了字符集和字符序之后来看看MySQL中的字符集与字符序。
3.1 MySQL中的字符集
通过下面的语句来查看MySQL中支持的字符集
SHOW CHARACTER SET;结果
------------------------------------------------------------------------
| Charset | Description | Default collation | Maxlen |
------------------------------------------------------------------------
| armscii8 | ARMSCII-8 Armenian | armscii8_general_ci | 1 |
| ascii | US ASCII | ascii_general_ci | 1 |
| big5 | Big5 Traditional Chinese | big5_chinese_ci | 2 |
| binary | Binary pseudo charset | binary | 1 |
| cp1250 | Windows Central European | cp1250_general_ci | 1 |
| cp1251 | Windows Cyrillic | cp1251_general_ci | 1 |
| cp1256 | Windows Arabic | cp1256_general_ci | 1 |
| cp1257 | Windows Baltic | cp1257_general_ci | 1 |
| cp850 | DOS West European | cp850_general_ci | 1 |
| cp852 | DOS Central European | cp852_general_ci | 1 |
| cp866 | DOS Russian | cp866_general_ci | 1 |
| cp932 | SJIS for Windows Japanese | cp932_japanese_ci | 2 |
| dec8 | DEC West European | dec8_swedish_ci | 1 |
| eucjpms | UJIS for Windows Japanese | eucjpms_japanese_ci | 3 |
| euckr | EUC-KR Korean | euckr_korean_ci | 2 |
| gb18030 | China National Standard GB18030 | gb18030_chinese_ci | 4 |
| gb2312 | GB2312 Simplified Chinese | gb2312_chinese_ci | 2 |
| gbk | GBK Simplified Chinese | gbk_chinese_ci | 2 |
| geostd8 | GEOSTD8 Georgian | geostd8_general_ci | 1 |
| greek | ISO 8859-7 Greek | greek_general_ci | 1 |
| hebrew | ISO 8859-8 Hebrew | hebrew_general_ci | 1 |
| hp8 | HP West European | hp8_english_ci | 1 |
| keybcs2 | DOS Kamenicky Czech-Slovak | keybcs2_general_ci | 1 |
| koi8r | KOI8-R Relcom Russian | koi8r_general_ci | 1 |
| koi8u | KOI8-U Ukrainian | koi8u_general_ci | 1 |
| latin1 | cp1252 West European | latin1_swedish_ci | 1 |
| latin2 | ISO 8859-2 Central European | latin2_general_ci | 1 |
| latin5 | ISO 8859-9 Turkish | latin5_turkish_ci | 1 |
| latin7 | ISO 8859-13 Baltic | latin7_general_ci | 1 |
| macce | Mac Central European | macce_general_ci | 1 |
| macroman | Mac West European | macroman_general_ci | 1 |
| sjis | Shift-JIS Japanese | sjis_japanese_ci | 2 |
| swe7 | 7bit Swedish | swe7_swedish_ci | 1 |
| tis620 | TIS620 Thai | tis620_thai_ci | 1 |
| ucs2 | UCS-2 Unicode | ucs2_general_ci | 2 |
| ujis | EUC-JP Japanese | ujis_japanese_ci | 3 |
| utf16 | UTF-16 Unicode | utf16_general_ci | 4 |
| utf16le | UTF-16LE Unicode | utf16le_general_ci | 4 |
| utf32 | UTF-32 Unicode | utf32_general_ci | 4 |
| utf8 | UTF-8 Unicode | utf8_general_ci | 3 |
| utf8mb4 | UTF-8 Unicode | utf8mb4_0900_ai_ci | 4 |
------------------------------------------------------------------------字段含义
Charset: 字符集的名称Description字符集的简单描述Default collation该字符集的默认字符序Maxlen该字符集中字符最大存储长度。
通过加入条件查询一部分字符集
SHOW CHARATER SET LIKE utf%;结果展示所有Unicode字符集
-------------------------------------------------------
| Charset | Description | Default collation | Maxlen |
-------------------------------------------------------
| utf16 | UTF-16 Unicode | utf16_general_ci | 4 |
| utf16le | UTF-16LE Unicode | utf16le_general_ci | 4 |
| utf32 | UTF-32 Unicode | utf32_general_ci | 4 |
| utf8 | UTF-8 Unicode | utf8_general_ci | 3 |
| utf8mb4 | UTF-8 Unicode | utf8mb4_0900_ai_ci | 4 |
-------------------------------------------------------后面会有关于Unicode的每种字符集的详细信息。
3.2 MySQL中的字符序
每个字符集都有一个或多个字符序可以通过下面的语句查看所有的字符序
SHOW COLLATION;结果只展示一部分
-------------------------------------------------------------------------------
| Collation | Charset | Id | Default | Compiled | Sortlen | Pad_attribute |
-------------------------------------------------------------------------------
| armscii8_bin | armscii8 | 64 | | Yes | 1 | PAD SPACE |
| armscii8_general_ci | armscii8 | 32 | Yes | Yes | 1 | PAD SPACE |
| ascii_bin | ascii | 65 | | Yes | 1 | PAD SPACE |
| ascii_general_ci | ascii | 11 | Yes | Yes | 1 | PAD SPACE |
| big5_bin | big5 | 84 | | Yes | 1 | PAD SPACE |
| big5_chinese_ci | big5 | 1 | Yes | Yes | 1 | PAD SPACE |
| binary | binary | 63 | Yes | Yes | 1 | NO PAD |
| cp1250_bin | cp1250 | 66 | | Yes | 1 | PAD SPACE |
| cp1250_croatian_ci | cp1250 | 44 | | Yes | 1 | PAD SPACE |
| cp1250_czech_cs | cp1250 | 34 | | Yes | 2 | PAD SPACE |
| cp1250_general_ci | cp1250 | 26 | Yes | Yes | 1 | PAD SPACE |
| cp1250_polish_ci | cp1250 | 99 | | Yes | 1 | PAD SPACE |
| ...... | ...... | ...| ... | ... | ... | ...... |
-------------------------------------------------------------------------------字段含义如下
Collation字符序名称Charset该字符序关联的字符集Id字符序IDDefault该字符序是否是所关联的字符集的默认字符序。比armscii8_general_ci就是armscii8的默认字符序而armscii8_bin就不是Compiled字符集是否已编译到服务器中Sortlen这与对以字符集表示的字符串进行排序所需的内存量有关Pad_attribute这表明了字符序在比较字符串时对末尾padding的处理。NO PAD表明在比较字符串时末尾的padding也会考虑进去否则不考虑。
也可以指定条件查询
SHOW COLLATION WHERE Charset utf8mb4;这里查询的就是utf8mb4字符集的所有字符序。
每个字符序都是以该字符序所关联的字符集为前缀的同时还有一些有规律的后缀。
这些后缀有
bin二进制ci大小写不敏感cs大小写敏感ai口音Accent不敏感as口音敏感ks假名Kanatype敏感。
同时有的字符序是面向某种语言的也会在字符序名字中有所体现比如big5_chinese_ci。
3.3 字符集与字符序的关系
字符集与字符序的关系可以用下面的图来表示 即
每个字符集都有一个或多个字符序每个字符集都有一个默认的字符序每个字符序都关联一个且只有一个字符集两个不同的字符集没有相同的字符序。
3.4 MySQL中的相关变量
MySQL中有一些变量用于字符集与字符序的设置。
3.4.1 字符集变量
通过下面的语句来查看与字符集相关的变量
SHOW VARIABLES LIKE character_set\_%; -- 当前会话
SHOW GLOBAL VARIABLES LIKE character_set\_%; -- 全局结果
-----------------------------------------
| Variable_name | Value |
-----------------------------------------
| character_set_client | utf8mb4 |
| character_set_client_handshake | ON |
| character_set_connection | utf8mb4 |
| character_set_database | utf8mb4 |
| character_set_filesystem | binary |
| character_set_results | utf8mb4 |
| character_set_server | utf8mb4 |
| character_set_system | utf8 |
-----------------------------------------变量含义
变量含义作用域默认值character_set_client客户端发出SQL语句的字符集全局会话utf8mb4character_set_client_handshake不忽略客户端发出的字符集信息全局会话ON不忽略character_set_connection没有指定字符集的字符串字面值所使用的字符集全局会话utf8mb4character_set_database数据库默认使用的字符集全局会话utf8mb4character_set_filesystem文件系统默认的字符集全局会话binarycharacter_set_results服务器返回给客户端的结果使用的字符集全局会话utf8mb4character_set_server服务器默认的字符集全局会话utf8mb4character_set_system服务器存储元数据使用的字符集全局utf8bm3
3.4.2 character_set_system
这个变量是MySQL数据库元数据使用的字符集。
所有描述数据库的数据都是元数据比如表名、列名等等。
对元数据的存储有如下几个要求
所有的元数据必须使用相同的字符集
这个字符集必须包含所有语言的字符。
MySQL使用UTF-8具体的就是utf8mb3字符集在MySQL中utf8就是utf8mb3不过后续的版本可能会有所改变。
3.4.3 字符序变量
通过下面的语句来查看与字符序相关的变量
SHOW VARIABLES LIKE %collation%; -- 当前会话
SHOW GLOBAL VARIABLES LIKE %collation%; -- 全局结果
------------------------------------------
| Variable_name | Value |
------------------------------------------
| collation_connection | utf8_general_ci |
| collation_database | utf8mb4_general_ci |
| collation_server | utf8mb4_general_ci |
------------------------------------------变量含义
变量含义作用域collation_connection没有指定字符集的字符串字面值所使用的字符序全局会话collation_database数据库默认使用的字符序全局会话collation_server服务器默认使用的字符序全局会话
3.4.3 重要变量
本文主要关注于下面几个变量
character_set_server, collation_servercharacter_set_database, collation_databasecharacter_set_clientcharacter_set_connection, collation_connectioncharacter_set_results
其中前前两组涉及库表设计时字符集与字符序的配置后三组涉及到客户端与服务器连接时的字符集与字符序的配置。
4. 设置字符集与字符序
MySQL中支持多种字符集与字符序对此MySQL能够为我们做到
使用不同字符集存储字符串使用不同的字符序对字符串进行排序在同一个服务器中或同一个数据库中甚至同一张表中使用不同的字符集或字符序对于多个级别的字符集与字符序进行设置。
4.1 服务器的设置
MySQL中服务器有一个默认的字符集与字符序其中
5.7以后版本默认字符集是utf8mb45.7的默认字符序是utf8mb4_general_ci8.0的默认字符序是utf8mb4_0900_ai_ci。
服务器的字符集与字符序可以通过多种方式设置
服务器启动时
mysqld
mysqld --character-set-serverutf8mb4
mysqld --character-set-serverutf8mb4 --collation-serverutf8mb4_0900_ai_ci这三种方式效果一样。
服务运行时设置character_set_server和collation_server变量还可以编译MySQL服务时进行设置。
服务器字符集与字符序的影响当创建数据库时没有指定字符集与字符序就是用服务器的字符集与字符序。
除此之外没有别的影响。
4.2 库表设计中的设置
在创建库表时需要指定数据库、表以及字段所使用的字符集与字符序。
如果没有指定MySQL有一系列规则来使用字符集与字符序的默认值。
4.2.1 数据库的设置
在创建数据库的时候可以指定该数据库所使用的字符集与字符序
CREATE DATABASE db_name CHARACTER SET latin1 COLLATE latin1_swedish_ci;MySQL使用下面的规则来设置数据库的字符集与字符序
如果创建数据库的时候指定了字符集与字符序就是用这个字符集与字符序
CREATE DATABASE db_name CHARACTER SET latin1 COLLATE latin1_swedish_ci;这里数据库的字符集就是latin1字符序就是latin1_swedish_ci。
如果创建数据库时指定了字符集而没有指定字符序那字符集就是这个值而字符序就是字符集的默认字符序
CREATE DATABASE db_name CHARACTER SET latin1;字符集就是latin1字符序就是latin1的默认字符序latin1_swedish_ci。
如果创建数据库时指定了字符序而没有指定字符集那么字符集就是该字符序所对应的字符集
CREATE DATABASE db_name CHARACTER COLLATE latin1_swedish_ci;字符序就是latin1_swedish_ci字符集就是这个字符序关联的字符集latin1。
如果字符集与字符序都没有指定那么就是用服务器默认的字符集(character_set_server)与字符序(collation_server)。
对于当前数据库所使用的字符集与字符序可以通过查看下面两个变量的值
USE db_name;
SELECT character_set_database, collation_database;这两个变量的值有如下的影响
如果创建表时没有指定该表使用的字符集与字符序就是用这两个变量所对应的字符集与字符序LOAT DATA语句没有指定字符集时服务器使用character_set_database来解析文件中的信息。
4.2.2 表的设置
创建表时也可以制定该表所使用的字符集与字符序
CREATE TABLE t1 ( ... )
CHARACTER SET latin1 COLLATE latin1_danish_ci;MySQL选择表的字符集与字符序的规则和数据库类似不同在于如果创建表时没有指定字符集与字符序就会使用变量character_set_database和 collation_database所指定的字符集与字符序。
4.2.3 字段的设置
表里的每个字段也可以拥有自己的字符集与字符序
CREATE TABLE t1
(col1 VARCHAR(5)CHARACTER SET latin1COLLATE latin1_german1_ci
);
ALTER TABLE t1 MODIFYcol1 VARCHAR(5)CHARACTER SET latin1COLLATE latin1_swedish_ci;与数据库和表类似MySQL也是按照层级来制定字符集与字符序的。
如果字段没有指定那么就是用表所使用的字符集与字符序。
4.2.4 小结
上面的几个小节中关于库表设计的字符集与字符序设置可以用下图来表示 上一层级如果没有指定字符集与字符序就是用下一层级的字符集与字符序。
4.3 客户端连接中的设置
当我们使用mysql这个客户端与MySQL服务器连接的时候也会涉及到字符集与字符序的设置。
4.3.1 与连接有关的变量
每一个连接到服务器的客户端都有一个对应的字符集与字符序。
涉及到的变量有
character_set_clientcharacter_set_connection, collation_connectioncharacter_set_results
这三个关于字符集的变量是这样使用的 即
客户端的语句从客户端出发时使用的字符集是character_set_client语句到达服务器时服务器将语句转换成character_set_connection字符集服务器执行完将结果返回给客户端时使用的是character_set_results字符集。
4.3.2 客户端连接字符集设置
当服务器使用的字符集与客户端连接使用的字符集不同时可能会有问题
MySQL [test] select title from article where id 2;
-------
| title |
-------
| ????? |
-------这时需要将客户端连接的字符集设置成与服务器保持一致。
SET NAMES utf8mb4;这样就可以了
MySQL [test] select title from article where id 2;
-----------------
| title |
-----------------
| 未命名项目 |
-----------------上面的语句等同于
SET character_set_client utf8mb4;
SET character_set_results utf8mb4;
SET character_set_connection utf8mb4;4.3.3 一些限制
在设置character_set_client变量时下面的字符集不可用
ucs2utf16utf16leutf32
否则就会报错
MySQL [test] set names utf16;
ERROR 1231 (42000): Variable character_set_client cant be set to the value of utf164.3.4 程序中连接的设置
使用数据库的程序也是一个客户端在连接数据库的时候也需要指定字符集。
Python
conn mysql.connect(host127.0.0.1,useruser,passwdpasswd,dbdb,charsetutf8)Golang:
dsn : root:roottcp(127.0.0.1 :3306)/DB_NAME?charsetutf8mb4
dbConn, _: sql.Open(mysql, dsn)5. MySQL对Unicode的支持
前面提到过一种包含所有语言所有字符的字符集Unicode它的码点分为两个部分
BMP(Basic Multilingual Plane): 基本多文种平面范围是0x0000到0xFFFF
补充平面Supplementary: 补充平面范围是0x10000到0x10FFFF。
5.1 BMP
BMP有如下的特点
范围是0x0000到0xFFFF一共65535个字符
可以编码成变长编码使用1到3个字节
也可以编码成定长编码使用2个字节
对于主要语言的大多数字符来说是足够了。
5.2 Supplementary
补充平面有如下的特点
范围是0x10000到0x10FFFF
编码所需的字节大于BMP需要4个字节。
5.3 MySQL的支持
MySQL中有几个字符集支持了Unicode
字符集支持的字符每个字符所需的存储大小备注utf8mb3, utf8BMP1、2或3个字节MySQL 8.0中已弃用ucs2BMP2个字节MySQL 8.0中已弃用utf8mb4BMP和Supplementary1、2、3或3个字节推荐使用utf16BMP和Supplementary2或4个字节utf16leBMP和Supplementary2或4个字节little-endian和utf16一样utf32BMP和Supplementary4个字节
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/927792.shtml
如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!