Protobuf vs CBOR:新一代的二进制序列化格式

开发 前端
Protobuf 是 Google 开发的一个二进制序列化格式,与 JSON 相比,Protobuf 的数据非常精简,甚至连数据的字段名都没有。

 [[386183]]

在以前的文章中,我们讲到了什么时候用 Yaml,什么时候用 JSON,什么时候用 Protobuf:

  • 人写机器读,用 Yaml
  • 机器写,人读,用 JSON
  • 机器写,机器读,用 JSON 或者 Protobuf

JSON 作为几乎每一个语言都支持的序列化格式,在很多地方都得到了广泛应用。但有个弊端,JSON 里面充斥了大量的大括号、中括号和双引号,导致冗余的字符太多,数据量非常大,在对传输速度有高要求的场景下,数据量越大,占用的传输带宽就越大,单位时间传输的数据也就越少。

Protobuf 是 Google 开发的一个二进制序列化格式,与 JSON 相比,Protobuf 的数据非常精简,甚至连数据的字段名都没有。例如有这样一段数据:

  1. a = {'name''kingname''salary': 99999, 'address''上海''skill': ['Python''爬虫''Golang']} 

如果用 Protobuf 来表示,那么数据的二进制形式是这样的:

这个二进制数据只有值,但没有字段名,所以要解析这些数据,必须在代码里面额外把字段名带上。所以需要定义一个xxx.proto文件,在里面标记每一个字段的信息。在任何时候任何语言中,需要序列化和反序列化的地方,都要提前使用protoc命令,基于这个.proto文件,生成一个xxx_pb2文件,通过从这个 xxx_pb2文件中导入数据对象来对数据进行处理。

因此,我们说,proto 格式,虽然确实精简了网络中的数据传输量,但却给开发者增加了相当大的工作量。

而最近,又新出来一种二进制序列化格式:CBOR,它的数据比 JSON 小,但是开发起来又比 Protobuf 简单得多。

我们来看看使用 CBOR 对上面的数据进行序列化操作。首先在 Python 中安装CBOR:

  1. python3 -m pip install cbor2 

安装完成以后,我们来对数据进行序列化:

  1. import cbor2 
  2. a = {'name''kingname''salary': 99999, 'address''上海''skill': ['Python''爬虫''Golang']} 
  3.  
  4. result = cbor2.dumps(a) 
  5. print(result) 

运行效果如下图所示:

注意,打印出来的是二进制数据,不是字符串。可以看到,数据是自带字段名的,字段名与值之间会有特殊的字符进行分割,CBOR 能够自动识别这些特殊符号,从而区分字段名和字段值。

经过我的测试,一个150MB 的大 JSON文件,读入到内存,然后重新通过 CBOR 序列化以后写文件,这个文件大小可以缩减到60MB 左右。虽然压缩比例不如 Protobuf,可读性不如 JSON;但是压缩比例比 JSON 高,可读性比 Protobuf 好,而且几乎不增加额外工作量。

大家在写微服务或者网站前后端通信的时候,可以考虑试一试 CBOR — Concise Binary Object Representation | Overview[1]。

参考资料

[1]CBOR — Concise Binary Object Representation | Overview: https://cbor.io/

 本文转载自微信公众号「未闻Code」,可以通过以下二维码关注。转载本文请联系未闻Code公众号。

 

责任编辑:武晓燕 来源: 未闻Code
相关推荐

2011-06-01 14:26:11

序列化

2022-09-05 08:12:28

Google二进制Protobuf

2015-06-30 10:00:44

Hyper虚拟化云计算

2009-02-27 09:37:33

Google二进制代码

2012-05-29 09:23:42

虚拟化微软私有云

2009-09-02 16:10:40

ADSL技术

2012-07-02 10:36:19

菲亚特

2022-03-10 16:01:29

Playwright开源

2011-12-31 09:31:57

Web

2010-02-07 15:50:33

Android手机

2011-12-31 11:22:50

Web新世界

2010-05-05 14:33:55

虚拟化

2010-10-13 15:45:23

MySQL二进制日志

2013-01-04 16:15:08

微软ERPDynamics AX

2016-01-26 11:58:12

2012-07-25 13:19:16

ibmdw

2024-01-23 12:27:15

2017-04-11 10:48:53

JS二进制

2018-10-22 14:37:16

二进制数据存储

2022-10-31 08:02:42

二进制计算乘法
点赞
收藏

51CTO技术栈公众号