CBOR (Concise Binary Object Representation en anglais) est un format d'échange de données informatiques d'utilisation générale pouvant être utilisé pour le stockage ou le transfert de données. C'est un format binaire de sérialisation de données dont les types sont inspirés du JSON permettant de représenter des structures de données simples et des tableaux associatifs, et d'étendre le format à d'autres types. L'objectif de ce format est de produire une forme binaire concise et extensible sans négociation de version de format.
Spécification
La spécification du CBOR[3] est disponible dans la RFC 8949[2].
Premier octet
Les types sont regroupés en 8 types majeurs dont le numéro est codé sur 3 bits :
- 0 = entier positif ou non signé,
- 1 = entier négatif,
- 2 = chaîne d'octets,
- 3 = chaîne de caractères,
- 4 = tableau,
- 5 = tableau associatif ou dictionnaire,
- 6 = étiquette (tag),
- 7 = type simple (booléen, null, autre) et nombre à virgule flottante.
Les 5 bits restant[4] du premier octet sont utilisés pour indiquer soit la valeur (si elle est comprise entre 0 et 23) ou le nombre d'octets qui suivent :
- de 0 à 23, il s'agit de la représentation de la valeur ou de la longueur pour les chaînes et les tableaux simples ou associatifs,
- de 24 à 27, il s'agit du nombre d'octets qui suivent (24 = 1 octet, 25 = 2 octets, 26 = 4 octets, 27 = 8 octets) contenant la valeur ou la taille,
- de 28 à 30, valeurs réservées pour un usage futur,
- selon le type majeur, la valeur 31 peut être réservée pour indiquer le début ou la fin d'une structure de taille indéterminée à l'avance.
Les types composés (tableaux simples, tableaux associatifs, chaînes de caractères ou d'octets) peuvent être encodés en spécifiant le nombre d'éléments avant le contenu, ou bien en mode non déterminé à l'avance en utilisant une valeur spéciale indiquant la fin.
Simples
Le code 7 réunit les valeurs simples.
| Valeur | Signification |
|---|---|
| 20 | true |
| 21 | false |
| 22 | nul |
| 23 | non défini |
| 31 | break |
Entiers
Les entiers (types 0 et 1) ainsi que les longueurs sont encodés sur 1 à 4 octets en big-endian.
Un entiers positifs ou nuls peut prendre les valeurs de 0 à . Un entier négatif peut prendre les valeurs de à -1. Pour les entiers négatifs la valeur écrite est égale à . Ainsi la valeur -500 sera écrite 0b001_11001 (entier négatif sur 2 octets) suivi de 0x01f3 (valeur 499).
Flottants
Les nombres flottants utilisent le code 7 et la valeur
- 25 suivit d’un flottant encodé en IEEE 754 sur 2 octets
- 26 suivit d’un flottant encodé en IEEE 754 sur 4 octets
- 27 suivit d’un flottant encodé en IEEE 754 sur 8 octets
Chaînes d’octets et de caractères
Une chaîne commence par indiquer le nombre d’octets dans la chaîne. Les textes doivent être encodés en UTF-8 sans octet nul final. Aucun échappement de caractères (comme \n, \t ou \" en JSON) n’est nécessaire.
Tableau
Un tableau est une suite de valeurs. Chaque valeur peut être d’un type différent. Un tableau commence par indiquer sa longueur puis chaque valeur est encodée séparément en CBOR (type + valeur).
Dans le tableau associatif, les valeurs vont par paires et sont nommées clé-valeur. Contrairement à d’autres format, la clé n’est pas obligatoirement un texte : la clé et la valeur peuvent utiliser n’importe quel type CBOR.
Longueur indéterminée
Pour les chaînes et les tableaux, le numéro de type peut être suivi de la valeur spéciale 31 (dans le premier octet). Un tableau se poursuit jusqu’à un objet de type 7 et de valeur 31 (0xFF) nommé « break ».
Une chaîne de caractères de longueur indéterminée sera écrite comme une liste de petits morceaux de textes de tailles connues suivit d’un objet break.
5F -- Texte de longueur indéfinie
45 -- Texte de longueur 5
48656C6C6F -- "Hello"
43 -- Texte de longueur 2
2021 -- " !"
FF -- break
Extensibilité
Le type majeur étiquette permet d'étendre le format en indiquant quelle est l'interprétation à donner à l'item qui suit. Par exemple, le tag 0 précède une chaîne de caractères représentant une date et une heure au format standard. Il existe des tags pour les UUID, les données au format Base64, les fractions, les expressions régulières, l'absence de valeur, etc.
L'assignation des numéros fait l'objet d'un enregistrement de l'IANA[5].
Implémentations
Différentes bibliothèques implémentent le format CBOR[6]. Il existe également des outils relatifs à ce format, notamment pour valider les données au format CBOR[7].
Références
- ↑ (en) « Media Types », sur IANA, (consulté le )
- 1 2 (en) Request for comments no 8949
- ↑ (en) « Specification Version 1.0 », sur cbor.io (consulté le )
- ↑ (en) « RFC8949 section 3 », sur datatracker.ietf.org (consulté le )
- ↑ (en) « Concise Binary Object Representation (CBOR) Tags », sur iana.org (consulté le )
- ↑ (en) « Implementations », sur cbor.io (consulté le )
- ↑ (en) « Tools », sur cbor.io (consulté le )