Array UTF-16 Byte
JavaScript mengkodekan string sebagai UTF-16 , seperti C # UnicodeEncoding, jadi array byte harus sama persis dengan yang digunakan charCodeAt(), dan memisahkan setiap pasangan byte yang dikembalikan menjadi 2 byte terpisah, seperti di:
function strToUtf16Bytes(str) {
const bytes = [];
for (ii = 0; ii < str.length; ii++) {
const code = str.charCodeAt(ii);
bytes.push(code & 255, code >> 8);
}
return bytes;
}
Sebagai contoh:
strToUtf16Bytes('🌵');
Namun, Jika Anda ingin mendapatkan array byte UTF-8, Anda harus mentranskode byte tersebut.
Array UTF-8 Byte
Solusinya terasa agak tidak sepele, tetapi saya menggunakan kode di bawah ini dalam lingkungan produksi dengan lalu lintas tinggi dengan kesuksesan besar ( sumber asli ).
Juga, untuk pembaca yang tertarik, saya menerbitkan pembantu unicode saya yang membantu saya bekerja dengan panjang string yang dilaporkan oleh bahasa lain seperti PHP.
export function strToUtf8Bytes(str) {
const utf8 = [];
for (let ii = 0; ii < str.length; ii++) {
let charCode = str.charCodeAt(ii);
if (charCode < 0x80) utf8.push(charCode);
else if (charCode < 0x800) {
utf8.push(0xc0 | (charCode >> 6), 0x80 | (charCode & 0x3f));
} else if (charCode < 0xd800 || charCode >= 0xe000) {
utf8.push(0xe0 | (charCode >> 12), 0x80 | ((charCode >> 6) & 0x3f), 0x80 | (charCode & 0x3f));
} else {
ii++;
charCode = 0x10000 + (((charCode & 0x3ff) << 10) | (str.charCodeAt(ii) & 0x3ff));
utf8.push(
0xf0 | (charCode >> 18),
0x80 | ((charCode >> 12) & 0x3f),
0x80 | ((charCode >> 6) & 0x3f),
0x80 | (charCode & 0x3f),
);
}
}
return utf8;
}