Архив сообщества
2011 — 2019
Аватар tizit

кодировкопроблемы

Автор: tizit · 07.08.2015, 20:56 · 6 сообщений

Сообщений в теме: 6

tizit#1

Есть лог из какой-то там темы.

http://pastebin.ca/3089864

Есть сайт, который неплохо умеет чинить кодировку.

http://2cyr.com/decode/?lang=ru

На сайте написано, что исходная кодировка этого текста windows - 1251, что правда. И-ии, я пытался вдуплить, что может произойти с текстом, чтобы он из 1251 стал кракозябрами, но так и не понял. Вот вопрос, короче.

Скопировать ссылку
tizit#3

Но смотри. Если взять текст из этого пастбина, вставить в чинилку кодировки, он найдёт правильный вариант. И мне стало интересно, что происходит с исходными байтами, чтобы они так изменились, и что потом делает этот сайт, чтобы вернуть их обратно. Сам я пока не понял.

Скопировать ссылку
tizit#5

Охуеть, я раскодировал.

Делал на питоне. Взял текст, и сделал ему encode из iso-8859-1, он стал байтами, а потом сделал decode в cp-1251. Мда.

Причина в том, что автоопределители кодировок распознают текст на кириллице, как текст на iso-8859-1. А 8859-1 содержит в себе символы румынского и прочих европейских языков.

А если ещё глубже, то вот эта вот паста в байтах прекрасно кодируется как в 1251, так и в 8851-1, не вызывая ошибок.

Скопировать ссылку

Обратно в Свободное общение