文字コード総合スレ part8 [sc] | レス10-61

■ このスレッドは過去ログ倉庫に格納されています

1 2012/11/30(金) 13:16:02.46

プログラマーなら一度は煩わされたことのある文字コードについてのスレ。
UTF-8、ShiftJIS、JIS、EUC、Uincode、 UCS、サロゲートペア、コードポイント、文字コード判定、
合成文字、ソート、TRON、外字コード、その他について語り合いましょう。
各言語での文字列の扱いについての質問もOKです。
基本マッターリ、ささ、茶でもどうぞ。

■過去スレ
文字コード総合スレ part1 http://pc11.2ch.net/test/read.cgi/tech/1031028205/
文字コード総合スレ part2 http://pc11.2ch.net/test/read.cgi/tech/1143375639/
文字コード総合スレ part3 http://pc11.2ch.net/test/read.cgi/tech/1180250376/
文字コード総合スレ part4 http://pc11.2ch.net/test/read.cgi/tech/1228052369/
（スレ再利用）UnicodeとUTF-8の違いは？ http://pc12.2ch.net/test/read.cgi/tech/1177930957/
（隔離スレ）UnicodeとUTF-8の違いは？　その2 http://pc12.2ch.net/test/read.cgi/tech/1274937437/
文字コード総合スレ part5 http://pc12.2ch.net/test/read.cgi/tech/1236529563/
文字コード総合スレ part6 http://hibari.2ch.net/test/read.cgi/tech/1278923059/
文字コード総合スレ part7 http://toro.2ch.net/test/read.cgi/tech/1306595564/

ここまで見た

10 2012/11/30(金) 15:14:10.43: ■単語一覧
・UTF-16は16ビット単位にエンコードするけど、サロゲートペアがある
　表現できる文字空間はUTF-8と同じく20ビットとちょっと
・丸付き数字は機種依存文字か？MSIME2007ではCP932に収録されてない文字は「環境依存文字」って表示。
　MacJapaneseではフォントによっては表示されないし、フォントによっては表示される。
今のMac（内部Unicodeアプリ）は、フォント依存ではなくアプリ依存。
似非ISO-2022-JPや似非Shift_JISのドキュメント中の丸付き数字は、
素直にAppleのAPIを使ってるアプリならゲタ（U+FFFD）になる。
・Mail.appではISO-2022-JPに収まらずCP932に収まるメールは、含まれる字種によって
　charset=CP932で送信される場合とISO-2022-JP（もどき）で送信される場合がある
・MSでのウニコードとSJIS変換のバグ。
　U+007E TILDE <-> Shift_JIS 0x7E OVERLINE
　U+301C WAVE DASH -> Shift_JIS NA 【MSの問題】
　U+FF5E FULLWIDTH TILDE <-> Shift_JIS 0x8160 WAVE DASH 【MSの問題】
・SafariでのウニコードとSJIS変換のバグ。
　U+007E TILDE -> Shift_JIS 0x8160 WAVE DASH 【Safariの問題】
　U+301C WAVE DASH <-> Shift_JIS 0x8160 WAVE DASH
　U+FF5E FULLWIDTH TILDE <-> Shift_JIS NA
・winzipの規格ではファイル名のコードページ指定もしくは記録情報が存在しない。
　解決策：取り合えず、MSWin+JPではShift-jisでファイル自体には保存されている。
　MACOSX=Unicode,Unix=UTF/EUC/S-JISどれでもありえる。文字に関係なくLocalLangで
　再変換しているので、それをしなければよい。
・charlenでの文字列長の判定はプラットフォームにより返り値が違う（機種依存文字等）。マニュアル嫁。
・JISのエスケープシーケンスが正しく認識されない本文とか。
　'0x1b, 0x24, 0x42' という3バイトを先頭に、'0x1b, 0x28, 0x42' を末尾に追加汁。
　あるいはhttp://masaka.dw.land.to/mr/jmr.phpとか。

ここまで見た

11 2012/11/30(金) 15:15:50.02: JTC1/SC2/WG2 - ISO/IEC 10646 - UCS
http://std.dkuug.dk/JTC1/SC2/WG2/

ISO/IEC JTC1/SC2/WG2/IRG
Ideographic Rapporteur Group
http://appsrv.cse.cuhk.edu.hk/~irg/

日本の委員 (JSC2)
http://www.itscj.ipsj.or.jp/meibo/020000.pdf

ここまで見た

12 2012/11/30(金) 18:18:17.85: スレ立てサンキュ

ここまで見た

13 2012/12/03(月) 21:21:23.27: 西夏文字、女文字、インダス文字、女真文字なんかはまだなんだな。
日本や中国の研究者頑張れ。

ここまで見た

14 2012/12/03(月) 23:51:37.30: ところでさ、U+1F5FEの日本列島絵文字なんだけど、
例示図形に普通に北方四島が入ってるんだよね。
これロシアとかからクレームなかったのかな。

あるいは、奄美と沖縄が単独の点として描かれてるのに
北方四島が本土とくっついてるのはあえてどうとでも解釈できるようにしたごまかし？
でも佐渡とか壱岐対馬はそもそも存在さえ描かれてないわけで、なんかちょっと変。

では、そもそもの元になったと思われるau絵文字#214「地図」ではどうだったのかと見てみたら、
なんと日本領部分は「本土4島だけ」のシンプルなものだった。
ここからどういう経緯で北方四島と奄美沖縄が加わったんだろう。

ここまで見た

15 2012/12/04(火) 01:09:59.61: >>14
日本列島という島の絵文字であって、日本という国の絵文字じゃないということだと思う。
でないと、国旗の絵文字でアレだけ揉めたのと整合性がつかなくなる。

ここまで見た

16 2012/12/04(火) 03:19:38.20: ただ、国境以外の理由で4島と千島を区切る理屈ってのもちょっとなさそうなのよね

ここまで見た

17 2012/12/04(火) 05:19:19.05: 南樺太も日本です
台湾も日本です

ここまで見た

18 2012/12/04(火) 06:09:50.32: U+1F5FCが固有名詞的な「東京タワー」じゃなくて「電波塔」という曖昧な名前で規格化する案もあったことを考えると
U+1F5FEも「弧状列島」とか表現されることになっていてもおかしくなかったかも

ここまで見た

19 2012/12/04(火) 09:09:38.01: 尖閣諸島を入れて欲しかった

ここまで見た

20 2012/12/04(火) 09:45:40.17: >>18
まあ、MOYAIさんが通った時点でそのへん曖昧だよね。

これに自由の女神と並ぶレベルの公共性なんてないと思うｗ

ここまで見た

21 2012/12/04(火) 19:17:25.01: >>20
あれって元の携帯絵文字ではモアイ像そのものの姿で描かれてるんだし (文字名はモヤイ像なのに)、
「モアイ像」として入れたほうがユニヴァーサリティがあって良かったんじゃないかと思うんだけど
まあ渋谷とかの意味で使われる絵文字として解釈できなくなるからやっぱダメか

ここまで見た

22 2012/12/04(火) 20:12:50.27: あるいは新島

ここまで見た

23 2012/12/04(火) 23:23:51.55: >>21
> あれって元の携帯絵文字ではモアイ像そのものの姿で描かれてるんだし

まじだ……一体どうなってるんだこれ

ここまで見た

24 2012/12/14(金) 13:36:10.61: http://slashdot.jp/~yasuoka/journal/559968/
＞JTC1/SC2/WG2/IRG N1883
＞(大正新脩大蔵経「外字」のISO/IEC 10646追加提案)

これ結局、日本提案から外されたのね

ここまで見た

25 2012/12/19(水) 21:05:28.98: >>5
>・Unicodeは言語情報を直接扱わない。多言語の混在表現は（unicodeでは）できないか

ISO2022なら楽勝でできる多スクリプトの混合表記がunicodeではできないってスクリプトレベル
の問題を、多言語問題にすりかえるなよ

言語情報が中国語でも、それを日本漢字で表記しても何も問題はない

それどころか、日本の漢文の教科書では、言語は中国語だが、字体は日本の教科書体で表記
しないといけないっての

ここまで見た

26 2012/12/19(水) 22:53:11.62: 正則漢文は中国語ではない

ここまで見た

27 2012/12/19(水) 23:54:59.27: >>25
文書そのものの言語よりむしろユーザーが理解可能なスクリプトの方が重要、
なのかなあ。

とりあえず自分のお仕事では、文書の言語情報が中国語だったら中国語のフォントを
割り当てるようにしてますけどw
例えばOSの言語設定を優先するようにしたりとかしたら... って?
...ちょっと無理かなw （ちょっと持田香織を意識してみた）

現実問題として例えば普通の日本語フォントは中国語の簡体とか持ってないから、
下手にやるとつぎはぎの脅迫文状態になってしまう。そういうのでも見たいかな?

ここまで見た

28 2012/12/20(木) 00:26:57.58: 漢字のフォントって今も全部手作業で作ってるの？

偏旁の情報流し込んだらざーっとバリエーションつくってくれて、細部だけ手修正、みたいな感じなら
せっかくだから和文で使わない文字も全部含めてくれればいいのに。クオリティ落ちてもいいからさ。

ここまで見た

29 2012/12/20(木) 05:39:55.98: じゃあおまえがやれよ

ここまで見た

30 2012/12/20(木) 09:22:41.68: e漢字というプロジェクトがあってだな

ここまで見た

31 2012/12/20(木) 10:30:33.04: つまんね

ここまで見た

32 2012/12/20(木) 11:52:51.57: 結局GlyphWikiみたいに人肉制作が一番成果物につながりやすいのかな

ここまで見た

33 2012/12/20(木) 19:09:10.91: Glyphwikiは曲線を実現する方法が改善されたら無敵かも。

ここまで見た

34 2012/12/20(木) 19:33:32.32: 現状のGlyphWikiで作った記号とかネタレベルだもんな。

ここまで見た

35 2012/12/20(木) 21:08:27.21: 花園は非漢字だけ別のフォントから借りてきた方がいいと思うんだけど
明朝だとなかなか選択肢がないのかな

ここまで見た

36 2012/12/21(金) 22:43:08.51: IPA明朝丸取りで良いやん。

ここまで見た

37 2012/12/28(金) 22:20:50.30: さて年の瀬なわけだが

ここまで見た

38 2012/12/28(金) 22:38:05.25: 年の瀬くらい、おとなしくしてなさい

ここまで見た

39 2012/12/29(土) 21:59:11.75: 年の瀬だから、いいじゃん

ここまで見た

40 2012/12/30(日) 14:27:54.18: こんなの始まってた
www.ipa.go.jp/about/kobo/tender-20121228-2/
>今回、変体仮名⽂字の字形を調達し、今後のフォント拡張及び文字符号の国際標準化の
>素材として使用するものとする。

変体仮名の符号化が動き出したか