文字コード総合スレ part8 [sc](★0)
-
- 1
- 2012/11/30(金) 13:16:02.46
-
プログラマーなら一度は煩わされたことのある文字コードについてのスレ。
UTF-8、ShiftJIS、JIS、EUC、Uincode、 UCS、サロゲートペア、コードポイント、文字コード判定、
合成文字、ソート、TRON、外字コード、その他について語り合いましょう。
各言語での文字列の扱いについての質問もOKです。
基本マッターリ、ささ、茶でもどうぞ。
■過去スレ
文字コード総合スレ part1 http://pc11.2ch.net/test/read.cgi/tech/1031028205/
文字コード総合スレ part2 http://pc11.2ch.net/test/read.cgi/tech/1143375639/
文字コード総合スレ part3 http://pc11.2ch.net/test/read.cgi/tech/1180250376/
文字コード総合スレ part4 http://pc11.2ch.net/test/read.cgi/tech/1228052369/
(スレ再利用)UnicodeとUTF-8の違いは? http://pc12.2ch.net/test/read.cgi/tech/1177930957/
(隔離スレ)UnicodeとUTF-8の違いは? その2 http://pc12.2ch.net/test/read.cgi/tech/1274937437/
文字コード総合スレ part5 http://pc12.2ch.net/test/read.cgi/tech/1236529563/
文字コード総合スレ part6 http://hibari.2ch.net/test/read.cgi/tech/1278923059/
文字コード総合スレ part7 http://toro.2ch.net/test/read.cgi/tech/1306595564/
-
- 2
- 2012/11/30(金) 13:19:29.05
-
待ってたよ!
http://www.youtube.com/watch?v=oFt9z2b2BVQ
-
- 3
- 2012/11/30(金) 14:18:38.86
-
■参考サイト
Unicode Home Page
http://www.unicode.org/
Java Character Encodings
http://www.ingrid.org/java/i18n/encoding/
euc.JP: tech docs, BeOS tools
http://euc.jp/
ISO-IR - 2.8.1 Coding systems with Standard return
http://www.itscj.ipsj.or.jp/ISO-IR/2-8-1.htm
ISO-IR - 2.8.2 Coding Systems without Standard return
http://www.itscj.ipsj.or.jp/ISO-IR/2-8-2.htm
IANA: Character Sets
http://www.iana.org/assignments/character-sets
Legacy Encoding Project
http://sourceforge.jp/projects/legacy-encoding/
CP50220
森山さんの説明
http://lists.sourceforge.jp/mailman/archives/legacy-encoding-talk-ja/2006-March/000002.html
JISX4061
日本語文字列照合順番
http://www.jisc.go.jp/
-
- 4
- 2012/11/30(金) 14:19:08.83
-
■これまでに行われた議論
・WinでCP50220 は Unicode からマルチバイト文字への変換でいわゆる半角カタカナを全角カタカナに置き換え
内部的には Unicode -> CP932 -> CP5022x って変換な気もする
・人名をソートかけたらバストサイズ順の並びになる?
・Shift JIS や EUC-JP や Big5 や GB なんかをUnicode に変換してしまうと、ラウンドトリップは保証されるか
・単一情報をソースの文字コード(or 言語)情報なしに元に戻したい (統計的に文字の出現確率なんかを調べる)
・PC-98x1シリーズのMS-DOSはShift_JISだが漢字ROMはJIS、変換は何処で行っていた?
・0x5cをUnicodeにするときにバックスラッシュに置き換えるか円マークに置き換えるかで、逆変換時に結果が変わるの問題
・丸付き数字は機種依存文字か?。MSIME2007ではCP932に収録されてない文字は「環境依存文字」って表示。
Macではフォントによっては表示されないし、フォントによっては表示される
・Shift_JISと名乗っているCP932やISO-2022-JPと名乗っているCP50220を表示(Unicodeに変換)する際に
機種依存文字はサポートされるか?
・Safari文字コード変換のバグは
・Microsoft文字コード変換のバグは
・U+31F0..U+31FF(アイヌ語表記用小書きカタカナ)が入ってない件
・なぜ携帯業界はunicode化しないのか?
・このスレへの書き込みはブラウザが2chへ送り出す時点でUnicodeからShift_JISに変換しているのか
・文字化けに強いishフォーマットでエロ画像を交換する場合、ssより、s7のほうが化けにくい
-
- 5
- 2012/11/30(金) 14:19:56.25
-
・中国語の簡体字では、へんやつくりが簡略化されるなら、その文字も自動的に簡略化して表記する国家規格が有る
・中国語の「噁心」簡化政策によると「恶(U+6076)」に統一。口偏+恶(U+6076)は普通に使われているがUnicodeにはない
・日本人のニーズが満たせないのも確かなので原規格分離(中国では「曾→曽」は簡体字と繁体字の違いとはみなされていないとか)
・UNICODEを扱うプログラムはサロゲートをぶったぎられた入力が渡されてくる場合にも備えろって→YES
・UnicodeとUTF-8の違いは?
・日本のCJK Ext.D Submissionに{魚針}が含まれてる件
U+9C75(魚箴)は強烈。いくら何でも違いすぎる。(魚針)
ひょっとしたら後で実は別字だったとか日本では異体字だが中国では別字とかになるかも知れんぞ。
中国ではってレベルじゃねーぞ。
・Windows Vista での「IME パッド - 文字一覧」の「JIS X 0213 (1面)」のバグ
UTF-16: 0x304B 0x309A → Unicode: U+FD61809A (間違い) (ISO/IEC10646はU+10FFFFまで)
サロゲートペアからコードポイントを引き出す計算を無理やり適用(間違い)
((0x304B - 0xD800) << 10) + (0x309A - 0xDC00) + 0x10000が 0xFD61809A になる。
・文字コードではインドカレーは飲み物か否か。カレーパンうまうま。
・CJK混在の漢字環境ってどうやって、切り分ければいいの? → ムリです。
・Winzipで保存されるファイル名が文字化け→zipではコードページ情報が無い。直接zipファイルから切り出せ
・Unicodeは言語情報を直接扱わない。 多言語の混在表現は(unicodeでは)できないか
・Unicode文字列リストを各国言語を考慮してソートしたいんですが → ムリです。
・Unicodeサニタイズが面倒になるのか
-
- 6
- 2012/11/30(金) 14:20:29.23
-
・SJISとUNICODEの判別はどのようにすればいいですか?BOM。無ければ、統計判断。 ライブラリを使うが吉
・ところでケータイのUnicode対応度って実際どうよ? → ウンコマークもUnicodeに追加されるんだな。
・WindowsXP で フォルダに使用できないフォルダ名はどうやって判定
→ ちょっとアホな方法だけど、%TEMP% フォルダの下で実際に作ってみて。本当に作成できるかどうかで判断。
・TwitterのWebインターフェイスからだと、サロゲートペアは2文字としてカウント。140字打てない 。
・Unicode 5.2で追加されたUnicodeSMP(第1面)、Unicode 5.1で未定義だったSMPのコードポイントや第15、第16面が
Windows7では表示されない。 → 和田研細丸ゴシック2004ARIBはARIB外字を含んでいる。
・WindowsXP SP3でMicrosoftのJIS2004フォント環境でサロゲートペア文字が表示されない。→
コントロールパネル-地域と言語のオプション-[言語]タブで
「複合文字や右から左方向に書く言語 (タイ語を含む) のファイルをインストールする」にチェック
・URLの%で続く2桁の0-9、A-Fへの変換は、UTF-8→urlencodeによる。RFC1738を嫁。
・菊紋、桐紋、葵紋などは文字か?海栗コードへの挿入は難しい。そこでTRONだ!!
・元号を安置する場所はJIS第三で確保済み。ウニコードでブロックを確保は政治力次第。
・元号は個人名ではない。特定の時間軸基準に数える年号を漢字で指す文字。
陛下の崩御後必ずしも元号が追号になるわけではない。むしろ違う場合が多い。昭和54年法律43号の元号法参照。
・文末でなければ"0"+ASCII7ビット、文末なら"1"+ASCII7ビットというエンコード。 → ヌル1バイトが貴重な時代からの負の遺産。
・Windows7出荷時に未定義だったコードポイントはフォント入れても豆腐になる。Unicode5.2は表示しない。欝だ。
・Unicode6ドラフトでPILE_OF_POO文字確定。ウニコードがもはやイミフ。SerifとSans-Serifで幅に違いは出る?
・shift-jisからUTF-8変換でサイズ1.5倍。でも圧縮すれば平均10%増加程度。用途に合わせて使うべし。
・「wchar_tは>849の嫁。>849の許可無くしてUTF16だの32だの無理矢理突っ込むのは許さん。」
・電子演算機では文字化けなんて飾りです。UTF-8/UTF16の人にはそれがわからんのですよ。
-
- 7
- 2012/11/30(金) 14:28:31.92
-
テンプレ乙でござるよ
-
- 8
- 2012/11/30(金) 15:02:44.42
-
もうひとつの過去スレ:
文字コード統一スレ 1文字目
http://pc8.2ch.net/test/read.cgi/tech/1109171258/
隔離スレ:
UnicodeとUTF-8の違いは?
http://pc12.2ch.net/test/read.cgi/tech/1177930957/
UnicodeとUTF-8の違いは? その2
http://hibari.2ch.net/test/read.cgi/tech/1274937437/
UnicodeとUTF-8の違いは? その2
http://toro.2ch.net/test/read.cgi/tech/1291075205/
UnicodeとUTF-8の違い4(インディアン隔離スレ)
http://toro.2ch.net/test/read.cgi/tech/1342963035/
-
- 9
- 2012/11/30(金) 15:13:16.40
-
■ライブラリ
IBM Globalization - ICU
http://www-306.ibm.com/software/globalization/icu/
NKF32.DLL
http://www.vector.co.jp/soft/win95/util/se020949.html
http://www1.ttcn.ne.jp/~kaneto/dll/nkf32dll.html
バベル
http://tricklib.com/cxx/ex/babel/
バベルの文字コード判定で使ってる日本語文書内での各文字の出現頻度データです。
http://tricklib.com/cxx/ex/babel/scoremap.csv
mlang
http://msdn.microsoft.com/ja-jp/library/aa767865(en-us).aspx
iconv
http://www.gnu.org/software/libiconv/
ICU
http://www.icu-project.org/
-
- 10
- 2012/11/30(金) 15:14:10.43
-
■単語一覧
・UTF-16は16ビット単位にエンコードするけど、サロゲートペアがある
表現できる文字空間はUTF-8と同じく20ビットとちょっと
・丸付き数字は機種依存文字か?MSIME2007ではCP932に収録されてない文字は「環境依存文字」って表示。
MacJapaneseではフォントによっては表示されないし、フォントによっては表示される。
今のMac(内部Unicodeアプリ)は、フォント依存ではなくアプリ依存。
似非ISO-2022-JPや似非Shift_JISのドキュメント中の丸付き数字は、
素直にAppleのAPIを使ってるアプリならゲタ(U+FFFD)になる。
・Mail.appではISO-2022-JPに収まらずCP932に収まるメールは、含まれる字種によって
charset=CP932で送信される場合とISO-2022-JP(もどき)で送信される場合がある
・MSでのウニコードとSJIS変換のバグ。
U+007E TILDE <-> Shift_JIS 0x7E OVERLINE
U+301C WAVE DASH -> Shift_JIS NA 【MSの問題】
U+FF5E FULLWIDTH TILDE <-> Shift_JIS 0x8160 WAVE DASH 【MSの問題】
・SafariでのウニコードとSJIS変換のバグ。
U+007E TILDE -> Shift_JIS 0x8160 WAVE DASH 【Safariの問題】
U+301C WAVE DASH <-> Shift_JIS 0x8160 WAVE DASH
U+FF5E FULLWIDTH TILDE <-> Shift_JIS NA
・winzipの規格ではファイル名のコードページ指定もしくは記録情報が存在しない。
解決策:取り合えず、MSWin+JPではShift-jisでファイル自体には保存されている。
MACOSX=Unicode,Unix=UTF/EUC/S-JISどれでもありえる。文字に関係なくLocalLangで
再変換しているので、それをしなければよい。
・charlenでの文字列長の判定はプラットフォームにより返り値が違う(機種依存文字等)。マニュアル嫁。
・JISのエスケープシーケンスが正しく認識されない本文とか。
'0x1b, 0x24, 0x42' という3バイトを先頭に、'0x1b, 0x28, 0x42' を末尾に追加汁。
あるいはhttp://masaka.dw.land.to/mr/jmr.phpとか。
-
- 11
- 2012/11/30(金) 15:15:50.02
-
JTC1/SC2/WG2 - ISO/IEC 10646 - UCS
http://std.dkuug.dk/JTC1/SC2/WG2/
ISO/IEC JTC1/SC2/WG2/IRG
Ideographic Rapporteur Group
http://appsrv.cse.cuhk.edu.hk/~irg/
日本の委員 (JSC2)
http://www.itscj.ipsj.or.jp/meibo/020000.pdf
-
- 12
- 2012/11/30(金) 18:18:17.85
-
スレ立てサンキュ
-
- 13
- 2012/12/03(月) 21:21:23.27
-
西夏文字、女文字、インダス文字、女真文字なんかはまだなんだな。
日本や中国の研究者頑張れ。
-
- 14
- 2012/12/03(月) 23:51:37.30
-
ところでさ、U+1F5FEの日本列島絵文字なんだけど、
例示図形に普通に北方四島が入ってるんだよね。
これロシアとかからクレームなかったのかな。
あるいは、奄美と沖縄が単独の点として描かれてるのに
北方四島が本土とくっついてるのはあえてどうとでも解釈できるようにしたごまかし?
でも佐渡とか壱岐対馬はそもそも存在さえ描かれてないわけで、なんかちょっと変。
では、そもそもの元になったと思われるau絵文字#214「地図」ではどうだったのかと見てみたら、
なんと日本領部分は「本土4島だけ」のシンプルなものだった。
ここからどういう経緯で北方四島と奄美沖縄が加わったんだろう。
-
- 15
- 2012/12/04(火) 01:09:59.61
-
>>14
日本列島という島の絵文字であって、日本という国の絵文字じゃないということだと思う。
でないと、国旗の絵文字でアレだけ揉めたのと整合性がつかなくなる。
-
- 16
- 2012/12/04(火) 03:19:38.20
-
ただ、国境以外の理由で4島と千島を区切る理屈ってのもちょっとなさそうなのよね
-
- 17
- 2012/12/04(火) 05:19:19.05
-
南樺太も日本です
台湾も日本です
-
- 18
- 2012/12/04(火) 06:09:50.32
-
U+1F5FCが固有名詞的な「東京タワー」じゃなくて「電波塔」という曖昧な名前で規格化する案もあったことを考えると
U+1F5FEも「弧状列島」とか表現されることになっていてもおかしくなかったかも
-
- 19
- 2012/12/04(火) 09:09:38.01
-
尖閣諸島を入れて欲しかった
-
- 20
- 2012/12/04(火) 09:45:40.17
-
>>18
まあ、MOYAIさんが通った時点でそのへん曖昧だよね。
これに自由の女神と並ぶレベルの公共性なんてないと思うw
-
- 21
- 2012/12/04(火) 19:17:25.01
-
>>20
あれって元の携帯絵文字ではモアイ像そのものの姿で描かれてるんだし (文字名はモヤイ像なのに)、
「モアイ像」として入れたほうがユニヴァーサリティがあって良かったんじゃないかと思うんだけど
まあ渋谷とかの意味で使われる絵文字として解釈できなくなるからやっぱダメか
-
- 22
- 2012/12/04(火) 20:12:50.27
-
あるいは新島
-
- 23
- 2012/12/04(火) 23:23:51.55
-
>>21
> あれって元の携帯絵文字ではモアイ像そのものの姿で描かれてるんだし
まじだ……一体どうなってるんだこれ
-
- 24
- 2012/12/14(金) 13:36:10.61
-
http://slashdot.jp/~yasuoka/journal/559968/
>JTC1/SC2/WG2/IRG N1883
>(大正新脩大蔵経「外字」のISO/IEC 10646追加提案)
これ結局、日本提案から外されたのね
-
- 25
- 2012/12/19(水) 21:05:28.98
-
>>5
>・Unicodeは言語情報を直接扱わない。 多言語の混在表現は(unicodeでは)できないか
ISO2022なら楽勝でできる多スクリプトの混合表記がunicodeではできないってスクリプトレベル
の問題を、多言語問題にすりかえるなよ
言語情報が中国語でも、それを日本漢字で表記しても何も問題はない
それどころか、日本の漢文の教科書では、言語は中国語だが、字体は日本の教科書体で表記
しないといけないっての
-
- 26
- 2012/12/19(水) 22:53:11.62
-
正則漢文は中国語ではない
-
- 27
- 2012/12/19(水) 23:54:59.27
-
>>25
文書そのものの言語よりむしろユーザーが理解可能なスクリプトの方が重要、
なのかなあ。
とりあえず自分のお仕事では、文書の言語情報が中国語だったら中国語のフォントを
割り当てるようにしてますけどw
例えばOSの言語設定を優先するようにしたりとかしたら... って?
...ちょっと無理かなw (ちょっと持田香織を意識してみた)
現実問題として例えば普通の日本語フォントは中国語の簡体とか持ってないから、
下手にやるとつぎはぎの脅迫文状態になってしまう。そういうのでも見たいかな?
-
- 28
- 2012/12/20(木) 00:26:57.58
-
漢字のフォントって今も全部手作業で作ってるの?
偏旁の情報流し込んだらざーっとバリエーションつくってくれて、細部だけ手修正、みたいな感じなら
せっかくだから和文で使わない文字も全部含めてくれればいいのに。クオリティ落ちてもいいからさ。
-
- 29
- 2012/12/20(木) 05:39:55.98
-
じゃあおまえがやれよ
-
- 30
- 2012/12/20(木) 09:22:41.68
-
e漢字というプロジェクトがあってだな
-
- 31
- 2012/12/20(木) 10:30:33.04
-
つまんね
-
- 32
- 2012/12/20(木) 11:52:51.57
-
結局GlyphWikiみたいに人肉制作が一番成果物につながりやすいのかな
-
- 33
- 2012/12/20(木) 19:09:10.91
-
Glyphwikiは曲線を実現する方法が改善されたら無敵かも。
-
- 34
- 2012/12/20(木) 19:33:32.32
-
現状のGlyphWikiで作った記号とかネタレベルだもんな。
-
- 35
- 2012/12/20(木) 21:08:27.21
-
花園は非漢字だけ別のフォントから借りてきた方がいいと思うんだけど
明朝だとなかなか選択肢がないのかな
-
- 36
- 2012/12/21(金) 22:43:08.51
-
IPA明朝丸取りで良いやん。
-
- 37
- 2012/12/28(金) 22:20:50.30
-
さて年の瀬なわけだが
-
- 38
- 2012/12/28(金) 22:38:05.25
-
年の瀬くらい、おとなしくしてなさい
このページを共有する
おすすめワード