From: Tanaka Akira Date: 2007-10-21T15:25:03+09:00 Subject: [ruby-dev:32113] pattern match with UTF-8 regexp and EUC-JP string. /./u という UTF-8 な 1文字を表現するパターンに EUC-JP な "\xa1\xa1" という 1文字な文字列をマッチさせたとき、"\241" と いう 1バイトにマッチします。 % ./ruby -ve 'p(/./u =~ "\xa1\xa1".force_encoding("euc-jp")); puts $&.dump' ruby 1.9.0 (2007-10-20 patchlevel 0) [i686-linux] 0 "\241" UTF-8 でも EUC-JP でもない "\241" という 1バイトが出てくるの はおかしいと思います。 パターンが UTF-8 であることを尊重して character encodings differ になるか、あるいは EUC-JP な 1文字にマッチするかどち らかが期待される動作だと思うのですが、どうでしょうか。 -- Tanaka Akira