OSDN Git Service

* Remove character convertions that are not defined in mappings
authorNARUSE, Yui <naruse@users.sourceforge.jp>
Mon, 21 Nov 2005 08:04:23 +0000 (08:04 +0000)
committerNARUSE, Yui <naruse@users.sourceforge.jp>
Mon, 21 Nov 2005 08:04:23 +0000 (08:04 +0000)
* Add --disable-cp932ext option (experimental)
* Add more strict input check for w_iconv()
* Add unicode_to_jis_common(), this was used w2e_conv and w16e_conv

nkf.c
utf8tbl.c

diff --git a/nkf.c b/nkf.c
index 06ca191..52493ef 100644 (file)
--- a/nkf.c
+++ b/nkf.c
@@ -39,9 +39,9 @@
 **        E-Mail: furukawa@tcp-ip.or.jp
 **    \e$B$^$G8fO"Mm$r$*4j$$$7$^$9!#\e(B
 ***********************************************************************/
-/* $Id: nkf.c,v 1.82 2005/11/07 22:38:08 naruse Exp $ */
+/* $Id: nkf.c,v 1.83 2005/11/20 23:04:23 naruse Exp $ */
 #define NKF_VERSION "2.0.5"
-#define NKF_RELEASE_DATE "2005-11-07"
+#define NKF_RELEASE_DATE "2005-11-21"
 #include "config.h"
 
 #define COPY_RIGHT \
 #define sizeof_utf8_to_euc_C2 64
 #define sizeof_utf8_to_euc_E5B8 64
 #define sizeof_utf8_to_euc_2bytes 112
-#define sizeof_utf8_to_euc_3bytes 112
+#define sizeof_utf8_to_euc_3bytes 16
 #endif
 
 /* MIME preprocessor */
@@ -312,6 +312,8 @@ STATIC  int     s_iconv PROTO((int c2,int c1,int c0));
 STATIC  int     s2e_conv PROTO((int c2, int c1, int *p2, int *p1));
 STATIC  int     e_iconv PROTO((int c2,int c1,int c0));
 #ifdef UTF8_INPUT_ENABLE
+STATIC  int     strict_mapping_f = TRUE;
+STATIC  int     disable_cp932ext_f = FALSE;
 STATIC  void    encode_fallback_html PROTO((int c));
 STATIC  void    encode_fallback_xml PROTO((int c));
 STATIC  void    encode_fallback_java PROTO((int c));
@@ -321,6 +323,7 @@ STATIC  void    (*encode_fallback)PROTO((int c)) = NULL;
 STATIC  int     w2e_conv PROTO((int c2,int c1,int c0,int *p2,int *p1));
 STATIC  int     w_iconv PROTO((int c2,int c1,int c0));
 STATIC  int     w_iconv16 PROTO((int c2,int c1,int c0));
+STATIC  int    unicode_to_jis_common PROTO((int c2,int c1,int c0,int *p2,int *p1));
 STATIC  int    w_iconv_common PROTO((int c1,int c0,const unsigned short *const *pp,int psize,int *p2,int *p1));
 STATIC  int     ww16_conv PROTO((int c2, int c1, int c0));
 STATIC  int     w16e_conv PROTO((unsigned short val,int *p2,int *p1));
@@ -481,7 +484,8 @@ STATIC int exec_f = 0;
 #endif
 
 #ifdef SHIFTJIS_CP932
-/* invert IBM extended characters to others and controls some UCS mapping */
+/* invert IBM extended characters to others
+   and controls some UCS mapping for Microsoft Code Page */
 STATIC int cp51932_f = TRUE;
 #define CP932_TABLE_BEGIN (0xfa)
 #define CP932_TABLE_END   (0xfc)
@@ -994,6 +998,8 @@ struct {
 #ifdef UTF8_INPUT_ENABLE
     {"utf8-input", "W"},
     {"utf16-input", "W16"},
+    {"disable-cp932ext", ""},
+    {"strict-mapping", ""},
 #endif
 #ifdef UNICODE_NORMALIZATION
     {"utf8mac-input", ""},
@@ -1085,8 +1091,9 @@ options(cp)
                     ms_ucs_map_f = TRUE;
 #endif
                    }else if(strcmp(codeset, "EUCJP") == 0 ||
-                            strcmp(codeset, "EUC-JP") == 0 ||
-                            strcmp(codeset, "CP51932") == 0){
+                            strcmp(codeset, "EUC-JP") == 0){
+                       input_f = JIS_INPUT;
+                   }else if(strcmp(codeset, "CP51932") == 0){
                        input_f = JIS_INPUT;
                        x0201_f = FALSE;
 #ifdef SHIFTJIS_CP932
@@ -1107,13 +1114,25 @@ options(cp)
 #ifdef UTF8_OUTPUT_ENABLE
                     ms_ucs_map_f = TRUE;
 #endif
+                   }else if(strcmp(codeset, "EUC-JP-ASCII") == 0 ||
+                            strcmp(codeset, "EUCJP-ASCII") == 0){
+                       input_f = JIS_INPUT;
+                       x0201_f = FALSE;
+#ifdef SHIFTJIS_CP932
+                    cp51932_f = FALSE;
+                    cp932inv_f = TRUE;
+#endif
+#ifdef UTF8_OUTPUT_ENABLE
+                    ms_ucs_map_f = FALSE;
+#endif
 #ifdef UTF8_INPUT_ENABLE
                    }else if(strcmp(codeset, "UTF-8") == 0 ||
                             strcmp(codeset, "UTF-8N") == 0 ||
                             strcmp(codeset, "UTF-8-BOM") == 0){
                        input_f = UTF8_INPUT;
 #ifdef UNICODE_NORMALIZATION
-                   }else if(strcmp(codeset, "UTF8-MAC") == 0){
+                   }else if(strcmp(codeset, "UTF8-MAC") == 0 ||
+                            strcmp(codeset, "UTF-8-MAC") == 0){
                        input_f = UTF8_INPUT;
                        nfc_f = TRUE;
 #endif
@@ -1152,8 +1171,9 @@ options(cp)
                     ms_ucs_map_f = TRUE;
 #endif
                    }else if(strcmp(codeset, "EUCJP") == 0 ||
-                            strcmp(codeset, "EUC-JP") == 0 ||
-                            strcmp(codeset, "CP51932") == 0){
+                            strcmp(codeset, "EUC-JP") == 0){
+                       output_conv = e_oconv;
+                   }else if(strcmp(codeset, "CP51932") == 0){
                        output_conv = e_oconv;
                        x0201_f = FALSE;
 #ifdef SHIFTJIS_CP932
@@ -1174,6 +1194,17 @@ options(cp)
 #ifdef UTF8_OUTPUT_ENABLE
                     ms_ucs_map_f = TRUE;
 #endif
+                   }else if(strcmp(codeset, "EUC-JP-ASCII") == 0 ||
+                            strcmp(codeset, "EUCJP-ASCII") == 0){
+                       output_conv = e_oconv;
+                       x0201_f = FALSE;
+                       x0212_f = TRUE;
+#ifdef SHIFTJIS_CP932
+                    cp51932_f = FALSE;
+#endif
+#ifdef UTF8_OUTPUT_ENABLE
+                    ms_ucs_map_f = FALSE;
+#endif
 #ifdef UTF8_OUTPUT_ENABLE
                    }else if(strcmp(codeset, "UTF-8") == 0){
                        output_conv = w_oconv;
@@ -1183,12 +1214,11 @@ options(cp)
                    }else if(strcmp(codeset, "UTF-8-BOM") == 0){
                        output_conv = w_oconv;
                        unicode_bom_f=2;
-                   }else if(strcmp(codeset, "UTF-16") == 0){
-                       output_conv = w_oconv16; 
                    }else if(strcmp(codeset, "UTF-16BE") == 0){
                        output_conv = w_oconv16; 
                        unicode_bom_f=1;
-                   }else if(strcmp(codeset, "UTF-16BE-BOM") == 0){
+                   }else if(strcmp(codeset, "UTF-16") == 0 ||
+                            strcmp(codeset, "UTF-16BE-BOM") == 0){
                        output_conv = w_oconv16; 
                        unicode_bom_f=2;
                    }else if(strcmp(codeset, "UTF-16LE") == 0){
@@ -1285,6 +1315,10 @@ options(cp)
                     internal_unicode_f = TRUE;
                     continue;
                 }
+                if (strcmp(long_option[i].name, "disable-cp932ext") == 0){
+                   disable_cp932ext_f = TRUE;
+                    continue;
+                }
                 if (strcmp(long_option[i].name, "fb-skip") == 0){
                    encode_fallback = NULL;
                     continue;
@@ -2729,33 +2763,21 @@ w2e_conv(c2, c1, c0, p2, p1)
     int    c2, c1, c0;
     int *p2, *p1;
 {
-    extern const unsigned short *const utf8_to_euc_2bytes[];
-    extern const unsigned short *const *const utf8_to_euc_3bytes[];
     int ret = 0;
 
-    if (0xc0 <= c2 && c2 <= 0xef) {
-        const unsigned short *const *pp;
-
-        if (0xe0 <= c2) {
-            if (c0 == 0) return -1;
-            pp = utf8_to_euc_3bytes[c2 - 0x80];
-            ret = w_iconv_common(c1, c0, pp, sizeof_utf8_to_euc_C2, p2, p1);
-        } else {
-            ret =  w_iconv_common(c2, c1, utf8_to_euc_2bytes, sizeof_utf8_to_euc_2bytes, p2, p1);
-        }
+    if (!c1){
+        *p2 = 0;
+        *p1 = c2;
+    }else if (0xc0 <= c2 && c2 <= 0xef) {
+       ret =  unicode_to_jis_common(c2, c1, c0, p2, p1);
 #ifdef NUMCHAR_OPTION
-        if (ret){
+        if (ret > 0){
             if (p2) *p2 = 0;
             if (p1) *p1 = CLASS_UTF16 | ww16_conv(c2, c1, c0);
             ret = 0;
         }
 #endif
-        return ret;
-    } else if (c2 == X0201) {
-        c1 &= 0x7f;
     }
-    if (p2) *p2 = c2;
-    if (p1) *p1 = c1;
     return ret;
 }
 
@@ -2766,12 +2788,13 @@ w_iconv(c2, c1, c0)
 {
     int ret = 0;
     
-    if (c0 == 0){
-       if (c2 == 0) /* 0x00-0x7f */
-           ; /* 1byte */
-       else if ((c2 & 0xe0) == 0xc0) /* 0xc0-0xdf */
-           ; /* 2ytes */
-       else if ((c2 & 0xf0) == 0xe0) /* 0xe0-0xef */
+    if (c2 == 0) /* 0x00-0x7f */
+       c1 &= 0x7F; /* 1byte */
+    else if (c0 == 0){
+       if ((c2 & 0xe0) == 0xc0){ /* 0xc0-0xdf */
+           /* 2ytes */
+           if((c2 & 0xFE) == 0xC0 || c1 < 0x80 || 0xBF < c1) return 0;
+       }else if ((c2 & 0xf0) == 0xe0) /* 0xe0-0xef */
            return -1; /* 3bytes */
 #ifdef __COMMENT__
        else if (0xf0 <= c2)
@@ -2780,8 +2803,20 @@ w_iconv(c2, c1, c0)
            return 0; /* trail byte */
 #endif
        else return 0;
-    }
-    if (c2 == EOF);
+    }else{
+       /* must be 3bytes */
+       if(c2 == 0xE0){
+           if(c1 < 0xA0 || 0xBF < c1 || c0 < 0x80 || 0xBF < c0)
+               return 0;
+       }else if(c2 == 0xED){
+           if(c1 < 0x80 || 0x9F < c1 || c0 < 0x80 || 0xBF < c0)
+               return 0;
+       }else if((c2 & 0xf0) == 0xe0){
+           if(c1 < 0x80 || 0xBF < c1 || c0 < 0x80 || 0xBF < c0)
+               return 0;
+       }else return 0;
+    }
+    if (c2 == 0 || c2 == EOF);
     else if (c2 == 0xef && c1 == 0xbb && c0 == 0xbf) {
        return 0; /* throw BOM */
 #if defined(UTF8_OUTPUT_ENABLE) && defined(UTF8_INPUT_ENABLE)
@@ -2829,7 +2864,9 @@ ww16_conv(c2, c1, c0)
      int c2, c1, c0;
 {
     unsigned short val;
-    if (c2 >= 0xe0){
+    if (c2 >= 0xf0){
+       val = -1;
+    }else if (c2 >= 0xe0){
         val = (c2 & 0x0f) << 12;
         val |= (c1 & 0x3f) << 6;
         val |= (c0 & 0x3f);
@@ -2847,34 +2884,37 @@ w16e_conv(val, p2, p1)
      unsigned short val;
      int *p2, *p1;
 {
-    extern const unsigned short *const utf8_to_euc_2bytes[];
-    extern const unsigned short *const *const utf8_to_euc_3bytes[];
     int c2, c1, c0;
-    const unsigned short *const *pp;
-    int psize;
     int ret = 0;
 
-    w16w_conv(val, &c2, &c1, &c0);
-    if (c1){
-        if (c0){
-            pp = utf8_to_euc_3bytes[c2 - 0x80];
-            psize = sizeof_utf8_to_euc_C2;
-            ret =  w_iconv_common(c1, c0, pp, psize, p2, p1);
-        }else{
-            pp = utf8_to_euc_2bytes;
-            psize = sizeof_utf8_to_euc_2bytes;
-            ret =  w_iconv_common(c2, c1, pp, psize, p2, p1);
-        }
+    if (val < 0x80){
+        *p2 = 0;
+        *p1 = val;
+    }else{
+       if(!ms_ucs_map_f){
+           /* eucJP-ascii */
+           switch(val){
+           case 0x203E:
+               *p2 = 0x21;
+               *p1 = 0x31;
+               return ret;
+               break;
+           case 0xFF5E:
+               *p2 = 0x8F22;
+               *p1 = 0x37;
+               return ret;
+               break;
+           }
+       }
+       w16w_conv(val, &c2, &c1, &c0);
+       ret =  unicode_to_jis_common(c2, c1, c0, p2, p1);
 #ifdef NUMCHAR_OPTION
-        if (ret){
-            *p2 = 0;
-            *p1 = CLASS_UTF16 | val;
-            ret = 0;
-        }
+       if (ret > 0){
+           *p2 = 0;
+           *p1 = CLASS_UTF16 | val;
+           ret = 0;
+       }
 #endif
-    }else{
-        *p2 = 0;
-        *p1 = c2;
     }
     return ret;
 }
@@ -2910,6 +2950,91 @@ w_iconv16(c2, c1, c0)
 }
 
 int
+unicode_to_jis_common(c2, c1, c0, p2, p1)
+    int c2, c1, c0;
+    int *p2, *p1;
+{
+    extern const unsigned short *const utf8_to_euc_2bytes[];
+    extern const unsigned short *const *const utf8_to_euc_3bytes[];
+    int ret = 0;
+
+    if(c2 < 0xe0){
+       if (ms_ucs_map_f && cp51932_f){
+           /* CP932/CP51932: U+00A6 (BROKEN BAR) -> not 0x8fa2c3, but 0x7c */
+           if(c2 == 0xC2 && c1 == 0xA6){
+               if (p2) *p2 = 0;
+               if (p1) *p1 = 0x7C;
+               return 0;
+           }
+       }else if(strict_mapping_f){
+           switch(c2){
+           case 0xC2:
+               switch(c1){
+               case 0xAB: case 0xAD: case 0xB2: case 0xB3:
+               case 0xB5: case 0xB7: case 0xB9: case 0xBB:
+                   return 1;
+               }
+               break;
+           case 0xC3:
+               switch(c1){
+               case 0x90:
+                   return 1;
+               }
+               break;
+           }
+       }
+       ret =  w_iconv_common(c2, c1, utf8_to_euc_2bytes, sizeof_utf8_to_euc_2bytes, p2, p1);
+    }else if(c0){
+       if(!ms_ucs_map_f){
+           /* eucJP-ascii */
+           if(c2 == 0xE2 && c1 == 0x80 && c0 == 0xBE){
+               if (p2) *p2 = 0x21;
+               if (p1) *p1 = 0x31;
+               return ret;
+           }else if(c2 == 0xEF && c1 == 0xBD && c0 == 0x9E){
+               if (p2) *p2 = 0x8F22;
+               if (p1) *p1 = 0x37;
+               return ret;
+           }
+       }
+       if(!strict_mapping_f);
+       else if(ms_ucs_map_f && cp51932_f){
+           /* Microsoft Code Page */
+           switch(c2){
+           case 0xE2:
+               switch(c1){
+               case 0x80:
+                   switch(c0){
+                   case 0x94: case 0x96: case 0xBE:
+                       return 1;
+                   }
+                   break;
+               case 0x88:
+                   if(c0 == 0x92)
+                       return 1;
+                   break;
+               }
+               break;
+           case 0xE3:
+               switch(c1){
+               case 0x80:
+                   if(c0 == 0x9C)
+                       return 1;
+                   break;
+               }
+               break;
+           }
+       }else{
+           /* eucJP-open */
+           if(c2 == 0xE3 && c1 == 0x82 && c0 == 0x94)
+               return 1;
+       }
+       ret = w_iconv_common(c1, c0, utf8_to_euc_3bytes[c2 - 0xE0], sizeof_utf8_to_euc_C2, p2, p1);
+    }else return -1;
+    return ret;
+}
+
+int
 w_iconv_common(c1, c0, pp, psize, p2, p1)
     int    c1,c0;
     const unsigned short *const *pp;
@@ -2920,13 +3045,6 @@ w_iconv_common(c1, c0, pp, psize, p2, p1)
     const unsigned short *p;
     unsigned short val;
 
-    /* CP932/CP51932: U+00A6 (BROKEN BAR) -> not 0x8fa2c3, but 0x7c */
-    if (ms_ucs_map_f && cp51932_f && c1 == 0xC2 && c0 == 0xA6){
-       if (p2) *p2 = 0;
-       if (p1) *p1 = 0x7C;
-       return 0;
-    }
-
     if (pp == 0) return 1;
 
     c1 -= 0x80;
@@ -2938,7 +3056,10 @@ w_iconv_common(c1, c0, pp, psize, p2, p1)
     if (c0 < 0 || sizeof_utf8_to_euc_E5B8 <= c0) return 1;
     val = p[c0];
     if (val == 0) return 1;
-    if (!ms_ucs_map_f && (val <= 0xFF || (c1 >= 0x40 && val & 0x8000))) return 1;
+    if (disable_cp932ext_f && (
+       (val>>8) == 0x2D || /* disable NEC special characters */
+       val > 0xF300 /* disable NEC special characters */
+       )) return 1;
 
     c2 = val >> 8;
     if (val & 0x8000){
@@ -3081,6 +3202,9 @@ e2w_conv(c2, c1)
         p = euc_to_utf8_1byte;
 #ifdef X0212_ENABLE
     } else if (c2 >> 8 == 0x8f){
+       if(!ms_ucs_map_f && c2 == 0x8F22 && c1 == 0x43){
+           return 0xA6;
+       }
         extern const unsigned short *const x0212_to_utf8_2bytes[];
         c2 = (c2&0x7f) - 0x21;
         if (0<=c2 && c2<sizeof_euc_to_utf8_2bytes)
@@ -5258,7 +5382,6 @@ usage()
     fprintf(stderr," --jis,--euc,--sjis,--utf8,--utf16,--mime,--base64  convert for the code\n");
     fprintf(stderr," --hiragana, --katakana    Hiragana/Katakana Conversion\n");
     fprintf(stderr," --x0212                   Convert JISX0212\n");
-    fprintf(stderr," --cp932, --no-cp932       CP932 compatibility\n");
     fprintf(stderr," --prefix=    Insert escape before troublesome characters of Shift_JIS\n");
 #ifdef INPUT_OPTION
     fprintf(stderr," --cap-input, --url-input  Convert hex after ':' or '%%'\n");
@@ -5273,9 +5396,6 @@ usage()
     fprintf(stderr," --fb-{skip, html, xml, perl, java, subchar}\n");
     fprintf(stderr,"                   set the way nkf handles unassigned characters\n");
 #endif
-#ifdef UTF8_OUTPUT_ENABLE
-    fprintf(stderr," --ms-ucs-map      Microsoft UCS Mapping Compatible\n");
-#endif
 #ifdef OVERWRITE
     fprintf(stderr," --overwrite       Overwrite original listed files by filtered result\n");
 #endif
index 1293414..57f707d 100644 (file)
--- a/utf8tbl.c
+++ b/utf8tbl.c
@@ -4,8 +4,8 @@
 const unsigned short euc_to_utf8_A1[] = {
          0x3000, 0x3001, 0x3002, 0xFF0C, 0xFF0E, 0x30FB, 0xFF1A,
  0xFF1B, 0xFF1F, 0xFF01, 0x309B, 0x309C, 0x00B4, 0xFF40, 0x00A8,
- 0xFF3E, 0xFFE3, 0xFF3F, 0x30FD, 0x30FE, 0x309D, 0x309E, 0x3003,
- 0x4EDD, 0x3005, 0x3006, 0x3007, 0x30FC, 0x2015, 0x2010, 0xFF0F,
+ 0xFF3E, 0x203E, 0xFF3F, 0x30FD, 0x30FE, 0x309D, 0x309E, 0x3003,
+ 0x4EDD, 0x3005, 0x3006, 0x3007, 0x30FC, 0x2014, 0x2010, 0xFF0F,
  0xFF3C, 0x301C, 0x2016, 0xFF5C, 0x2026, 0x2025, 0x2018, 0x2019,
  0x201C, 0x201D, 0xFF08, 0xFF09, 0x3014, 0x3015, 0xFF3B, 0xFF3D,
  0xFF5B, 0xFF5D, 0x3008, 0x3009, 0x300A, 0x300B, 0x300C, 0x300D,
@@ -2382,7 +2382,7 @@ const unsigned short utf8_to_euc_C2[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
0x0E20, 0xA242, 0x2171, 0x2172, 0xA270,   0x5C, 0xA243, 0x2178,
     0, 0xA242, 0x2171, 0x2172, 0xA270,   0x5C, 0xA243, 0x2178,
  0x212F, 0xA26D, 0xA26C, 0x2263, 0x224C,   0x2D, 0xA26E, 0xA234,
  0x216B, 0x215E,   0x32,   0x33, 0x212D, 0x264C, 0x2279, 0x2126,
  0xA231,   0x31, 0xA26B, 0x2264,      0,      0,      0, 0xA244,
@@ -2489,8 +2489,8 @@ const unsigned short utf8_to_euc_E280[] = {
 };
 const unsigned short utf8_to_euc_E284[] = {
       0,      0,      0, 0x216E,      0,      0,      0,      0,
-      0, 0x2B37,      0,      0,      0,      0,      0,      0,
-      0,      0,      0, 0x2B31,      0,      0, 0x2D62,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
+      0,      0,      0,      0,      0,      0, 0x2D62,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0, 0x2D64, 0xA26F,      0,      0,      0,      0,      0,
       0,      0,      0, 0x2272,      0,      0,      0,      0,
@@ -2503,9 +2503,9 @@ const unsigned short utf8_to_euc_E285[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
  0x2D35, 0x2D36, 0x2D37, 0x2D38, 0x2D39, 0x2D3A, 0x2D3B, 0x2D3C,
- 0x2D3D, 0x2D3E, 0x2A2B, 0x2A2C,      0,      0,      0,      0,
+ 0x2D3D, 0x2D3E,      0,      0,      0,      0,      0,      0,
  0xF373, 0xF374, 0xF375, 0xF376, 0xF377, 0xF378, 0xF379, 0xF37A,
- 0xF37B, 0xF37C, 0x2A3F, 0x2A40,      0,      0,      0,      0,
+ 0xF37B, 0xF37C,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E286[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
@@ -2518,12 +2518,12 @@ const unsigned short utf8_to_euc_E286[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E287[] = {
-      0,      0,      0,      0, 0x2C4E, 0x2C4F, 0x2C4D,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0, 0x224D,      0, 0x224E,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0, 0x2C52, 0x2C53,
0x2C51, 0x2C54,      0,      0,      0,      0,      0,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
     0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
@@ -2574,17 +2574,7 @@ const unsigned short utf8_to_euc_E291[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
  0x2D21, 0x2D22, 0x2D23, 0x2D24, 0x2D25, 0x2D26, 0x2D27, 0x2D28,
  0x2D29, 0x2D2A, 0x2D2B, 0x2D2C, 0x2D2D, 0x2D2E, 0x2D2F, 0x2D30,
- 0x2D31, 0x2D32, 0x2D33, 0x2D34, 0x293F, 0x2940, 0x2941, 0x2942,
- 0x2943, 0x2944, 0x2945, 0x2946, 0x2947, 0x2948, 0x2949, 0x294A,
-};
-const unsigned short utf8_to_euc_E292[] = {
- 0x294B, 0x294C, 0x294D, 0x294E, 0x294F, 0x2950, 0x2951, 0x2952,
- 0x2972, 0x2973, 0x2974, 0x2975, 0x2976, 0x2977, 0x2978, 0x2979,
- 0x297A,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0, 0x2A5D, 0x2A5E, 0x2A5F, 0x2A60,
- 0x2A61, 0x2A62, 0x2A63, 0x2A64, 0x2A65, 0x2A66, 0x2A67, 0x2A68,
- 0x2A69, 0x2A6A, 0x2A6B, 0x2A6C, 0x2A6D, 0x2A6E, 0x2A6F, 0x2A70,
- 0x2A71, 0x2A72, 0x2A73, 0x2A74, 0x2A75, 0x2A76,      0,      0,
+ 0x2D31, 0x2D32, 0x2D33, 0x2D34,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E294[] = {
@@ -2629,40 +2619,30 @@ const unsigned short utf8_to_euc_E297[] = {
 };
 const unsigned short utf8_to_euc_E298[] = {
       0,      0,      0,      0,      0, 0x217A, 0x2179,      0,
-      0,      0,      0,      0,      0,      0, 0x2C36,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0, 0x2C4A, 0x2C4B, 0x2C49, 0x2C4C,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-};
-const unsigned short utf8_to_euc_E299[] = {
- 0x216A,      0, 0x2169,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
- 0x2C25, 0x2C23, 0x2C24, 0x2C26, 0x2C21, 0x2C27, 0x2C28, 0x2C22,
-      0,      0, 0x2276,      0,      0, 0x2275,      0, 0x2274,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
-const unsigned short utf8_to_euc_E29D[] = {
+const unsigned short utf8_to_euc_E299[] = {
+ 0x216A,      0, 0x2169,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
+      0,      0, 0x2276,      0,      0, 0x2275,      0, 0x2274,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0, 0x295D, 0x295E,
- 0x295F, 0x2960, 0x2961, 0x2962, 0x2963, 0x2964, 0x2965,      0,
 };
 const unsigned short utf8_to_euc_E380[] = {
- 0x2121, 0x2122, 0x2123, 0x2137, 0x2C37, 0x2139, 0x213A, 0x213B,
+ 0x2121, 0x2122, 0x2123, 0x2137,      0, 0x2139, 0x213A, 0x213B,
  0x2152, 0x2153, 0x2154, 0x2155, 0x2156, 0x2157, 0x2158, 0x2159,
  0x215A, 0x215B, 0x2229, 0x222E, 0x214C, 0x214D,      0,      0,
       0,      0,      0,      0, 0x2141, 0x2D60,      0, 0x2D61,
0x2C35,      0,      0,      0,      0,      0,      0,      0,
     0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
@@ -2681,7 +2661,7 @@ const unsigned short utf8_to_euc_E382[] = {
  0x2460, 0x2461, 0x2462, 0x2463, 0x2464, 0x2465, 0x2466, 0x2467,
  0x2468, 0x2469, 0x246A, 0x246B, 0x246C, 0x246D, 0x246E, 0x246F,
  0x2470, 0x2471, 0x2472, 0x2473, 0x2574,      0,      0,      0,
-      0, 0x0E5E, 0x0E5F, 0x212B, 0x212C, 0x2135, 0x2136,      0,
+      0,      0,      0, 0x212B, 0x212C, 0x2135, 0x2136,      0,
       0, 0x2521, 0x2522, 0x2523, 0x2524, 0x2525, 0x2526, 0x2527,
  0x2528, 0x2529, 0x252A, 0x252B, 0x252C, 0x252D, 0x252E, 0x252F,
  0x2530, 0x2531, 0x2532, 0x2533, 0x2534, 0x2535, 0x2536, 0x2537,
@@ -2694,8 +2674,8 @@ const unsigned short utf8_to_euc_E383[] = {
  0x2558, 0x2559, 0x255A, 0x255B, 0x255C, 0x255D, 0x255E, 0x255F,
  0x2560, 0x2561, 0x2562, 0x2563, 0x2564, 0x2565, 0x2566, 0x2567,
  0x2568, 0x2569, 0x256A, 0x256B, 0x256C, 0x256D, 0x256E, 0x256F,
- 0x2570, 0x2571, 0x2572, 0x2573, 0x2574, 0x2575, 0x2576, 0x2F4B,
0x2F4C, 0x2F4D, 0x2F4E, 0x2126, 0x213C, 0x2133, 0x2134,      0,
+ 0x2570, 0x2571, 0x2572, 0x2573, 0x2574, 0x2575, 0x2576,      0,
     0,      0,      0, 0x2126, 0x213C, 0x2133, 0x2134,      0,
 };
 const unsigned short utf8_to_euc_E388[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
@@ -2703,64 +2683,54 @@ const unsigned short utf8_to_euc_E388[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0, 0x2D22, 0x2D23, 0x2D24, 0x2D25, 0x2D26, 0x2D27,
- 0x2D21, 0x2D6A, 0x2D6B, 0x2D34, 0x2D30, 0x2D35, 0x2D33, 0x2D29,
- 0x2D39, 0x2D6C, 0x2D2D, 0x2D32, 0x2D36, 0x2D37, 0x2D2F, 0x2D38,
-};
-const unsigned short utf8_to_euc_E389[] = {
- 0x2D28,      0, 0x2D2A, 0x2D2B,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
+      0, 0x2D6A, 0x2D6B,      0,      0,      0,      0,      0,
+      0, 0x2D6C,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E38A[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0, 0x2D79,      0,
0x2D7B, 0x2D7E,      0,      0,      0, 0x2D7A, 0x2D7C,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
     0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0, 0x2D65, 0x2D66, 0x2D67, 0x2D68,
- 0x2D69, 0x2D78,      0,      0,      0,      0,      0,      0,
+ 0x2D69,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E38C[] = {
0x2E3F,      0,      0, 0x2D46,      0, 0x2E26,      0,      0,
     0,      0,      0, 0x2D46,      0,      0,      0,      0,
       0,      0,      0,      0,      0, 0x2D4A,      0,      0,
-      0,      0,      0,      0, 0x2D41, 0x2E2C, 0x2E25,      0,
- 0x2D44,      0,      0,      0,      0,      0, 0x2E40,      0,
+      0,      0,      0,      0, 0x2D41,      0,      0,      0,
+ 0x2D44,      0,      0,      0,      0,      0,      0,      0,
       0,      0, 0x2D42, 0x2D4C,      0,      0, 0x2D4B, 0x2D45,
-      0,      0, 0x2E41, 0x2D4D,      0,      0,      0,      0,
-      0, 0x2E42,      0, 0x2E27,      0,      0, 0x2D47,      0,
-      0, 0x2E30,      0, 0x2D4F,      0,      0,      0,      0,
+      0,      0,      0, 0x2D4D,      0,      0,      0,      0,
+      0,      0,      0,      0,      0,      0, 0x2D47,      0,
+      0,      0,      0, 0x2D4F,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E38D[] = {
-      0,      0, 0x2E33,      0,      0,      0,      0, 0x2E43,
-      0, 0x2D40, 0x2D4E,      0,      0, 0x2D43, 0x2E28,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
+      0, 0x2D40, 0x2D4E,      0,      0, 0x2D43,      0,      0,
       0, 0x2D48,      0,      0,      0,      0,      0, 0x2D49,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0, 0x2D5F, 0x2D6F, 0x2D6E, 0x2D6D, 0x2E7C,
+      0,      0,      0, 0x2D5F, 0x2D6F, 0x2D6E, 0x2D6D,      0,
 };
 const unsigned short utf8_to_euc_E38E[] = {
-      0,      0,      0,      0,      0, 0x2B3B, 0x2B3C, 0x2B3D,
+      0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0, 0x2D53, 0x2D54,
- 0x2B3A,      0,      0,      0,      0,      0, 0x2B2F, 0x2B30,
- 0x2B32,      0,      0,      0, 0x2D50, 0x2D51, 0x2D52, 0x2B22,
- 0x2B24, 0x2D56, 0x2B2A,      0, 0x2B25, 0x2B28,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
- 0x2B36, 0x2B35, 0x2B34, 0x2B33,      0,      0,      0,      0,
+      0,      0,      0,      0, 0x2D50, 0x2D51, 0x2D52,      0,
+      0, 0x2D56,      0,      0,      0,      0,      0,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
 const unsigned short utf8_to_euc_E38F[] = {
       0,      0,      0,      0, 0x2D55,      0,      0,      0,
-      0,      0,      0, 0x2B39,      0, 0x2D63,      0,      0,
-      0,      0,      0,      0, 0x2B38,      0,      0,      0,
+      0,      0,      0,      0,      0, 0x2D63,      0,      0,
+      0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
@@ -6017,26 +5987,6 @@ const unsigned short utf8_to_euc_EFA8[] = {
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
 };
-const unsigned short utf8_to_euc_EFB8[] = {
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
- 0x7545, 0x753D,      0, 0x7532,      0, 0x754A, 0x754B, 0x7550,
- 0x7551, 0x754C, 0x754D, 0x755A, 0x755B, 0x7554, 0x7555, 0x7552,
-};
-const unsigned short utf8_to_euc_EFB9[] = {
- 0x7553, 0x7556, 0x7557, 0x7558, 0x7559,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-      0,      0,      0,      0,      0,      0,      0,      0,
-};
 const unsigned short utf8_to_euc_EFBC[] = {
       0, 0x212A, 0xF42A, 0x2174, 0x2170, 0x2173, 0x2175, 0xF429,
  0x214A, 0x214B, 0x2176, 0x215C, 0x2124, 0x215D, 0x2125, 0x213F,
@@ -6082,10 +6032,10 @@ const unsigned short *const utf8_to_euc_E2[] = {
  utf8_to_euc_E284, utf8_to_euc_E285, utf8_to_euc_E286, utf8_to_euc_E287,
  utf8_to_euc_E288, utf8_to_euc_E289, utf8_to_euc_E28A,                0,
  utf8_to_euc_E28C,                0,                0,                0,
-                0, utf8_to_euc_E291, utf8_to_euc_E292,                0,
+                0, utf8_to_euc_E291,                0,                0,
  utf8_to_euc_E294, utf8_to_euc_E295, utf8_to_euc_E296, utf8_to_euc_E297,
  utf8_to_euc_E298, utf8_to_euc_E299,                0,                0,
-                0, utf8_to_euc_E29D,                0,                0,
+                0,                0,                0,                0,
                 0,                0,                0,                0,
                 0,                0,                0,                0,
                 0,                0,                0,                0,
@@ -6098,7 +6048,7 @@ const unsigned short *const utf8_to_euc_E2[] = {
 const unsigned short *const utf8_to_euc_E3[] = {
  utf8_to_euc_E380, utf8_to_euc_E381, utf8_to_euc_E382, utf8_to_euc_E383,
                 0,                0,                0,                0,
- utf8_to_euc_E388, utf8_to_euc_E389, utf8_to_euc_E38A,                0,
+ utf8_to_euc_E388,                0, utf8_to_euc_E38A,                0,
  utf8_to_euc_E38C, utf8_to_euc_E38D, utf8_to_euc_E38E, utf8_to_euc_E38F,
                 0,                0,                0,                0,
                 0,                0,                0,                0,
@@ -6236,7 +6186,7 @@ const unsigned short *const utf8_to_euc_EF[] = {
                 0,                0,                0,                0,
                 0,                0,                0,                0,
                 0,                0,                0,                0,
utf8_to_euc_EFB8, utf8_to_euc_EFB9,                0,                0,
               0,                0,                0,                0,
  utf8_to_euc_EFBC, utf8_to_euc_EFBD, utf8_to_euc_EFBE, utf8_to_euc_EFBF,
 };
 const unsigned short *const utf8_to_euc_2bytes[] = {
@@ -6270,30 +6220,6 @@ const unsigned short *const utf8_to_euc_2bytes[] = {
               0,              0,              0,              0,
 };
 const unsigned short *const *const utf8_to_euc_3bytes[] = {
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
-              0,              0,              0,              0,
               0,              0, utf8_to_euc_E2, utf8_to_euc_E3,
  utf8_to_euc_E4, utf8_to_euc_E5, utf8_to_euc_E6, utf8_to_euc_E7,
  utf8_to_euc_E8, utf8_to_euc_E9,              0,              0,
@@ -7474,7 +7400,7 @@ const unsigned short shiftjis_x0212[3][189] = {
 const unsigned short x0212_shiftjis_A2[] = {
          0x819F,      0,      0,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,
-      0, 0x8143,      0,      0, 0x8150,      0,      0,      0,
+      0, 0x8143,      0,      0, 0x8150,      0,      0, 0x8160,
       0,      0,      0,      0,      0,      0,      0,      0,
       0,      0,   0x21, 0xFA55,      0,      0,      0,      0,
       0,      0,      0,      0,      0,      0,      0,      0,