多字节与UTF-8、 Unicode之间的转换
VC中Ansi、 Unicode、 UTF8字符串之间的转换和写入文本
An si字符串我们最熟悉英文占一个字节汉字2个字节 以一个\0结尾常用于txt文本文件
Unicode字符串每个字符(汉字、英文字母)都占2个字节 以2个连续的\0结尾 NT操作系统内核用的是这种字符串常被定义为typedef unsigned short wchar_t;所以我们有时常会见到什么char*无法转换为unsigned short*之类的错误其实就是unicode
UTF8是Unicode一种压缩形式英文A在unicode中表示为0x0041 老外觉得这种存储方式太浪费因为浪费了50%的空间于是就把英文压缩成1个字节成了u tf8编码但是汉字在u tf8中占3个字节显然用做中文不如a ns i合算这就是中国的网页用作a n s i编码而老外的网页常用utf8的原因。
UTF8在还游戏里运用的很广泛 比如WOW的lua脚本等
下面来说一下转换主要用代码来说明吧
写文件我用了CFi le类其实用FILE*之类的也是一样写文件和字符串什么类别没有关系硬件只关心数据和长度
Ansi转Unicode
介绍2种方法void CConvertDlg: :OnBnCl ickedButtonAnsiToUnicode()
{
//ansi to unicodechar*szAnsi="abcd1234你我他";
//预转换得到所需空间的大小int wcsLe n =: :MultiByteToWideChar(CP_ACP, NULL, szAnsi , strlen(szAnsi), NULL,
0);
//分配空间要给'\0'留个空间 MultiByteToWideChar不会给'\0'空间wchar_t*wszString=newwchar_t[wcsLen+1];
//转换
: :MultiByteToWideChar(CP_ACP,NULL,szAnsi ,strlen(szAnsi),wszSt ring,wcsLen);
//最后加上'\0'wszString[wcsLen]='\0';
//unicode版的MessageBoxAPI
: :MessageBoxW(GetSafeHwnd(),wszString,wszString,MB_OK);
//接下来写入文本
//写文本文件头2个字节0xfeff低位0xff写在前
CFi lecFi le;cFi le.Open(_T("1 .txt"),CFi le: :modeWrite|CFi le: :modeCreate);
//文件开头cFi le.SeekToBegin();cFi le.Write("\xff\xfe",2);
//写入内容cFi le.Write(wszString,wcsLen*sizeof(wchar_t));cFi le.Flush();cFi le.Close();delete[]wszString;wszSt ring=NULL;
//方法2
//设置当前地域信息不设置的话使用这种方法 中文不会正确显示
//需要#include<locale.h>setlocale(LC_CTYPE, "chs");wchar_t wcsStr[100];
//注意下面是大写S在unicode中代表后面是ansi字符串
//swprintf是sprintf的unicode版本
//格式的前面要加大写L代表是unicodeswprintf(wcsStr, L"%S",szAns i);
: :MessageBoxW(GetSafeHwnd(),wcsStr,wcsStr,MB_OK);
}
Unicode转Ansi
也是2种方法void CConvertDlg: :OnBnCl ickedButtonUnicodeToAnsi()
{
//unicode to ansiwchar_t*wszString=L"abcd1234你我他";
//预转换得到所需空间的大小这次用的函数和上面名字相反int ansiLen =: :WideCharToMultiByte(CP_ACP, NULL,wszString,wcslen(wszString),NULL,0,NULL,NULL);
//同上分配空间要给'\0'留个空间char*szAnsi=newchar[ansiLen+1];
//转换
//unicode版对应的strlen是wcslen
: :WideCharToMultiByte(CP_ACP, NULL, wszString, wcslen(wszSt ring), szAnsi ,ansiLen,NULL,NULL);
//最后加上'\0'szAnsi[ansiLen]='\0' ;
//Ansi版的MessageBoxAPI
: :MessageBoxA(GetSafeHwnd(),szAnsi ,szAnsi ,MB_OK);
//接下来写入文本
//写文本文件 ANSI文件没有BOM
CFi lecFi le;cFi le.Open(_T("1.txt"),CFi le: :modeWrite|CFi le: :modeCreate);
//文件开头cFi le.SeekToBegin();
//写入内容cFi le.Write(szAnsi ,ansiLen*sizeof(char));cFi le.Flush();cFi le.Close();delete[]szAnsi ;szAnsi=NULL;
//方法2
//和上面一样有另一种方法setlocale(LC_CTYPE, "chs");char szStr[100];
//注意下面是大写在ansi中代表后面是unicode字符串
//sprintfsprintf(szStr, "%S",wszSt ring);
: :MessageBoxA(GetSafeHwnd(),szStr,szStr,MB_OK);
}
Unicode转UTF8void CConvertDlg: :OnBnCl ickedButtonUnicodeToU8()
{
//unicode to UTF8wchar_t*wszString=L"abcd1234你我他";
//预转换得到所需空间的大小这次用的函数和上面名字相反int u 8Len =: :WideCharToMultiByte(CP_UTF8, NULL,wszSt ring,wcslen(wszString),NULL,0,NULL,NULL);
//同上分配空间要给'\0'留个空间
//UTF8虽然是Unicode的压缩形式但也是多字节字符串所以可以以char的形式保存char*szU8=new char[u8Len+1];
//转换
//unicode版对应的strlen是wcslen
: :WideCharToMultiByte(CP_UTF8,NULL,wszSt ring,wcslen(wszString), szU8, u8Len,NULL,NULL);
//最后加上'\0'szU8[u8Len]='\0' ;
//MessageBox不支持UTF8,所以只能写文件
//接下来写入文本
//写文本文件 UTF8的BOM是0xbfbbef
CFi lecFi le;cFi le.Open(_T("1 .txt"),CFi le: :modeWrite|CFi le: :modeCreate);
//文件开头cFi le.SeekToBegin();
//写BOM 同样低位写在前cFi le.Write("\xef\xbb\xbf",3);
//写入内容cFi le.Write(szU8, u8Len*sizeof(char));cFi le.Flush();cFi le.Close();delete[]szU8;szU8=NULL;
}
UTF8转UNICO DEvoid CConvertDlg: :OnBnCl ickedButtonU8ToUnicode()
{
//UTF8 to Unicode
//由于中文直接复制过来会成乱码编译器有时会报错故采用16进制形式char*szU8="abcd 1234\xe4\xbd\xa0\xe6\x88\x91\xe4\xbb\x96\x00";
//预转换得到所需空间的大小int wcsLen=: :MultiByteToWideChar(CP_UTF8,NULL,szU8,strlen(szU8),NULL,0);//分配空间要给'\0'留个空间 MultiByteToWideChar不会给'\0'空间wchar_t*wszString=newwchar_t[wcsLen+1];
//转换
: :MultiByteToWideChar(CP_UTF8,NULL,szU8,strlen(szU8),wszString,wcsLen);//最后加上'\0'wszString[wcsLen]='\0';
//unicode版的MessageBoxAPI
: :MessageBoxW(GetSafeHwnd(),wszString,wszString,MB_OK);
//写文本同ansi to unicode
}
An si转换utf8和utf8转换An si就是上面2个的结合把u n icod e作为中间量进行2次转换即可
#include<iostream>
#include<string>
#include<Windows.h>using namespace std;
void unicodeToUTF8(constwstring&src,string&result)
int n=WideCharToMultiByte(CP_UTF8,0,src.c_str(), -1 ,0,0,0,0);result.resize(n);
: :WideCharToMultiByte(CP_UTF8,0,src.c_str(), -1 , (char*)result.c_str(), result. length(),0,0);
void unicodeToGB2312(constwstring&wstr ,string&result)
int n=WideCharToMultiByte(CP_ACP, 0,wstr.c_str(), -1 ,0,0,0,0);result.resize(n);
: :WideCharToMultiByte(CP_ACP, 0,wstr.c_str(), -1 , (char*)result.c_str(), n,0,0);
void utf8ToUnicode(const string&src,wstring&result)
int n=MultiByteToWideChar(CP_UTF8,0,src.c_str(), -1 ,NULL,0);result.resize(n);
: :MultiByteToWideChar(CP_UTF8,0,src.c_str(), -1 , (LPWSTR)result.c_str(), result. len g th());
void gb2312ToUnicode(const string&src,wstring&result)
int n=MultiByteToWideChar(CP_ACP, 0,src.c_str(), -1 ,NULL,0);result.resize(n);
: :MultiByteToWideChar(CP_ACP, 0,src.c_str(), -1 , (LPWSTR)result.c_str(), result. length());
提速啦 成立于2012年,作为互联网老兵我们一直为用户提供 稳定 高速 高质量的产品。成立至今一直深受用户的喜爱 荣获 “2021年赣州安全大赛第三名” “2020创新企业入围奖” 等殊荣。目前我司在美国拥有4.6万G总内存云服务器资源,香港拥有2.2万G总内存云服务器资源,阿里云香港机房拥有8000G总内存云服务器资源,国内多地区拥有1.6万G总内存云服务器资源,绝非1 2台宿主机的小商家可比。...
轻云互联成立于2018年的国人商家,广州轻云互联网络科技有限公司旗下品牌,主要从事VPS、虚拟主机等云计算产品业务,适合建站、新手上车的值得选择,香港三网直连(电信CN2GIA联通移动CN2直连);美国圣何塞(回程三网CN2GIA)线路,所有产品均采用KVM虚拟技术架构,高效售后保障,稳定多年,高性能可用,网络优质,为您的业务保驾护航。活动规则:用户购买任意全区域云服务器月付以上享受免费更换IP服...
LayerStack(成立于2017年),当前正在9折促销旗下的云服务器,LayerStack的云服务器采用第 3 代 AMD EPYC™ (霄龙) 处理器,DDR4内存和企业级 PCIe Gen 4 NVMe SSD。数据中心可选中国香港、日本、新加坡和洛杉矶!其中中国香港、日本和新加坡分为国际线路和CN2线路,如果选择CN2线路,价格每月要+3.2美元,付款支持paypal,支付宝,信用卡等!...