解析XML文件时,无效的XML 字符 (Unicode: 0x7)异常处理

 在最近的工作中需要使用XML文件做数据存储,由于此XML文件的内容是不同的数据来源的数据,在解析XML文件时,遇到几处相似的异常:无效的XML字符 (Unicode: 0x7), (Unicode: 0x8b)。

org.dom4j.DocumentException: Error on line 85342 of document file:///E:/实习生工作/TRS数据/baseinfo_1.xml : 在文档的元素内容中找到无效的 XML 字符 (Unicode: 0x7)。 Nested exception: 在文档的元素内容中找到无效的 XML 字符 (Unicode: 0x7)。

at org.dom4j.io.SAXReader.read(SAXReader.java:482)
at org.dom4j.io.SAXReader.read(SAXReader.java:264)
at parser.parserXml2Person.PersonXmlParser.parser(PersonXmlParser.java:27)
at parser.parserXml2Person.TestParser.parserXml2Person(TestParser.java:35)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:62)
at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
at java.lang.reflect.Method.invoke(Method.java:497)
at org.junit.runners.model.FrameworkMethod$1.runReflectiveCall(FrameworkMethod.java:47)
at org.junit.internal.runners.model.ReflectiveCallable.run(ReflectiveCallable.java:12)
at org.junit.runners.model.FrameworkMethod.invokeExplosively(FrameworkMethod.java:44)
at org.junit.internal.runners.statements.InvokeMethod.evaluate(InvokeMethod.java:17)
at org.junit.runners.ParentRunner.runLeaf(ParentRunner.java:271)
at org.junit.runners.BlockJUnit4ClassRunner.runChild(BlockJUnit4ClassRunner.java:70)
at org.junit.runners.BlockJUnit4ClassRunner.runChild(BlockJUnit4ClassRunner.java:50)
at org.junit.runners.ParentRunner$3.run(ParentRunner.java:238)
at org.junit.runners.ParentRunner$1.schedule(ParentRunner.java:63)
at org.junit.runners.ParentRunner.runChildren(ParentRunner.java:236)
at org.junit.runners.ParentRunner.access$000(ParentRunner.java:53)
at org.junit.runners.ParentRunner$2.evaluate(ParentRunner.java:229)
at org.junit.runners.ParentRunner.run(ParentRunner.java:309)
at org.eclipse.jdt.internal.junit4.runner.JUnit4TestReference.run(JUnit4TestReference.java:86)
at org.eclipse.jdt.internal.junit.runner.TestExecution.run(TestExecution.java:38)
at org.eclipse.jdt.internal.junit.runner.RemoteTestRunner.runTests(RemoteTestRunner.java:459)
at org.eclipse.jdt.internal.junit.runner.RemoteTestRunner.runTests(RemoteTestRunner.java:675)
at org.eclipse.jdt.internal.junit.runner.RemoteTestRunner.run(RemoteTestRunner.java:382)

at org.eclipse.jdt.internal.junit.runner.RemoteTestRunner.main(RemoteTestRunner.java:192)

一开始,试图对XML文件进行不同格式的修改,UTF-8,ANBI等等,均无效(后来明白过来了,字符值根本没有改变), 接着去寻找解决办法,试图把Unicode转变为UTF-8,也找了相关的算法,但是XML中仅仅含有几处Unicode字符,也没能解决。

        后来找了一些资料发现这些字符有些共性:这些无效的字符在一些文档中作为文档处理器的控制编码(微软选择了那些再0x82到0x95之间的字符作为"smart"标点),这些也被Unicode保留作为控制编码的,并且在XML中是不合法的。

        在下面的网页中有所有的Unicode字符,对应的UTF-8字符,以及它代表的意义

        http://www.utf8-chartable.de/unicode-utf8-table.pl?utf8=0x 

        最后我还是把这些无效的Unicode字符转变为空字符


你可能感兴趣的:(xml)