[日志]2009.04.30
中午来到实验室主要还是解决正则表达式的问题text标签的内容是词条正文描述里面除了有实体的链接外还有一些无关链接如类别链接[[Category:Iyobokamana]]语言链接[[yo:Europe]]文件链接[[Image:Europe_satellite_globe.jpgthumbright300pxUburayi]]等在存进ent_text之前最好将这些内容删去目前用StringBuffer来避免逐行解析时漏掉某些链接的问题或许会牺牲效率
在匹配正则表达式时采用的Matcher.appendReplacement(StringBuffer,String)方法似乎存在问题输出的时候多打了一遍后来仔细核对文档发现必须用两个StringBuffer才行基本关系抽取的代码到此也差不多了只是没有用英文维基XML测试原本这种处理是比较复杂的但修改数据库后变得简单一些把删除了无关链接的正文文存进entity表的ent_text项同时通过ent_id和ent_title来更新relationent表的re_fromre_sortkey将正文中的其他实体名存进re_to项暂时通过实体名而不是编号来查询数据信息回避当前实体表不全的缺点
遇到的问题
服务器的MySQL服务仍然无法启用
下一步计划
劳动节继续劳动...写高级接口功能
-------------------
[日志]2009.04.29
中午来到实验室发现服务器的MySQL服务无法启用昨天是可以用的但是大三学弟昨晚调试PHP的时候重启了服务器之后就无法启用了花了两个小时没有解决这个问题几天前曾为了连接服务器修改过一些文件夹的权限可能改乱了下午与学弟一起把服务器搬回了机房用PuTTY测试连接暂时没有问题
晚上与同学讨论了一些毕设的进展问题把UDMGrid-DOC0-数据库设计说明-20090429-0-jyb.doc上传到了FTP的设计文档目录中
遇到的问题
修改关系抽取代码时正则表达式抽取到的信息并不准确原因可能与SAX的抽取方式有关SAX是逐行解析会将段落中的每行割裂开这样会漏掉一些实体的链接本想用StringBuffer来解决但是效果不好
下一步计划
0 评论:
发表评论