Chinaunix

标题: unix编程难题，如何分解这样的文件 [打印本页]

作者: angel518 时间: 2009-06-06 18:44
标题: unix编程难题，如何分解这样的文件
有一些文件，文件A的内容可能如下：
北京＃2||erif|23|yu||||||a|^|||$$$
文件B的内容可能如下：
黑白hg|er|nmd|2||||反对法||||||反对jdjf|$$$
等等。总之，文件内容以"|"进行字段分隔，两个“|”之间可以有内容，也可以为空（非空格）；现在要求把这些文件按照字段分解到另外的文件中，新文件要求每个字段占据一行，遇到^符号则退出对该文件的处理，遇到$$$符号则表示处理到该文件的尾部。比如文件A处理结果为：（两个“|”之间为空也是一个字段，处理后占一行）
================================
北京＃2

erif
23
yu

a
==============================
不用一个一个字符读取，如何快速的达到偶的要求呢（因为是从文件到文件转换，要求效率，用fgetc好像不合适吧？？？同样，如果一个一个字符处理，遇到中文怎么办呢，需要进行扫描转换吗？？？？）
偶尝试用strtok函数，但strtok对两个“|”之间为空的部分不会返回一个空，而是接着处理后面的，直到有数据为止才返回
比如对文件A用strstok后会返回：
================================
北京＃2
erif
23
yu
a
==============================
而不是偶上面要求的那样啊？怎么办
另外，文件有可能很长，后面的内容可能会循环，所以也不能固定几个字段，用sprintf来格式化处理

[ 本帖最后由 angel518 于 2009-6-6 19:16 编辑 ]

作者: majia1984 时间: 2009-06-06 18:51
strtok（char＊，‘｜’）；

作者: angel518 时间: 2009-06-06 19:14
偶都说了，用strtok不能满足要求啊

作者: mfzz1134 时间: 2009-06-06 20:42
先全部读进来，在弄个DFA就可以搞定了。DFA中遇到非|和^就直接输出，遇到|输出回车遇到^退出就可以了。

[ 本帖最后由 mfzz1134 于 2009-6-6 20:44 编辑 ]

作者: gawk 时间: 2009-06-06 21:31
这个还是用脚本比较方便

作者: DQP 时间: 2009-06-06 21:59
读进来一个一个判断呗
fgetc 怎么会影响你的效率呢.

作者: syncpk99 时间: 2009-06-06 22:00
脚本方便啊

作者: angel518 时间: 2009-06-06 23:37

原帖由 DQP 于 2009-6-6 21:59 发表
读进来一个一个判断呗
fgetc 怎么会影响你的效率呢.

当然影响那，因为源文件可能很大，而且该转换过程是人机交互，要求转换后人要马上其他操作啊，
怎么提高效率呢

作者: angel518 时间: 2009-06-08 08:43

原帖由 syncpk99 于 2009-6-6 22:00 发表
脚本方便啊

就是要用c编写呢

作者: bruceteen 时间: 2009-06-08 10:22
标题: strchr的事例
#include <stdio.h>
#include <string.h>

void split001( const char* str, const char chr )
{
const char* p1 = str;
for( const char* p2; (p2=strchr(p1,chr))!=0; p1=p2+1 )
{
printf( "\"%.*s\"\n", p2-p1, p1 );
}
printf( "\"%s\"\n", p1 );
}

int main()
{
split001( "北京＃2||erif|23|yu||||||a|^|||$$$", '|' );

return 0;
}

作者: edigar 时间: 2009-06-08 11:43
楼上的
学习

欢迎光临 Chinaunix (http://bbs.chinaunix.net/)