題面描述:
你嘗試過在百度上使用 site inurl 文法查詢嗎 ? 如果還沒有的話可以試一下 :)
如輸入 site:www.baidu.com inurl:news
則會搜出所有在 www.baidu.com 站點上的包含 "news" 子串的 url 。
現在我們有兩份資料,一份是 site_inurl.txt 一份是 url.txt
site_inurl.txt 中每行是一個 site inurl 文法組成的查詢串, url.txt 中儲存的是 url 清單。
你能否在 url 清單中找出所有能被 site_inurl.txt 中的查詢串檢索到的 url?
如 site_inurl.txt 内容如下:
site:www.baidu.com inurl:/more
site:zhidao.baidu.com inurl:/browse/
site:www.sina.com.cn inurl:www20041223am
url.txt 内容如下:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.baidu.com/events/20060105/photomore.html
http://hi.baidu.com/browse/
http://hi.baidu.com/baidu/
http://www.sina.com.cn/head/www20021123am.shtml
http://www.sina.com.cn/head/www20041223am.shtml
則你的程式運作完輸出的結果應該為:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.sina.com.cn/head/www20041223am.shtml
程式以指令行形式傳入這兩個檔案名,第一個參數為 site_inurl 檔案對應的檔案名,第二個參數為 url 清單對應的檔案名,程式的輸出請輸出到标準輸出。
C++實作代碼:
- #include <string>
- #include <iostream>
- #include <fstream>
- using std::string;
- using std::cin;
- using std::cout;
- using std::endl;
- using std::cerr;
- using std::ifstream;
- int main(int argc, char *argv[])
- {
- string sitestring,
- urlstring;
- if(argc==3)
- {
- sitestring.assign(argv[1]);
- urlstring.assign(argv[2]);
- cout<<"Your site file is: "<<sitestring<<endl;
- cout<<"Your url file is: "<<urlstring<<endl;
- }
- else
- {
- cerr<<"Please check your arguments!"<<endl;
- return -1;
- }
- cout<<endl;
- ifstream sitefile(argv[1]);
- if(!sitefile)
- {
- cerr<<"Error: Can't open file "<<argv[1]<<endl;
- return -1;
- }
- while(getline(sitefile,sitestring))
- {
- ifstream urlfile(argv[2]);
- if(!urlfile)
- {
- cerr<<"Error: Can't open file "<<argv[2]<<endl;
- return -1;
- }
- string::size_type sitepos,
- urlpos;
- if((sitepos=sitestring.find("site:"))==string::npos ||
- (urlpos=sitestring.find("inurl:"))==string::npos)
- continue;
- cout<<sitestring<<endl;
- string subsite=sitestring.substr(sitepos+5,urlpos-6);
- string suburl=sitestring.substr(urlpos+6);
- while(getline(urlfile,urlstring))
- {
- if((urlstring.find(subsite.c_str(),0,subsite.size()-1)!=string::npos)
- && (urlstring.find(suburl.c_str(),0,suburl.size()-1)!=string::npos))
- cout<<urlstring<<endl;
- }
- cout<<endl;
- }
- return 0;
- }