新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     计算机科学论坛     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> The future of AI, is the future of computer
    [返回] 计算机科学论坛计算机理论与工程『 人工智能 :: 机器学习|数据挖掘|进化计算 』 → 数据挖掘中数据集资源的收集 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 17856 个阅读者浏览上一篇主题  刷新本主题   树形显示贴子 浏览下一篇主题
     * 贴子主题: 数据挖掘中数据集资源的收集 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     DMman 帅哥哟,离线,有人找我吗?魔羯座1984-1-11
      
      
      威望:1
      头衔:数据挖掘青年
      等级:研二(Pi-Calculus看得一头雾水)(版主)
      文章:803
      积分:5806
      门派:W3CHINA.ORG
      注册:2007/4/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给DMman发送一个短消息 把DMman加入好友 查看DMman的个人资料 搜索DMman在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 点击这里发送电邮给DMman 访问DMman的主页 引用回复这个贴子 回复这个贴子 查看DMman的博客楼主
    发贴心情 数据挖掘中数据集资源的收集

    DMman按:以下链接转自互联网,链接的有效性与可用价值DMman没有逐个进行测试。                                  

    收集了一些数据集下载的网址,做测试用的。大有用处:

    1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

    2、几个实用的测试数据集下载的网站

    http://www.cs.toronto.edu/~roweis/data.html
    http://www.cs.toronto.edu/~roweis/data.html
    http://kdd.ics.uci.edu/summary.task.type.html
    http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
    http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
    http://www.phys.uni.torun.pl/~duch/software.html
    在下面的网址可以找到reuters数据集http://www.research.att.com/~lewis/reuters21578.html

    以下网址上有各种数据集:
    http://kdd.ics.uci.edu/summary.data.type.html

    进行文本分类,还有一个数据集是可以用的,即rainbow的数据集
    http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

    3、找了很多测试数据集,写论文的同志们肯定需要的,至少能用来检验算法的效果
    可能有一些不能访问,但是总有能访问的吧:

    UCI收集的机器学习数据集
    ftp://pami.sjtu.edu.cn/
    http://www.ics.uci.edu/~mlearn//MLRepository.htm

    statlib
    http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm
    http://lib.stat.cmu.edu/

    样本数据库
    http://kdd.ics.uci.edu/
    http://www.ics.uci.edu/~mlearn/MLRepository.html

    关于基金的数据挖掘的网站
    http://www.gotofund.com/index.asp

    http://lans.ece.utexas.edu/~strehl/

    reuters数据集
    http://www.research.att.com/~lewis/reuters21578.html

    各种数据集:
    http://kdd.ics.uci.edu/summary.data.type.html
    http://www.mlnet.org/cgi-bin/mlnetois.pl/?File=datasets.html
    http://lib.stat.cmu.edu/datasets/
    http://dctc.sjtu.edu.cn/adaptive/datasets/
    http://fimi.cs.helsinki.fi/data/
    http://www.almaden.ibm.com/software/quest/Resources/index.shtml
    http://miles.cnuce.cnr.it/~palmeri/datam/DCI/

    进行文本分类&WEB
    http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

    http://www.w3.org/TR/WD-logfile-960221.html
    http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog
    http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html
    http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
    http://www.web-caching.com/traces-logs.html
    http://www-2.cs.cmu.edu/webkb
    http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf
    http://www.cs.cornell.edu/projects/kddcup/index.html


    时间序列数据的网址
    http://www.stat.wisc.edu/~reinsel/bjr-data/

    apriori算法的测试数据
    http://www.almaden.ibm.com/cs/quest/syndata.html

    数据生成器的链接
    http://www.cse.cuhk.edu.hk/~kdd/data_collection.html
    http://www.almaden.ibm.com/cs/quest/syndata.html


    关联:
    http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
    http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

    WEKA:
    http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
    1。A jarfile containing 37 classification problems, originally obtained from the UCI repository
    http://prdownloads.sourceforge.net/weka/datasets-UCI.jar
    2。A jarfile containing 37 regression problems, obtained from various sources
    http://prdownloads.sourceforge.net/weka/datasets-numeric.jar
    3。A jarfile containing 30 regression datasets collected by Luis Torgo
    http://prdownloads.sourceforge.net/weka/regression-datasets.jar

    癌症基因:
    http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

    金融数据:
    http://lisp.vse.cz/pkdd99/Challenge/chall.htm

    另一个人提供的
    http://www.cs.toronto.edu/~roweis/data.html
    http://kdd.ics.uci.edu/summary.task.type.html
    http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-20/www/data/
    http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/
    http://www.phys.uni.torun.pl/~duch/software.html
    在下面的网址可以找到reuters数据集
    http://www.research.att.com/~lewis/reuters21578.html

    以下网址上有各种数据集:
    http://kdd.ics.uci.edu/summary.data.type.html

    进行文本分类,还有一个数据集是可以用的,即rainbow的数据集
    http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html


    Download the Financial Data (~17.5M zipped file, ~67M unzipped data)
    Download the Medical Data (~2M zipped file, ~6M unzipped data)
    http://lisp.vse.cz/pkdd99/Challenge/chall.htm


    kdnuggets 相关链接数据集(借花献佛了):
    http://www.kdnuggets.com/datasets/index.html

    你也可以到http://blogger.org.cn/blog/more.asp?name=idmer&id=24017
    察看kdnuggets 数据集资源的详细介绍。


       收藏   分享  
    顶(0)
      




    ----------------------------------------------
    数据挖掘青年 http://blogger.org.cn/blog/blog.asp?name=DMman
    纪录片之家 (很多纪录片下载)http://www.jlpzj.com/?fromuid=137653

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/4/26 10:56:00
     
     lina260 美女呀,离线,快来找我吧!
      
      
      等级:大一新生
      文章:1
      积分:54
      门派:XML.ORG.CN
      注册:2008/6/10

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给lina260发送一个短消息 把lina260加入好友 查看lina260的个人资料 搜索lina260在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看lina260的博客2
    发贴心情 
    初学者 不知道怎么使用uci数据,请教一下,谢谢啦
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/6/10 16:23:00
     
     不想穿鞋子 美女呀,离线,快来找我吧!
      
      
      等级:大一新生
      文章:2
      积分:58
      门派:XML.ORG.CN
      注册:2008/6/27

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给不想穿鞋子发送一个短消息 把不想穿鞋子加入好友 查看不想穿鞋子的个人资料 搜索不想穿鞋子在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 点击这里发送电邮给不想穿鞋子 引用回复这个贴子 回复这个贴子 查看不想穿鞋子的博客3
    发贴心情 

    都是好东东,谢谢了
    不过对我的英文是极大的考验

    ----------------------------------------------
    爱情比软件还要难开发

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/6/27 20:08:00
     
     guodan13 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:1
      积分:54
      门派:XML.ORG.CN
      注册:2008/7/27

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给guodan13发送一个短消息 把guodan13加入好友 查看guodan13的个人资料 搜索guodan13在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看guodan13的博客4
    发贴心情 
    正缺少这个,谢谢了
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/7/27 22:53:00
     
     roywwcheng 帅哥哟,离线,有人找我吗?
      
      
      等级:大一(高数修炼中)
      文章:17
      积分:158
      门派:IEEE.ORG.CN
      注册:2005/11/1

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给roywwcheng发送一个短消息 把roywwcheng加入好友 查看roywwcheng的个人资料 搜索roywwcheng在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看roywwcheng的博客5
    发贴心情 
    表示感谢!
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/7/28 8:26:00
     
     xiaoyatou_00 美女呀,离线,快来找我吧!
      
      
      等级:大一新生
      文章:5
      积分:74
      门派:XML.ORG.CN
      注册:2008/9/8

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给xiaoyatou_00发送一个短消息 把xiaoyatou_00加入好友 查看xiaoyatou_00的个人资料 搜索xiaoyatou_00在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看xiaoyatou_00的博客6
    发贴心情 
    呵呵,谢谢楼主了,我正在寻找又用的测试数据集,太感谢了!!!!
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2008/9/8 16:57:00
     
     哪吒闹海 美女呀,离线,快来找我吧!
      
      
      等级:大一(高数修炼中)
      文章:12
      积分:120
      门派:XML.ORG.CN
      注册:2009/4/2

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给哪吒闹海发送一个短消息 把哪吒闹海加入好友 查看哪吒闹海的个人资料 搜索哪吒闹海在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看哪吒闹海的博客7
    发贴心情 
    以下是引用不想穿鞋子在2008-6-27 20:08:00的发言:

    都是好东东,谢谢了
    不过对我的英文是极大的考验


    发同样的感慨,有中文的就好了
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2009/4/3 10:23:00
     
     skylikeblue 帅哥哟,离线,有人找我吗?
      
      
      等级:大一新生
      文章:5
      积分:72
      门派:XML.ORG.CN
      注册:2009/5/2

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给skylikeblue发送一个短消息 把skylikeblue加入好友 查看skylikeblue的个人资料 搜索skylikeblue在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 引用回复这个贴子 回复这个贴子 查看skylikeblue的博客8
    发贴心情 
    刚好用到,谢谢
    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2009/5/3 9:56:00
     
     GoogleAdSense
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 人工智能 :: 机器学习|数据挖掘|进化计算 』的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2025/1/15 18:13:13

    本主题贴数8,分页: [1]

    管理选项修改tag | 锁定 | 解锁 | 提升 | 删除 | 移动 | 固顶 | 总固顶 | 奖励 | 惩罚 | 发布公告
    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    109.375ms