数据集 - 青少年人工智能资源与创新平台 - 互联网教育智能技术及应用国家工程实验室 - Powered By EduSoho

01

12月

Apache Software Foundation公共邮件存档

截至2011年7月11日所有公开可用的Apache Software Foundation邮件存档

01

12月

TED-LIUM

TED 演讲的语音转录数据集。1495 份 TED 演讲的语音记录，并且这些语音记录有对应的全文本。

01

12月

Yahoo!搜索日志与相关性判断

匿名化的Yahoo!搜索日志与相关性判断（1.3 GB）

01

12月

SouthparkData

带有脚本信息的.csv文件，包含《南方公园》季数、剧集、角色等信息（3.6 MB）

01

12月

ICCV13/MVFW

2500幅图像,每个人脸标定68个关键点

01

12月

DBpedia

包含从维基百科中提取出的结构化信息，包括312,000个人、413,000个地点、94,000张音乐专辑、49,000部电影、15,000种电子游戏、140,000个组织、146,000个物种和4600种疾病。共计10亿多条信息，其中2.57亿条来自维基百科英文版，7.66亿条来自其他语言版本（17...

01

12月

澳大利亚新闻标题[Kaggle]

包含15年内（2003年初至2017年）澳大利亚广播公司发布的130万条新闻的标题，深入研究关键词，可以看到所有塑造了过去十年的重要事件，以及它们随着时间的演变历程（56 MB）

01

12月

Home Depot产品搜索相关性[Kaggle]

包含Home Depot网站上的许多产品和真实客户的搜索关键词。每对词都经3名评估人员评估，并给出1—3的相关性评分，可用来预测相关性（65 MB）

01

12月

路透社语料库

包含大量路透社新闻报道，主要用于研究和开发自然语言处理、信息检索和机器学习系统。在2004年秋季，NIST接管了RCV1，所以现在需要向NIST发送请求并签署协议来获取这些数据集（2.5 GB）

01

12月

Twitter东京地理定位推文

来自东京的20万条推文（47 MB）

01

12月

300-W

600幅图像,每个人标定68个关键点

01

12月

NEGRA

德语报刊文本的句法注释语料库，适用于所有大学和非营利组织，需要签署并发送表格才能获得

01

12月

CMU Q/A Dataset

人工生成的问题/答案对，难度评级来自维基百科文章。

01

12月

2000 HUB5 English

仅仅只包含英语的语音数据，最近百度发表的论文《深度语音：扩展端对端语音识别(Deep Speech: Scaling up end-to-end speech recognition)》就是使用了该语音数据集。

01

12月

crosswikis

英语短语相关的维基百科文章数据库、论文（11 GB）

01

12月

20万英语笑话文本

来源于各个地方的208,000个纯文本笑话

01

12月

一周全球新闻馈送[Kaggle]

一周内（2017年8月24日至2017年8月30日）全球在线发布的大多新闻内容的快照，包括大约140万篇文章、20,000个新闻来源和20多种语言（115 MB）

01

12月

Urban Dictionary词汇和定义[Kaggle]

截至2016年5月，包含全部260万个Urban Dictionary的词汇定义、提交者和点赞数量的CSV语料库（238 MB）

01

12月

Adience

2284个人,共26580幅人脸图像(年龄、性别识别)

01

12月

Yahoo!从公开可用网页中提取的HTML表单

包含一小部分含有复杂HTML表单的页面，共计267万个复杂表单（50+ GB）