- 主页 > 生活百科 > >
盘点20多个强大且免费的数据源,任何人都能以此来构建AI( 二 )
Google Open Images——数以百万计的图像以各种方式分类和标记,用于训练许多不同类型的计算机视觉算法 。 Imag.NET Open Dataset——另一个由标记图像组成的数据集,可免费用于非商业机器学习应用 。 COCO Dataset——Common Objects in Context (COCO)数据集中包含了超过200000张图像,这些图像被选择用于训练对象检测和字幕算法 。声音数据
- Mozilla Common Voice——一个开放的录音数据集,可用于训练任何涉及语音的AI应用 。
- AudIOSet——另一个由谷歌策划的数据集,这个数据集专注于声音,包含数十万个10秒样本,这些样本被分解为乐器、车辆和人声等类别 。
- Million Song Dataset——来自一百万个当代流行音乐曲目的样本和元数据 。
文本数据
- Wikidata——多种不同格式的维基百科文章的数据库下载 。
- Common Crawl——一个从万维网上抓取的开放数据存储库,最知名的用途就是对ChatGPT和其他聊天机器人的GPU大型语言模型进行训练 。
其他和杂项数据集
- Amazon Reviews——包含约3500万条亚马逊产品评论的数据库,包括产品信息和评级 。
- Waymo Open Dataset——Alphabet自动驾驶子公司Waymo公开了通过自动驾驶车辆收集的大量数据,包括来自摄像头和LiDAR传感器数据 。
- Apolloscape Dataset——更多的自动驾驶数据,是由百度开源Apollo平台提供的 。
推荐阅读
-
菜花头妈妈育儿经|后天的努力大于基因,父母矮小=生不出“大长腿”的孩子?你错了
-
芯片|1708亿!美国突然出手,谁也没想到,一切竟来得如此之快!
-
-
三节课:支付宝迎来15年最大改版!决战微信下半场,到底谁能笑到最后?
-
-
-
秉笔春秋吕书生|45岁蒋勤勤新剧突破尺度!裸身拍戏,风采一点不输当年,
-
cba|CBA一天5消息!姚明被曝辞职 辽宁男篮一喜一忧
-
总能感觉到有的人和自己说话时,有“轻蔑”的微表情,但又觉得是自己想多了。大家有类似的经历吗
-
野钓|水库实战技巧,本人看完深感受用,国庆钓鱼大总结
-
-
音容历史 父亲说一句话, 她哭着走了,开国中将前妻的女儿进城找父亲,
-
可降解塑料|股市两大泡沫破灭,唯有吃喝不败,已经影响股市走牛
-
中国网科技|猎豹移动2020年Q2财报:净利润2.44亿元 AI机器人部署超10000台
-
-
搜达足球|从3-1到3-3!中超再现99分钟大戏,裁判再成为主角,国安连夜上诉
-
大猩猩说影|金晨:穿着一身粉公主长裙瞬间变成少女,感觉像遇到自己大学初恋
-
海外网|美两栖攻击舰燃烧两天致61伤,高官:未来24小时有望灭火
-
-
南叔|他们最大的错,就是低估了女人的心机,不管是陈俊生还是刘洋