首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 第七章 AI数据质量-5

    7.7 基于智能硬件的数据采集及标注方案 7.6章节提到的无论是基于数据增强及AI合成数据还是基于3D渲染生成数据,都存在真实性不足的问题:生成数据可能与真实数据存在差异,从而影响模型的泛化能力。 成本收益 (1)采集阶段的收益:采集场景上,我们每次以5度为单位,高度范围为90度,左右转动为90度,俯仰为60度,则最多一轮可采集90/5*90/5*60/5= 3888张。 图7-32 基于机械臂的证件样本自动化采集方案的收益 7.9 总结 本章我们首先介绍了数据在AI算法整个生命期中的重要性,接着介绍了AI数据的采集流程和采集量及其质量的评估。 人工采集样本存在效率低下的问题,我们可以通过程序合成进行样本数据的扩充,包括如数据增强、基于AI合成数据以及基于3D渲染引擎生成数据等手段。 下一章节,我们将进入AI模型质量的评估和测试环节。

    61110编辑于 2025-04-15
  • 来自专栏云云众生s

    用于训练多模态AI模型的5个有用数据集

    译自 5 Useful Datasets for Training Multimodal AI Models,作者 Kimberley Mok。 然而,构建有用的多模态AI模型需要高质量的多模态数据集,这些数据集是训练这些多功能系统的必要燃料——使它们能够超越单一维度或模式,扩展对世界的理解。 例如,图像字幕任务需要一个结合图像和相关描述性文本的训练数据集,这可以用来训练AI模型。训练过程结束后,就可以部署AI模型,利用自然语言处理和计算机视觉技术识别新图像的内容并生成相关的文本。 该数据集的独特之处在于它包含多种信息来源,包括视频片段、剧情、字幕、脚本和描述性视频服务(DVS)。 应用:自动化电影分析、摘要和分类。 许可证:未指定。 MovieQA数据集示例。 5. 这些只是大量可用多模态数据集中的少数几个——更不用说也日益受到关注的多语言数据集了。有如此多的选择,找到合适的训练AI模型的数据集相对容易。

    2.2K10编辑于 2025-01-17
  • 欧盟将建5座AI数据中心,每座将配备约10万个AI芯片

    近日,欧盟委员会公布了其人工智能大陆行动计划,打算建立了一个构架,以加强欧盟的人工智能(AI)计算基础设施。 其中,该计划将以设立5座AI数据中心为核心,每座数据中心将配备约10万个AI芯片,相较于现有的基础设施,其拥有的训练数量将提高达四倍。 根据外媒报导,欧盟投资基金承诺为数据中心建设和半导体采购提供200亿欧元的资金,另外还会补充100亿欧元给其他13个较小的AI数据中心,这些数据中心预计在2026年投入营运。 不过,AI 数据中心的选址仍然是一个问题,在德国政府的部分,打算在境内寻找一个合适的地点,以争取设置。 另外,该行动计划还将通过数据实验室,进一步解决基础设施的相关问题,其负责对来自研究机构和产业合作伙伴的数据进行标准化的作业。

    24010编辑于 2026-03-19
  • 关于AI就业,1亿条招聘数据背后的5个发现

    2026年前5个月,美国为主的科技业裁员超10万人,已达去年全年水平。AI成为最大单一原因。Challenger 4月裁员报告显示,全美因AI裁员的占比已达26%,居所有原因之首。 HBR 2026年初一项全球高管调研,点破了背后逻辑:企业现在是为AI的潜力而裁,不是为AI的实绩而裁。这是美国的情况。中国呢?我们用1亿条招聘数据来看看究竟。 斯坦福2025年AI指数报告给出的全球数据:新加坡3.2%、卢森堡2.0%、美国1.8%。中国处在合理区间。但2%可能只是表象。公开岗位的数据,只能统计"写进招聘描述里"的需求。 美国初级岗位年薪中位数5万—8.5万美元,用AI替代有比较明确的降成本收益。中国初级劳动力成本相对低,企业算账后可能会发现,给初级员工配AI提效,比直接替代更划算且稳妥。第二,产业阶段不同。  2025年二季度,AI岗位溢价达到观察期最高的79%,不是AI岗位薪酬涨的多,是别的岗位下滑的多导致。这个发现在全球数据中得到印证。

    1.3K10编辑于 2026-05-26
  • 来自专栏AI开发牧安

    AI开发牧安 · 第5期 数据是怎么自己进来的

    但有个最实在的问题没解决:**数据从哪来?**总不能每次都让我登到别人机器上,手动跑一遍检查、再把结果抄回平台。那样我一个人顶多盯三家,还累个半死。我要的是:我不在场,数据自己往平台上走。 停用它就收不到数据了,相当于远程拔网线。第二层,**HMAC 签名**。光有 token 不够——token 万一泄露,别人拿去伪造数据怎么办? 这不是我讲究,是 PIPL 要求的——客户的数据出不了自己场,就算出,也不能带能直接定位到人的明文。## 第一次真收到东西真正让我踏实的是 7 月 16 号上午。 盯着平台"数据接收"页,第一次看见一行新记录刷出来——Agent ID `23f17afd-5d9a-429d-b14e-a3a8ae7dd7b2`,类型 scan,成功。 到这儿,后台能登录、有权限、还能自己收数据了。下一期聊聊:一个人怎么赶三驾马车。

    12700编辑于 2026-07-29
  • 来自专栏存储公众号:王知鱼

    SPhotonix:5D光存储,探究AI时代数据永存之道

    阅读收获 掌握5D光存储核心原理:了解飞秒激光在石英玻璃中实现五维数据编码的机制,及其带来的超高存储密度与介质稳定性 洞察冷数据归档挑战:识别AI时代海量冷数据对传统存储(磁盘、磁带)在成本、能耗、寿命上的严峻考验 全文概览 AI与物联网正以前所未有的速度驱动数据爆炸式增长,你是否曾思考过,这些海量数据,尤其是那些不常访问却价值连城的“冷数据”,将如何被长期、安全、经济地存储? “可归档数据”的主要来源 可归档数据的爆炸式增长并非空穴来风,而是由几个关键且高价值的领域共同驱动的,尤其是合规要求和AI技术的普及。 凸显新兴增长点: 明确指出了“AI训练数据”和“AI生成的数据”是归档数据增长最快、最新的驱动力。 核心技术: 5D Memory Crystal™,能够在5英寸玻璃盘上存储高达360TB的数据,保存时间超过1000年,比其他商用产品长1000倍。 2.

    93110编辑于 2025-10-09
  • 来自专栏VoiceVista语音智能

    5 Generative AI - 5 powerful tools you might use in 2023

    Welcome to You.com the first app that combines ChatGPT connected to Google. 5 powerful tools you might Design a Logo, make a #website, and create a #brand identity you'll love with the power of Al. www.copy.ai #Copy.ai is an Al-powered copywriter that generates high-quality copy for your business.

    31020编辑于 2023-03-02
  • 来自专栏AI科技大本营的专栏

    AI 重塑 IT的 5 种方式

    数据科学需要与IT进行更加深入的合作 一些主流的企业应用(例如CRM)正在采用更多的AI和自动化技术。但对于更高级的AI应用而言,在IT和数据科学之间加强合作的必要性与日俱增。 由于公司准备扩展其AI和分析功能的应用,因此需要更加深入地访问IT系统、数据和应用。 Fractal Analytics的技术服务客户合伙人乔治•马修(George Mathew)表示,“构建AI主导的解决方案需要数据科学家和工程师之间的紧密合作。 马修指出:“这种对共同挑战的理解使得数据科学家和工程师之间的合作更加紧密”。他所在机构中的几个团队已经凭借着强大的合作伙伴关系,交付了多个与AI相关的复杂解决方案。 AI是一个需要数据和IT共同合作的领域,Gartner建议重点关注以下三点:对数据源和AI成果的信任;数据和算法透明度要求;以及支撑AI伦理和准确性的数据、算法及观点多样性。

    74930发布于 2020-06-24
  • 来自专栏AI工具

    5款“真香”AI工具推荐

    如何更好利用AI辅助学习,工作,搞钱,好用的AI工具必不可少。 推荐5个非常好用的AI工具,也是我目前使用频率比较高和准备使用的工具,很香。 Chatgpt不在此推荐中啊,在目前的AI工具中,Chatgpt是大哥,既然是大哥,大哥都知道,就不推荐了,然而其目前主要支持文本输出,虽然丰富的插件拓宽了使用场景,但虽是尊贵的Plus,仍旧有3个小时只能输出 第一款 Bing 图形创建器 类型:AI绘画工具 访问地址:https://www.bing.com/images/create? FORM=GENILP 推荐理由: AI绘画软件有很多,为什么推荐这个呢? 重点是比较好用,而且完全免费哈。 Bing 图形创建器,由DALL.E驱动,DALL.E是什么? 第二款 Adobe firefly 访问地址:https://firefly.adobe.com/ 类型:AI图片处理 推荐理由: 好用强大且免费。

    88020编辑于 2023-07-01
  • 来自专栏火星娃统计

    GEO数据挖掘5

    GEO数据挖掘5 sunqi 2020/7/13 GEO数据挖掘5 概述 GO和KEGG富集分析 KEGG全称 Kyoto Encyclopedia of Genes and Genomes,由日本京都大学生物信息学中心的 数据库能够把基因及表达信息作为一个整体的网络进行研究,通俗点讲就是通过基因寻找通路 GO全称为gene ontology,由基因本体联合会(Gene Ontology Consortium)建立的数据库 ,数据库对基因和蛋白功能进行限定和描述 GEO数据挖掘离不来富集分析,单纯的差异表达基因不能说明什么问题,只有对基因根据现有知识做定义定位分类,这样才能在生物学上解释这个差异,也就是故事才能讲顺了 注释 :GO和KEGG的具体作用不再赘述,等代码实现完成之后后续再学习理论知识 另外,KEGG和GO分析可以通过软件实现,具体参考官网 数据预处理 用到的数据集为差异分析后得到的数据集deg,详情见上章 rm by cytochrome P450 3/82 ## hsa04390 hsa04390 Hippo signaling pathway 5/

    1.6K10发布于 2020-09-15
  • 来自专栏算法进阶

    5秒实现AI语音克隆(Python)

    水文一篇,推荐一个有趣的AI黑科技--MockingBird,该项目集成了Python开发,语音提取、录制、调试、训练一体化GUI操作,号称只需要你的 5 秒钟的声音,就能实时克隆出你的任意声音。 B7%B1%E8%AE%AD%E7%BB%83encoder%E6%A8%A1%E5%9E%8B-%E5%8F%AF%E9%80%89)2.1 使用数据集自己训练encoder模型 (可选) * B8%80)2.2 使用数据集自己训练合成器模型(与2.3二选一) * 下载 数据集并解压:确保您可以访问 *train* 文件夹中的所有音频文件(如.wav) * 进行音频和梅尔频谱图预处理 输入框里的就是要合成的话术,传入的声音可以当场录音或者上传已录好的声音(需要wav格式),点击上传合成就可以稍后就可以听到AI克隆的声音。 类似与AI模型从海量数据中,发现本质特征做合理的决策的过程,我们也需要维护好自己的“信息筛选及决策系统”,去客观地认识事物及笃定内心深处的追求。

    2.8K30编辑于 2022-06-02
  • 来自专栏小巫技术博客

    2026.3.9 今日5大AI前沿新闻

    40610编辑于 2026-03-30
  • 来自专栏小巫技术博客

    2026.3.7 今日5大AI前沿新闻

    44610编辑于 2026-03-30
  • 来自专栏小巫技术博客

    2026.3.8 今日5大AI前沿新闻

    41010编辑于 2026-03-30
  • 来自专栏月色的自留地

    从锅炉工到AI专家(5)

    这样全部28x28=784个数据都用这种方式计算,最后的结果,当然就代表更接近字符0的可能性。这就是这个程序图像识别的基本原理。 并且在实践中的结果也非常令人兴奋,所以从并不很长的AI历史上,“人工神经网络”算统治了相当不短的时间。以至于对于很多非专业人士来讲,“神经网络”已经成了AI标志性的概念。 ? 在这些多层的计算中,第一层承担了所有原始数据的输入,因此叫做“输入层”;最后一层完成结果的输出,叫做“输出层”;中间的部分承担上一层的结果,经过计算完成下一层的输入,但对用户来讲实际是不可见的,叫做“隐藏层 你可以理解为:通过增加计算节点、更多的体现和保持每个数据和其它数据之间的微小关系甚至多层互动之后的关系,从而更准确的完成对结果的计算。 tf初始化及所有变量初始化 sess.run(tf.global_variables_initializer()) #进行20000步的训练 for i in range(20000): #每批数据

    92340发布于 2018-06-20
  • 来自专栏圣杰的专栏

    .NET+AI | MEAI | ChatOptions 详解(5)

    ChatOptions 详解:精准控制 AI 对话的配置利器 一句话简介 ChatOptions 是 Microsoft.Extensions.AI 中传递给 IChatClient 的统一配置容器,用于在单次请求中精准控制生成策略 背景执行与恢复 属性 说明 AllowBackgroundResponses 支持后台长任务(实验性) ContinuationToken 用于轮询或恢复流式响应 5. = []; additionalProperties[SummaryKey] = newSummary; 场景 3:Azure AI Inference 的额外属性 在 Microsoft.Extensions.AI.AzureAIInference 抽象与实现的矛盾 ChatOptions 提供统一配置,但各提供商有特有选项 例如 OpenAI 的 IncludeUsage、Azure AI 的自定义配置 避免抽象层膨胀 不为每个提供商在 :Raw representation 中的非 null 值具有最高优先级 ✅ 最佳实践:标准功能用标准属性,特殊功能用扩展点,始终返回新实例 下一步:探索 Microsoft.Extensions.AI

    44610编辑于 2025-12-28
  • 来自专栏云云众生s

    Cursor AI设置AI编码辅助标准的5种方式

    译自 5 Ways Cursor AI Sets the Standard for AI Coding Assistance,作者 Janakiram MSV。 在创建提示时,可以参考文件(如屏幕截图、数据库模式,甚至是文本文件)以及分步说明,以便为 Composer 提供上下文。 在我的测试中,我利用 Composer 将现有数据集导入 PostgreSQL 数据库,并通过 REST API 端点公开它。 我可以毫不费力地将数据库和 API 层打包到 Docker Compose 文件中,并在我的开发机器上运行它——所有这些都不需要离开开发环境。 5. DevOps 工作流程自动化 我对 Cursor 最满意的是它能够处理端到端的应用程序生命周期,而无需离开开发环境。

    2.6K20编辑于 2024-09-12
  • 来自专栏实时流式计算

    数据血缘系列(5)—— 数据血缘与元数据

    在当今数据驱动的商业环境中,数据治理成为企业成功的关键因素之一,而数据血缘正是数据治理成功的一个关键。 本文我们详细探讨下数据血缘与元数据有什么关系?他们之间又是如何配合实现数据治理的。 本文思维导图如下所示: 元数据(Metadata)是描述数据的数据,它为数据提供了上下文信息,使用户能够更好地理解、管理和使用数据。 元数据的类型 根据不同的应用场景,元数据可以分为业务元数据、技术元数据和操作元数据。 业务元数据描述与业务相关的信息,包括业务术语、数据定义和业务规则。 在数据治理中,元数据和数据血缘紧密相关。元数据记录了数据的来源和目标,使数据血缘分析能够准确地追踪数据的流动路径。 通过元数据和数据血缘的结合,企业可以更好地理解和管理其数据资产,提升数据的价值和利用水平。元数据和数据血缘在数据治理中具有不可替代的重要作用。

    1.4K10编辑于 2024-07-16
  • 来自专栏雪胖纸的玩蛇日常

    5.双向数据绑定

    1.双向数据绑定 <template>

    <! -- 双向数据绑定MVVM vue就是一个mvvm框架, model改变影响视图,视图改变影响model --> <! -- 双向数据绑定必须结合表单使用 -->

    {{msg}}

    <input type="text" v-model="msg">

    <button
    </template> <script> export default { name: 'app', data () { return { msg:'双向数据绑定

    1.2K50发布于 2019-09-27
  • 来自专栏漫漫生信路

    Day 5——数据结构

    2)#1-3重复2次##从向量中提取元素根据元素位置x[4]#x取第4个元素x[-4]#x取除了第4个元素之外所有元素x[2:4]#x取第2到第4个元素x[-(2:4)]#x除了第2到第4x[c(1,5) ]#x第1个和第5个根据值x[x==10]#等于10的元素x[x<0]#小于0的元素x[x%in%c(1,2,5)]#存在于向量1,2,5之间的元素数据框读取本地数据read.table(file="文件名 文件名.txt",sep="\t",header=T)查看行名和列名、行数和列数colnames(a)#查看列名rownames(a)#查看行名,如果不命名使用默认值的话,行号就是行名,即1,2,3,4,5, ......dim(a)#几行几列数据框的导出write.table(a,file = "新文件名.txt",sep=",",quote=F)#分隔符号改为逗号,导出文件在工作目录下变量的保存与重新加载可适用于未一次性处理完的数据下次接着处理

    36710编辑于 2023-12-02
领券