首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 第七章 AI数据质量-3

    7.5.3 基于扩散模型(Diffusion Model)合成数据 AI图像生成是2022年以来AIGC(Artificial Intelligence Generated Content:人工智能创作内容 输出:处理后的图片信息张量(Processed image information tensor) (3) 图片解码器(Image Decoder) 图像解码器通过前置的图片信息生成器得到的信息来生成图像 7-11 基于Stable Diffusion模型生成的测试样本 除了基于文生图外,我们还可以利用StableDiffusion的图生图(Img2Img)能力来生成相似的测试样本,代码示例如代码段7-3所示 代码段7-3:基于Stable Diffusion模型的图生图模型生成测试样本代码 import torch import requests from PIL import Image from io 下面我们将演示如何基于边缘检测和姿态检测生成相似AI样本数据。 1. 基于Canny边缘检测生成样本数据 Canny边缘检测是一种常用的边缘检测算法,它可以在图像中找到明显的边缘,并将其提取出来。

    65010编辑于 2025-04-15
  • 来自专栏JNing的专栏

    【3D人脸】AI Mesh 数据工程调研

    业内的数据来源 synthetic data(合成数据) [2021,微软] Fake It Till You Make It: Face analysis in the wild using synthetic 开源的假图只给了70个2d点,不给模型) [2022,微软] 3D face reconstruction with dense landmarks(直接完全沿用了自家2021的数据,没有任何改进,不给模型 (没细看) [2015,中科院] Face alignment across large poses: A 3d solution(没细看) semi-automatic refined data(半3dmm geometry from monocular video on mobile GPUs(3w张真实人脸,用3DMM去fit出假标签,之后数据迭代清洗自循环:模型洗出脏数据,手动微调x和y,更干净的数据再反哺给模型 ,全程z不洗) [2020,谷歌] AttentionMesh(直接完全沿用了自家2019的数据,没有任何改进。

    99020编辑于 2022-11-14
  • 来自专栏用户2241938的专栏

    3年专注心电图AI数据标注服务

    人工智能技术的开发都需要大量的数据,这些数据就是人工智能技术的基础。 但是这些数据要想被利用起来,并适合于人工智能训练用的数据,则需要按照一定的规则加以处理和清洗,如果是医疗用的数据进一步需要专业医生的标注。 目前大量的以心电图设备为基础的的公司,为了训练识别心电图的AI模型都在同样重复的工作,第一找可靠的数据,第二标注数据。 策位信息公司历经3年多的磨砺,逐步形成了一套行之有效的方法,已经成功标注百万计的心电图数据。通过和大型专业软件公司的长期合作,摸索出一种适合于专业医生和普通人标注的一个大型平台。 三甲医院的主任医师标注数据是最高级,同时为了节省成本我们也与卫生学校合作,做简单的标注和数据清洗工作。 与我公司合作将会使你公司更加专注于AI技术的开发,省去其中大量的劳务管理费用,加速AI的开发。

    1.3K00发布于 2020-09-02
  • 来自专栏Android知识点总结

    3-AI--Activity间的数据传递

    零、前言 打开FromActivity,通过按钮以返回结果方式打开ToActivity,同时在intent中加入数据,在ToActivity的onCreate方法中使用数据填充到TextView上。 按返回按钮,将ToActivity数据传递给FromActivity,在onActivityResult方法中验证返回结果并将数据填充到TextView上。 ? Activity数据传递.gif 一、Java类 FromActivity.java public class FromActivity extends AppCompatActivity { Activity传递数据.png ---- 附录 Person.java public class Person implements Serializable { private String android.support.constraint.ConstraintLayout> 本文由张风捷特烈原创,转载请注明 更多安卓技术欢迎访问:https://www.jianshu.com/c/004f3fe34c94

    78250发布于 2018-09-26
  • datawhale AI+数据分析 task3、4

    task3思考题(遇到这个场景,你准备如何分析?希望分析出什么结果?)回答:我希望分析出大家最希望学习的主题以及最不希望学习的主题。我会先统计每一个主题所获得的票数,再进行排序。 修改提示词让ai理解sheet1和sheet2分别是一群和二群感兴趣的主题统计,数字分别代表一种活动。 task4日常使用ai对数据分析(根据公选课评价表格选出适合自己的公选课)提示词如下:这是一些课程的评价表格。给我推荐一些好老师和其公选课,分析指标包括对老师上课的评价。 将重要的数据关系用图表展示,并以此达成我们的目标。总结提示词可以分为主要三部分,对数据的解释、数据分析指标和研究目标。其他是否使用图表展示可有可无。 确定好主要的三部分内容的提示词,ai可以生成较好的数据分析。

    27110编辑于 2025-08-27
  • AI客流分析系统技术架构:从3D感知到边缘AI数据输出

    AI客流分析系统本质上是一套实时目标检测与时空数据处理系统。输入端是传感器数据,输出端是结构化客流数据,中间经过人体检测、深度计算、目标跟踪、轨迹判断、属性识别和数据聚合。 本文按照系统架构拆解AI客流分析的完整数据链路。1. 获得深度之后,目标检测不再只有二维坐标:(x, y)还可以得到:(x, y, z)这就是3D客流分析与普通二维图像计数的重要技术区别之一。3. 人体检测层人体检测负责回答:当前数据中哪里存在人体目标? 边缘AI为什么越来越常见传统架构可以采用:Camera ↓Network ↓Server ↓AI Processing边缘AI则可以变成:Sensor ↓Edge AI Device 数据处理层AI模型产生的数据还不能直接作为最终统计结果。

    6400编辑于 2026-09-24
  • 来自专栏玉树芝兰

    如何用 Llama 3 免费本地 AI 分析数据和可视化?

    帮助你消除调用大模型 API 带来的数据安全烦恼。 模型 今天我们来探讨一个有趣的话题 —— 如何使用 Llama 3 免费地进行数据分析和可视化。 关于 700 亿参数的模型,我之前已经为你撰写了一篇文章《如何免费用 Llama 3 70B 帮你做数据分析与可视化?》,如果你感兴趣,欢迎点击链接阅读。 问题 只不过在利用 Llama 3 8B + Open Interpreter 执行数据分析过程中,你仍然会遇到一些障碍。 机构数据的安全性可以得到最大限度的保障。 小结 我们来总结一下,Llama 3 相对于前一代产品有了实质性的进步。这种进步现在还不完美。 祝 AI 辅助数据分析愉快!

    2.2K10编辑于 2024-04-26
  • 来自专栏Sign

    数据分享3

    这个算是最后一篇了,后续不打算再分享数据了。 原因后面说。 首先,小卜,out。 ? 这个世界真是残酷啊。 小卜巅峰的时候达到dau 8k+,眼看着就要越过1w的槛了,然后,被人拉下来,踢出去了。

    54130发布于 2018-07-23
  • 来自专栏大大的小数据

    @@@全民AI写代码+数据分析?AI+WPS文档表格+AirScript3步搞定2024.3.14

    1、打开WPS金山表格-效率-高级开发-AirScript脚本编辑器-新建脚本 2、点击WPS AI给AI写要求,写完了,插入代码 写代码,将Sheet1中的BC列,求平均值记录在D列,求和记录在E列, 计算和并赋值给E列单元格 const sum = WorksheetFunction.Sum(chineseTextB, chineseTextC) cellE.Value2 = sum } 3、

    1.7K10编辑于 2024-03-25
  • 来自专栏Hank’s Blog

    3-3 数据框的子集

    > x <- data.frame(v1=1:5,v2=6:10,v3=11:15) > x v1 v2 v3 1 1 6 11 2 2 7 12 3 3 8 13 4 4 9 14 5 5 10 15 > x$v3[c(2,4)] <- NA > x v1 v2 v3 1 1 6 11 2 2 7 NA 3 3 8 13 4 4 9 NA 5 5 10 15 > #找出第2列 > x[, 3 3 8 13 > x[x$v1>2,] #第1列大于2的所有元素 v1 v2 v3 3 3 8 13 4 4 9 NA 5 5 10 15 > x[which(x$v1>2),] #使用 which函数筛选第1列大于2的所有元素 v1 v2 v3 3 3 8 13 4 4 9 NA 5 5 10 15 > ? 和上面的操作一样,筛选第1列大于2的所有元素 v1 v2 v3 3 3 8 13 4 4 9 NA 5 5 10 15

    95500发布于 2020-09-16
  • 来自专栏Keegan小钢

    AI+Web3实战营日志 #3 | Router合约

    这是我的 AI + Web3 实战营的第三篇研发日志,前两篇如下: AI+Web3实战营日志 #1|开营 AI+Web3实战营日志 #2 | 完成底层合约 另外,关于 AI + Web3 实战营的相关介绍则有如下几篇文章 : 我要启动 AI + Web3 实战营了 再谈 AI+Web3 实战营:这到底能带给你什么? AI+Web3实战营,9月15日正式开营 背景 上篇日志里我们完成了 BlockETFCore 底层合约,它能处理多资产按比例的申购赎回。 +V3 混合架构。 混合 DEX 集成 根据资产特性决定走 V2 还是 V3,比如: WBNB:走 V2 其他:走 V3 Router 内部做了自动判断,用户无感知。

    29210编辑于 2025-11-12
  • 来自专栏人工智能头条

    AI 3 分钟:每周最新闻

    每天 AI 新闻那么多?其实一周 3 分钟就够了。 平时都是讲技术讲干货,太费脑子。周一是一周最难熬的一天,所以我们今天聊点轻松的话题。 全文大约2000字。读完可能下面这首歌的时间 ? ? 新闻联播8分钟讲 AI 上周最大的新闻,恐怕就是新闻联播给了 AI 8 分钟的展示镜头。也就是说,新闻联播花了 27% 的篇幅,在说一件事情。 farmingvillein 大概算了一下成本: 4 颗云 TPUs ✖ 2美元/小时(preemptible) ✖ 24小时/天 ✖ 4天 = $768 (约合 5300 人民币) 16 颗云 TPUs = ~$3k 甚至百度还联合有关部门,将北京海淀公园打造成全球首个 AI 公园。阿里在杭州搞智慧城市,百度在北京搞 AI 公园,好!非常好! 他们发了一篇 10w+ 的文章,大意是:“一个文科女生,没有博士学位,经过 Fast.ai 三个月的培训,直接入职 Google 大脑做 AI”。

    2.9K30发布于 2018-12-06
  • 来自专栏大数据实战演练

    DeepSeek 开源周压轴大戏:3FS 处理数据堪比光速,引爆 AI 数据效率革命

    我们一起来看: 开源周最后一天,DeepSeek 震撼发布了 3FS 并行文件系统。这个被誉为“AI 数据高速公路”的技术,究竟有什么特别之处?又将为我们的未来带来哪些改变? 一、3FS 是什么? 它像一个“超级数据仓库”,通过整合现代 SSD 的存储速度和 RDMA 网络的全带宽,让海量数据在 AI 模型训练和推理中“跑”得更快、更稳。 三、3FS 的意义:AI时代的“技术普惠” 3FS 的开源,不仅是技术突破,更是对AI行业的深远影响: 降低门槛提供标准文件接口和易用的数据处理框架 Smallpond,让普通开发者也能轻松驾驭 PB 加速创新从医疗影像分析到 AI 绘画,3FS 的高吞吐和强一致性为多领域提供底层支持,推动AI应用爆发。 想象一下,未来 AI 模型训练像“搭积木”一样简单,数据处理像“闪电取快递”一样快。3FS 正让这一愿景成为现实。无论是科研人员还是企业开发者,都能通过开源社区共同优化技术,让AI更普惠、更强大。

    71000编辑于 2025-03-17
  • 来自专栏火星娃统计

    GEO数据挖掘3

    数据挖掘3 sunqi 2020/7/11 概述 对下载好的基因初步分析,进行PCA分析和热图绘制 PCA 绘制 rm(list = ls()) options(stringsAsFactors = F file = 'step1-output.Rdata') table(group_list) ## group_list ## Control Vemurafenib ## 3 3 # 查看数据 dat[1:4,1:4] ## GSM1052615 GSM1052616 GSM1052617 GSM1052618 ## ZZZ3 11.26970 11.12560 ) # install.packages(c("FactoMineR", "factoextra")) library("FactoMineR") library("factoextra") # 数据处理 # 对数据进行归一化 # 因为是按照基因归一化,所以先进行转置,然后再转置回去 n=t(scale(t(dat[cg,]))) # 对绝对值大于2的数取绝对值2 # 使得最后的数据范围控制在2以内 n[

    1.3K31发布于 2020-09-15
  • 来自专栏网络收集

    数据类型(3)

    因此我们定义了 BigInteger/BigDecimal 类来保存这类数据,实际是以字符串形式在堆区存储。BigInteger 类主要用来操作比 long 类型更大的整型数字。 // 绝对值a.compareTo(b); // 比较大小// BigDecimal 类专用BigDecimal x = y.setScale(3, ,等到创建对象或调用方法时再明确数据类型。 编译过程中,由编译器检查类型安全,自动隐性地对类的数据类型进行强制转换(Object -> 指定数据类型)。编译后生成的 字节码文件(.class) 将不再含有泛型。 Test{ static void main(String[] args){ Box<Integer> myBox = new Box<>(); myBox.set(3)

    51340编辑于 2022-08-03
  • 来自专栏生信菜鸟团

    TCGA数据整理-3

    另一个数据集的整理 GSE162550 下载这两个文件 建立工作目录 rm(list = ls())proj = "DHA"#1.获取表达矩阵dat = data.table::fread("GSE162550 顺便看下表达矩阵,空的dim(exprs(eSet))save(exp,Group,proj,clinical,file = paste0(proj,".Rdata")) 差异分析 三种差异分析函数比较: 输入数据都是 = topTable(fit, coef=2, n=Inf)DEG3 = na.omit(DEG3) k1 = (DEG3$P.Value < pvalue_t)&(DEG3 $logFC < -logFC_t)k2 = (DEG3$P.Value < pvalue_t)&(DEG3$logFC > logFC_t)DEG3$change = ifelse(k1,"DOWN" ="NOT"]cg3 = rownames(DEG3)[DEG3$change !

    42110编辑于 2024-07-11
  • 来自专栏Android开发指南

    3.数据存储

    还有缓存中一般是存放一些内存中一些直接读取的数据。               3. 储存步骤 得到了SharedPreferences对象之后, 就可以开始向SharedPreferences文件中存储数据了,主要可以分为三步实现。 1. 向 SharedPreferences.Editor 对象中添加数据,比如添加一个布尔型数据就使用 putBoolean方法,添加一个字符串则使用 putString()方法,以此类推。 3. 调用 commit()方法将添加的数据提交,从而完成数据存储操作。

    1.4K70发布于 2018-05-14
  • 来自专栏R语言 / Linux

    GEO数据挖掘—3

    GEO数据挖掘—3 富集分析 (一)GO富集分析(用差异基因做富集) 输入数据 #(1)输入数据 gene_up = deg$ENTREZID[deg$change == 'up'] gene_down save(ego,ego_BP,file = f) } #(3)可视化 #条带图 barplot(ego) barplot(ego, split = "ONTOLOGY", font.size = 10 , #layout = "star", color.params = list(foldChange = gl), showCategory = 3) organism = 'hsa') save(kk.diff,kk.down,kk.up,file = f2) } load(f2) #(3) 复杂数据及其分析 1.多分组数据:示例GSE474 2.多数据联系分析:例如GSE83521_ and_ GSE89143 批次效应

    65700编辑于 2023-03-20
  • 来自专栏企鹅号快讯

    AI需要大数据,而大数据也需要AI

    美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据和AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。

    904100发布于 2018-01-18
  • AI数据分析可信度验证:从数据溯源到结论核查的3级评估框架

    第一级:数据溯源——AI用的数据从哪来可信度的起点,是回答一个最基本的问题:AI得出这个结论,依据的是哪些数据?这听起来简单,但在实际场景中远比想象中复杂。 AI不应该访问超出用户权限范围的数据。这不是功能层面的加分项,而是企业数据治理的底线。好的产品会在给出结论时让用户感知到"这是在你权限范围内能看到的全部数据",而不是让用户去猜测AI有没有越权。 第二级:过程可解释——AI的分析路径是否经得起追问数据溯源解决了"数据从哪来"的问题,但用户更关心的是:AI是怎么从数据得出这个结论的?这对应着AI问数产品中最核心的能力——分析过程的可解释性。 ● 第二级(过程可解释)→ L2模型层:可查看分析涉及的数据模型、表关系、维度关联,AI的分析路径在模型层面是透明的 ● 第三级(结论可核查)→ L3数据层:可查看原始数据表、行数、更新时间,用户可基于这些信息独立验证 、指标体系和权限体系,在已有资产上增加AI Agent能力——这意味着企业在第一级"数据溯源"上的投入(指标定义、口径管理、权限体系)可以无缝延续到AI阶段,不需要为了AI重新做一遍数据治理。

    20200编辑于 2026-08-21
领券