02 k近邻算法的缺点 对于一个新的预测数据来说,需要O(m * n): ? 当然针对kNN缺点,有很多优化,比如使用树结构:KD-Tree, Ball-Tree。 前面介绍了kNN算法的第一个缺点:效率低下; kNN算法的第二个缺点:kNN算法得到的最终结果是高度的数据相关,当然对于我们的机器学习算法来说,就是使用喂给机器学习算法的数据来进行预测,所以理论上所有的机器学习算法都是高度的数据相关的 ,不过kNN算法对大的噪声数据(outlier)更加的敏感,比如说假设使用3近邻算法,如果我们预测样本周边一旦有2个错误的值的话,就足以让我们最终的预测结果错误,但是在整个空间中是有大量正确的样本的,这就是 实际上,使用机器学习算法来处理数据的时候,在实际生产环境中,在很多领域处理成千上万维的数据是很正常。当然维度过高,可以通过降维的方式来解决。 03 机器学习流程回顾 ? 划分数据集为训练集和测试集; 对于kNN这种算法,需要数据在同一尺度下,因此要进行数据的归一化: 先将训练集进行归一化Scaler,然后将归一化后的数据进行训练,得到最终的模型; 测试集要使用训练集上的
这篇就按当天的真实节奏,把关键步骤、坑点、以及当时的体感记录下来——以后再遇到类似“明明有数据但检索不到”的问题,可以直接按这份清单排查。 AI/向量逻辑优先放 Python:文本处理、入库流水线、检索策略在 Python 里更顺手,也更容易做成单一事实来源。 按时间线拆解) 1)目标确认:先把“能用的 RAG”跑起来 我给自己定的验收标准很简单: 能流式对话(体验像“打字机”一样顺滑) 能从 Supabase 向量库检索到上下文并回答 能按日期准确命中(例如:问 4- 9 必须能明确找到 2026-4-09.md) 2)第一轮实现:RAG 通了,但日期查询会漂移 现象库里确实有 2026-4-09.md 的切片,但问“4-9 写了什么”时,经常出现: 找不到相关内容 4)工程落地:把 AI/向量逻辑迁到 Python,并保持前端体验 当天的关键决定是:AI 交互链路优先走 Python,前端只做同源代理和 UI。
美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据和AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
AI和大数据已经形成了一种真正的共生关系,彼此需要相得益彰。 美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
一篇关于數據倉庫建設、人工數據分析、AI數據分析的讲义 數據Data&信息Information 信息 信息是一個客觀存在物體的自然表現,比如說“I am a local villain.” 隨著數據的不斷累積和堆積在數據背後發現了驚人的統計規律,隨著這些統計規律的發展漸漸的出現了AI分析和數據分析。 數據&數據分析&AI 如下圖是建立數據分析工程的過程 ? 根據需要訓練AI模型。 數據倉庫的建立 聯機事物型系統&決策分析系統 在數據能力上,通常將系統的數據結構模型分為2類,聯機事物型、決策分析型。 數據倉庫案例展示superset 地址:http://192.168.0.212:8088 賬號:admin 密碼:admin 數據分析到AI訓練 進過大量的數據演練,可以逐漸的發現數據背後的統計規律。
一位在数据领域深耕多年的创业者告诉我,早期AI在数据工程领域的切入点其实很务实——那些原本需要大量人工的数据治理工作,恰恰是大模型最擅长的地方。 比如从海量数据中提炼关键信息、自动生成数据文档、识别重复和冗余的表结构。这些事情以前要靠专人花时间梳理,现在AI可以快速完成。 但这只是第一步。 更深层的变化在于,数据工程的需求本身正在被AI重塑。 以前的交付物很明确:一张张处理好的数据表,加上一个Dashboard,业务方看数据就够了。 现在呢?业务方不仅看Dashboard,还想直接跟数据对话——问AI一个问题,AI直接给出答案。 好的数据工程,应该配合AI在事中就做好管理和体系搭建。” 这句话背后是一个残酷的现实:以前数据工程师的工作更像是管道工——把数据从A搬到B,分层、清洗、汇总。 现在的要求变成了规划师——不仅要搬数据,还要让数据能被AI正确理解和调用。 这需要的不仅是技术能力,更是思维方式的转变。
由于原定举办地美国新奥尔良在其他时间无合适会场酒店,AAAI 2017 将改为 2017 年 2 月 4-9 日在旧金山举行,新奥尔良改为举办 AAAI 2018,于 2018 年 2 月 3-10 日举行 来源:腾讯科技 谷歌让AI读爱情小说 要把它调教得更加性感 为了让AI更加善解人意,更加健谈,谷歌今日发起了一个项目,让自家AI读了2865本爱情小说,来提高AI理解语言的能力。 该项目的出发点是提高用户体验,让AI更有“人情味”。 项目负责人Andrew Dai在接受BuzzFeed采访时表示:谷歌AI的回应一般很一本正经,我们希望能够借助这个项目以及未来的其他项目让它更健谈,或者能够展现更多的语调或风格。” 来源雷锋网
整理 | 阿司匹林 出品 | 人工智能头条(AI_Thinker) 想要成为一名数据科学家,首先你得学会数据分析,而 Python 就是一个很好的数据分析工具。 这门课程将教会你使用 Python 来分析所有类型的数据,而且不需要任何的编程经验。 以下是课程内容介绍: ▌课程主题 介绍/审查命令行 Python 基础知识及其数据类型 数据分析软件包 Numpy 和 Pandas 绘图软件包 Matplotlib 和 Seaborn 统计学 常用表达 第 4-9 课将介绍如何使用 Python 进行编程。主要内容将是 Learn Python 3 the Hard Way。 第 10-18 课将着重介绍如何用 Python 软件包进行数据分析。我们将使用 Python for Data Analysis 作为教材,这本书的主要内容是数据分析,数据统计和制作漂亮的图表。
SEAJ指出,因以ChatGPT为代表的生成式AI需求扩大,数据中心所需的服务器投资预估将增加,且存储、逻辑/晶圆代工投资预估将复苏,加上在各国政府支持下,厂商计划进行大规模投资,因此预估2024年度( SEAJ指出,2025年度(2025年4月-2026年3月)日本芯片设备销售有望进一步增长、预估将年增10%至43187亿日元,将首度冲破40000亿日元大关,主因除了PC、智能手机、数据中心用服务器需求外 关于生成式AI所带动的芯片需求增长刺激的相关设备需求,日本半导体设备巨头东京电子(TEL)执行董事川本弘7月初接受日媒专访表示,“目前已有询单,规模虽仍小,不过预估将自2024年度上半年(2024年4- 川本弘指出,“今后生成式AI用服务器芯片需求数将扩大,就中长期来看、预估将成为下一个成长动能”。
11月6日,日本相机及光刻机大厂尼康(Nikon)公布了2026财年上半年(2025年4-9月)财报。 从主营业务来看,今年4-9月期间精机业务(包含半导体光刻、FPD光刻设备)营收较去年同期减少14.3%至698.86亿日元、营业利润受益于结构改革效益而暴涨222.6%至30.44亿日元;图像业务(相机业务 从产品销量来看,4-9月期间,尼康半导体光刻机销量为9台,低于去年同期的10台;FPD光刻设备销量为15台,低于去年同期的16台;尼康单反相机全球销售量同比增长17%至48万台、更换用镜头销售量同比增长
图⑥:V10连资料库版(迭代10-13)——五模块资料接进来,左侧九项导航,界面终于"有内容"第二步:AI智能+数据贯通(迭代14-16)AI智能输入:WorkBuddy生成的台子里,右下角的AI助手能听懂 "七年级有理数"、"打开错题库"这类自然语言指令,娃不用记菜单在哪数据分析:把打卡、任务、错题、专注时间汇总成周报和热力图,哪天划水、哪科薄弱,一眼看出一个真实插曲:AI智能输入刚加时,我让它"打开数学 后来才发现是训练数据里"数学"关联偏了,我专门喂了一批指令样例("七年级有理数""初三物理浮力")才调准。所以别神话AI输入,它也需要你教。 图⑦:V16智能化当前版(迭代14-16)——AI输入+数据看板,台子从"工具"变成"中枢"图①:12个模块分四层组织,不是堆功能三、12个模块是怎么组织的? 其实模块之间是有层次的:计划层:今日总览、今日打卡、学习任务、目标管理执行层:学科管理、学习打卡、番茄专注、资料库检查层:错题库、数据分析激励层:读书笔记、日历贯穿全局:AI智能输入、本地持久存储你可以根据自己孩子学生自己的需求
最近,Lightning AI创始人、AI研究大牛Sebastian Raschka发表了一篇博客,描述了Llama 2中的RLHF机制和原版相比做出了哪些改变和提升,还介绍了几个RLHF算法的替代方案 Margin Loss 在标准InstructGPT中使用的RLHF PPO方法,研究人员需要收集同一个提示下的4-9个模型输出并进行排序,比如四个回复的排序结果为A<C< D<B,那么就可以得到六个对比结果 :A < C,A < D ,A < B,C < D,C < B,D < B Llama 2的数据集也采用类似的方式,不过标注人员每次只能看到两个(而非4-9个)回复并进行对比,但新增了一个边际(margin 宪政AI:人工智能反馈的无害性 研究人员提出了一种基于人类提供的规则列表的自我训练机制,也使用了强化学习的方法。 论文标题:Constitutional AI: Harmlessness from AI Feedback 论文链接:https://arxiv.org/abs/2212.08073 发表日期:2022
开篇介绍AI训练的瓶颈往往不是模型计算,而是数据预处理。openEuler提供高效的数据处理管道,支持并行加载、GPU预处理、数据增强等优化。今天聊聊如何加速AI数据处理。 数据处理优化:多进程DataLoader并行加载提升5-10倍,DALIGPU预处理释放CPU,预取机制减少等待时间,数据缓存避免重复读取。 存储优化:NVMeSSD提升I/O吞吐,分布式文件系统支持大规模数据集,数据格式优化TFRecord/Parquet提升读取效率。 QPS提升40%,Web服务器并发提升50%,大数据任务快35%。 优化要基于数据驱动,每次都要测试对比,确保有效且稳定。
流水线中的数据存储类型和量级 图片 每个AI流水线中都涉及到数据存储 数据源-数据提取过程中涉及到: PB级别的顺序写 数据准备过程中: TB级别的顺序读 模型训练过程中: GB级别的随机读 检查点和恢复过程中 中间采用高性能全闪存,通过是TLC, 弥补机械盘性能, 总容量比HDD少 右边采用对象存储, 存储集群或JBODS, 包含大量机械盘, 总容量占比高 AI集群中的数据移动 图片 1.数据采集阶段,原始数据按顺序写入对象存储层 RAG 还可以创建额外的 I/O 活动 5.归档流程: 模型输入和输出被捕获并写入对象存储层的磁盘 旨在优化 AI 存储效率的产品组合 QLC 提升新型 AI DC(数据中心) 构建的电源效率 每个 DGX 有关建模详细信息,请参阅附录“QLC 功率效率与 HDD” 模型训练与数据存储 AI 数据穿越存储层之旅 最近的检查点基本在SSD上 早期的检查点数据在HDDS AI数据量级和性能 检查点:提高存储容量和吞吐量 Blob 存储层一次性访问可实现高吞吐量 AI负载中的存储扩展性 总结 AI集群流程中的数据存储需要根据实际业务的量级和性能要求做分层存储, 这样成本可控且性能满足需求 AI行业也会带动存储行业发展,
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
随着AI应用对多源异构数据的需求增加,企业对于非结构化数据的价值化需求也在加速释放,而相应的数据治理模块也将获得进一步的关注与优化。 对于部署AI应用的企业来说,数据资源的质量直接决定了AI应用能否成功落地。因此,在推进AI应用的过程中,开展针对性的数据治理工作是首要且必要的步骤。 AI模型对数据高度敏感,低质量的数据会导致“garbage in, garbage out”的问题,即输入数据的缺陷会直接影响到输出结果的质量。 为了确保AI模型的有效性和准确性,必须保证数据的完备性和准确性。有效的数据治理不仅可以为AI模型提供高质量的数据原料,还能提高模型的拟合效果,进而增强AI应用的实际性能。 在金融、医疗、零售、工业以及互联网等数据基础建设较好的行业中,面向AI时代的数据治理正在逐步显现其优势。
这也是很多大数据部门领导非常焦虑的地方。 那么出路在哪里呢? All In AI 事实上,真正能帮助业务提高效能,提供创新产品的必然是AI,AI是一种模式的输出。 从上面我们可以看到,数据部门的最大价值,最终会通过AI来进行落地,并且还会给部门/公司提供了极为丰富的想象空间。 如何 All In AI? 对于这件事情,我们要仔细研究一个核心的东西: 资源。 我们知道,AI平台是基于数据平台的之上的,其结构是一个金字塔形状的。所以第一步你需要有一个良好的数据平台,其次你还需要有一个AI平台,让单一算法落地变得容易。 现阶段,按我的了解,AI平台通常只能做到针对单一算法的自助化。那么为了让组织更加合理高效,重构数据部门团队就很有必要了。 总结 本文我们说了为什么要All In AI,要实现All In AI 不仅仅需要有一个好的平台(数据、算法平台),也需要有良好的动员人力资源的能力,采用一个合理的算法组织架构充分利用人力资源。
上个月参加一个AI技术沙龙,我问了在座的技术负责人这样一个问题。 原本以为会听到关于算力、算法或者成本的回答,结果大家的答案出奇一致——数据质量。 一个创业公司的CTO感慨地说:"我们现在花的钱,80%都在找数据、清洗数据、标注数据,真正的模型训练反而是小头。" 这个回答让我意识到,我们正处在AI发展的一个重要转折点。 解密高质量数据集的三张面孔 很多人对数据集的理解还停留在"图片+标签"的层面,认为只要有数据就能训练AI模型。但实际上,高质量数据集远不止这么简单。 从数据模态来看,现代AI需要的是多维度的数据生态。 2025年,AI智能体和高质量数据集建设的双重推进,将把人工智能带入一个新的发展阶段。这个阶段的特征是数据质量成为决定性因素,技术创新与数据资源同等重要。 数据质量决定AI命运,也决定我们在AI时代的命运。
此时,一套基于AI技术的智能数据采集管理系统应运而生,它如同精密运转的数字中枢,将杂乱无章的信息流转化为可挖掘的金矿,为企业数字化转型提供坚实的数据底座。 一、多源异构数据的无缝对接:打破“数据孤岛”壁垒系统具备强大的跨平台、多格式数据接入能力,无论是结构化数据库、半结构化日志文件,还是非结构化的音视频素材,均可通过标准化接口实现统一纳管。 五、自适应迭代优化循环:与企业发展同频共振系统具备自我进化的自适应迭代能力,通过持续收集用户反馈和使用习惯数据,AI引擎会自动调整采集策略优先级。 六、典型应用场景示例:赋能多行业数字化转型AI数据采集管理系统已在多个行业落地应用,创造显著价值:在智能制造领域,系统实时监控生产线参数波动,提前预警设备故障风险,帮助企业将良品率提升15%;智慧城市建设中 八、未来演进方向展望:开启数据智能新篇章随着联邦学习、隐私计算等新技术的成熟,下一代AI数据采集管理系统将实现更多突破:通过联邦学习技术,实现跨组织联合建模而不共享原始数据,打破数据协作的隐私壁垒;采用边缘节点自主决策与云端协同优化模式