首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏cwl_Java

    C++编程之美-结构之法(代码清单3-10)

    代码清单3-10 class Queue { public: Type MaxValue(Type x, Type y) { if(x > y)

    28040编辑于 2022-11-30
  • 来自专栏devops_k8s

    Go Protobuf(比xml小3-10倍, 快20-100倍)

    protocol buffers 是一种灵活,高效,自动化机制的结构数据序列化方法-可类比 XML,但是比 XML 更小、更快、更为简单。 你可以定义数据的结构,然后使用特殊生成的源代码轻松的在各种数据流中使用各种语言进行编写和读取结构数据。你甚至可以更新数据结构,而不破坏根据旧数据结构编译而成并且已部署的程序。 1 . Protobuf是一种轻便高效的结构化数据存储格式; 4 . 传输前使用protobuf编码,接收方再进行解码,可显著地降低二进制传输数据的大小。另外,protobuf非常适合传输结构化数据,便于通信字段的扩展。 ? 用途 1 . 可以轻松引入新字段, 中间服务器不需要检查数据, 可以简单解析他并传递数据而无需了解所有字段; 2 .

    2.6K50发布于 2021-04-13
  • 来自专栏AI机器学习与深度学习算法

    机器学习入门 3-10 Numpy中的比较和Fancy Indexing

    1:3, col]) ''' [[ 4 6 7] [ 8 10 11]] ''' numpy.array 比较 使用 bool 来进行 Fancy Indexing 比较常见,很多时候我们会对数据进行批量的比较 不过,在 sklearn 中封装的机器学习算法往往接收的数据类型是 NumPy 数组。 因此,我们使用 sklearn 实现机器学习算法通常会依照下面的流程: 使用 Pandas 库对数据进行一系列的预处理操作; 将预处理后的数据转换成 NumPy 数组; 使用 sklearn 对 NumPy

    1K20编辑于 2022-11-08
  • 来自专栏华章科技

    手把手教你用Python进行帕累托分析(二八定律)

    3-10是某个月中海鲜系列的10个菜品A1~A10的盈利额(已按照从大到小的顺序排序)。 ? ▲图3-10 菜品盈利数据帕累托图 由图3-10可知,菜品A1~A7共7个菜品,占菜品种类数的70%,总盈利额占该月盈利额的85.0033%。 表3-5是餐饮系统对应的菜品盈利数据,绘制菜品盈利帕累托图,如代码清单3-8所示。 ▼表3-5 餐饮系统菜品盈利数据 ? plt.ylabel('盈利(比例)') plt.show() 关于作者:张良均,资深大数据挖掘与分析专家、模式识别专家、AI技术专家。 有10余年大数据挖掘与分析经验,擅长Python、R、Hadoop、Matlab等技术实现的数据挖掘与分析,对机器学习等AI技术驱动的数据分析也有深入研究。

    2.1K10发布于 2020-11-16
  • 腾讯云AI大模型全信创解决方案:驱动证券期货业数智升级

    第二章 部署AI大模型全信创解决方案 腾讯云提供证券期货业AI大模型全信创解决方案,以“智能体层-大模型服务层-大模型平台层-大数据平台层-云智算中心层”五层架构为核心,覆盖全链路工具自主可控(来源:证券期货业 :推动大数据AI融合,通过统一集群(云原生数据湖+AI)、统一元数据(多模态统一治理)、统一开发(DataOps+MLOps+LLMOps一体化)解决割裂问题(来源:信创大数据章节); 信创数据库 :实现LLM能力下沉至DB,支持全链路向量检索、AI原生SQL语法、NL2SQL交互,减少应用层链路调用(来源:信创数据库章节); 信创操作系统(TencentOS Server AI):AI原生OS 通过qGPU虚拟化(内核态劫持,故障隔离强,支持容器共享)提升GPU利用率3-10倍,及TACO-LLM训推加速框架优化模型性能(来源:信创操作系统章节); 信创AI平台(TCADP):提供智能体低代码开发 第三章 量化应用成效与客户价值 方案落地实现三大核心指标突破(数据严格基于原文): GPU利用率提升3-10倍:通过qGPU虚拟化(内核态劫持设计,支持训练推理在离线混部、故障显存算力强隔离),打破

    43410编辑于 2026-05-01
  • 来自专栏企鹅号快讯

    AI需要大数据,而大数据也需要AI

    美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。

    888100发布于 2018-01-18
  • 来自专栏ATYUN订阅号

    【观点】AI需要大数据,而大数据也需要AI

    AI和大数据已经形成了一种真正的共生关系,彼此需要相得益彰。 美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 “通过云计算,任何人都可以轻而易举地获得数据,大数据AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。

    59270发布于 2018-03-06
  • 来自专栏AI系统

    AI系统】数据并行

    数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。

    1.2K10编辑于 2024-12-07
  • 来自专栏技术墨客

    数据AI

    一篇关于數據倉庫建設、人工數據分析、AI數據分析的讲义 數據Data&信息Information 信息 信息是一個客觀存在物體的自然表現,比如說“I am a local villain.” 隨著數據的不斷累積和堆積在數據背後發現了驚人的統計規律,隨著這些統計規律的發展漸漸的出現了AI分析和數據分析。 數據&數據分析&AI 如下圖是建立數據分析工程的過程 ? 根據需要訓練AI模型。 數據倉庫的建立 聯機事物型系統&決策分析系統 在數據能力上,通常將系統的數據結構模型分為2類,聯機事物型、決策分析型。 數據倉庫案例展示superset 地址:http://192.168.0.212:8088 賬號:admin 密碼:admin 數據分析到AI訓練 進過大量的數據演練,可以逐漸的發現數據背後的統計規律。

    95250发布于 2019-11-21
  • AI Agent + 数据工程

    一位在数据领域深耕多年的创业者告诉我,早期AI数据工程领域的切入点其实很务实——那些原本需要大量人工的数据治理工作,恰恰是大模型最擅长的地方。 比如从海量数据中提炼关键信息、自动生成数据文档、识别重复和冗余的表结构。这些事情以前要靠专人花时间梳理,现在AI可以快速完成。 但这只是第一步。 更深层的变化在于,数据工程的需求本身正在被AI重塑。 以前的交付物很明确:一张张处理好的数据表,加上一个Dashboard,业务方看数据就够了。 现在呢?业务方不仅看Dashboard,还想直接跟数据对话——问AI一个问题,AI直接给出答案。 好的数据工程,应该配合AI在事中就做好管理和体系搭建。” 这句话背后是一个残酷的现实:以前数据工程师的工作更像是管道工——把数据从A搬到B,分层、清洗、汇总。 现在的要求变成了规划师——不仅要搬数据,还要让数据能被AI正确理解和调用。 这需要的不仅是技术能力,更是思维方式的转变。

    40010编辑于 2026-02-28
  • 腾讯云AI全栈信创方案推动证券基金行业数智升级

    行业面临AI落地与信创转型双重挑战 证券基金行业在AI应用深化与信创转型过程中面临三重瓶颈:GPU资源利用率普遍低于30%,算力成本高昂且存在潮汐效应;大数据AI系统割裂,导致数据流转效率低、开发运维复杂 腾讯云推出AI原生全栈信创解决方案 腾讯云构建覆盖IaaS到SaaS层的5T产品矩阵:TCE信创云实现异构算力统一调度,TBDS大数据平台打通数据AI壁垒,TDSQL数据库内置NL2SQL能力,Tencent 实现关键性能指标显著提升 算力利用率提升3-10倍:通过qGPU内核态虚拟化技术,实现训练推理混合部署,突破GPU资源隔离瓶颈(来源:腾讯云技术白皮书) 推理性能大幅优化:在DeepSeek-R1场景下 投研平台,实现投研报告生成效率提升5倍,日均处理非结构化数据量达TB级。 数据来源:腾讯云官方技术文档、环球Tech报道、信创工委会评估报告、行业客户实践案例 专家证言:腾讯云资管行业高级架构师杨磊表示:"AI信创转型需要从算力基础到应用生态的全栈重构,而非单点替换"

    34710编辑于 2026-04-30
  • 来自专栏#大模型热点基础知识

    为什么给几个例子就能让AI学会新任务?

    本文收录于Github:AI-From-Zero项目——一个从零开始系统学习AI的知识库。如果觉得有帮助,欢迎⭐Star支持!什么是少样本学习?为什么给几个例子就能让AI学会新任务? by@Laizhuocheng一、简介少样本学习(Few-shotLearning)是一种通过提供少量示例(通常3-10个),就能让AI模型快速理解和执行新任务的学习范式。 大语言模型具有上下文学习能力,这意味着它们能够:从提供的示例中识别模式理解输入和输出之间的映射关系将学到的模式应用到新的输入上这种能力源于模型在预训练阶段接触过大量"问题-答案"、"指令-响应"的配对数据 效果可能不佳难以处理完全未知的概念可能过度拟合示例模式4.成本考虑更长的Prompt意味着更高的计算成本需要在效果和成本之间权衡七、少样本vs其他学习范式方法示例数量适用场景优势劣势零样本0简单、标准任务最灵活、成本最低复杂任务效果有限少样本3- 好的示例就像精心设计的教学材料,能够引导AI快速掌握任务的本质;而随意的示例则可能导致AI学到错误的模式。掌握少样本学习的关键在于理解:示例不仅是数据,更是教学策略。

    59210编辑于 2026-03-18
  • 来自专栏新智元

    AI快报】AAAI 2017为华人科学家改期 | 谷歌让AI读爱情小说

    由于原定举办地美国新奥尔良在其他时间无合适会场酒店,AAAI 2017 将改为 2017 年 2 月 4-9 日在旧金山举行,新奥尔良改为举办 AAAI 2018,于 2018 年 2 月 3-10 日举行 来源:腾讯科技 谷歌让AI读爱情小说 要把它调教得更加性感 为了让AI更加善解人意,更加健谈,谷歌今日发起了一个项目,让自家AI读了2865本爱情小说,来提高AI理解语言的能力。 该项目的出发点是提高用户体验,让AI更有“人情味”。 项目负责人Andrew Dai在接受BuzzFeed采访时表示:谷歌AI的回应一般很一本正经,我们希望能够借助这个项目以及未来的其他项目让它更健谈,或者能够展现更多的语调或风格。” 来源雷锋网

    69170发布于 2018-03-27
  • openEuler 高效 AI 数据管道

    开篇介绍AI训练的瓶颈往往不是模型计算,而是数据预处理。openEuler提供高效的数据处理管道,支持并行加载、GPU预处理、数据增强等优化。今天聊聊如何加速AI数据处理。 数据处理优化:多进程DataLoader并行加载提升5-10倍,DALIGPU预处理释放CPU,预取机制减少等待时间,数据缓存避免重复读取。 存储优化:NVMeSSD提升I/O吞吐,分布式文件系统支持大规模数据集,数据格式优化TFRecord/Parquet提升读取效率。 QPS提升40%,Web服务器并发提升50%,大数据任务快35%。 优化要基于数据驱动,每次都要测试对比,确保有效且稳定。

    36610编辑于 2025-12-03
  • 来自专栏AI

    AI中的数据存储

    流水线中的数据存储类型和量级 图片 每个AI流水线中都涉及到数据存储 数据源-数据提取过程中涉及到: PB级别的顺序写 数据准备过程中: TB级别的顺序读 模型训练过程中: GB级别的随机读 检查点和恢复过程中 中间采用高性能全闪存,通过是TLC, 弥补机械盘性能, 总容量比HDD少 右边采用对象存储, 存储集群或JBODS, 包含大量机械盘, 总容量占比高 AI集群中的数据移动 图片 1.数据采集阶段,原始数据按顺序写入对象存储层 RAG 还可以创建额外的 I/O 活动 5.归档流程: 模型输入和输出被捕获并写入对象存储层的磁盘 旨在优化 AI 存储效率的产品组合 QLC 提升新型 AI DC(数据中心) 构建的电源效率 每个 DGX 有关建模详细信息,请参阅附录“QLC 功率效率与 HDD” 模型训练与数据存储 AI 数据穿越存储层之旅 最近的检查点基本在SSD上 早期的检查点数据在HDDS AI数据量级和性能 检查点:提高存储容量和吞吐量 Blob 存储层一次性访问可实现高吞吐量 AI负载中的存储扩展性 总结 AI集群流程中的数据存储需要根据实际业务的量级和性能要求做分层存储, 这样成本可控且性能满足需求 AI行业也会带动存储行业发展,

    1.9K11编辑于 2024-09-18
  • 转载:【AI系统】数据并行

    数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。

    56810编辑于 2024-12-13
  • AI+Data:AI时代的企业数据治理

    随着AI应用对多源异构数据的需求增加,企业对于非结构化数据的价值化需求也在加速释放,而相应的数据治理模块也将获得进一步的关注与优化。 对于部署AI应用的企业来说,数据资源的质量直接决定了AI应用能否成功落地。因此,在推进AI应用的过程中,开展针对性的数据治理工作是首要且必要的步骤。 AI模型对数据高度敏感,低质量的数据会导致“garbage in, garbage out”的问题,即输入数据的缺陷会直接影响到输出结果的质量。 为了确保AI模型的有效性和准确性,必须保证数据的完备性和准确性。有效的数据治理不仅可以为AI模型提供高质量的数据原料,还能提高模型的拟合效果,进而增强AI应用的实际性能。 在金融、医疗、零售、工业以及互联网等数据基础建设较好的行业中,面向AI时代的数据治理正在逐步显现其优势。

    1.3K10编辑于 2025-01-03
  • 来自专栏祝威廉

    数据部门如何All In AI

    这也是很多大数据部门领导非常焦虑的地方。 那么出路在哪里呢? All In AI 事实上,真正能帮助业务提高效能,提供创新产品的必然是AIAI是一种模式的输出。 从上面我们可以看到,数据部门的最大价值,最终会通过AI来进行落地,并且还会给部门/公司提供了极为丰富的想象空间。 如何 All In AI? 对于这件事情,我们要仔细研究一个核心的东西: 资源。 我们知道,AI平台是基于数据平台的之上的,其结构是一个金字塔形状的。所以第一步你需要有一个良好的数据平台,其次你还需要有一个AI平台,让单一算法落地变得容易。 现阶段,按我的了解,AI平台通常只能做到针对单一算法的自助化。那么为了让组织更加合理高效,重构数据部门团队就很有必要了。 总结 本文我们说了为什么要All In AI,要实现All In AI 不仅仅需要有一个好的平台(数据、算法平台),也需要有良好的动员人力资源的能力,采用一个合理的算法组织架构充分利用人力资源。

    51620发布于 2018-08-27
  • 数据质量决定AI命运

    上个月参加一个AI技术沙龙,我问了在座的技术负责人这样一个问题。 原本以为会听到关于算力、算法或者成本的回答,结果大家的答案出奇一致——数据质量。 一个创业公司的CTO感慨地说:"我们现在花的钱,80%都在找数据、清洗数据、标注数据,真正的模型训练反而是小头。" 这个回答让我意识到,我们正处在AI发展的一个重要转折点。 解密高质量数据集的三张面孔 很多人对数据集的理解还停留在"图片+标签"的层面,认为只要有数据就能训练AI模型。但实际上,高质量数据集远不止这么简单。 从数据模态来看,现代AI需要的是多维度的数据生态。 2025年,AI智能体和高质量数据集建设的双重推进,将把人工智能带入一个新的发展阶段。这个阶段的特征是数据质量成为决定性因素,技术创新与数据资源同等重要。 数据质量决定AI命运,也决定我们在AI时代的命运。

    35410编辑于 2026-02-02
  • AI数据采集管理系统

    此时,一套基于AI技术的智能数据采集管理系统应运而生,它如同精密运转的数字中枢,将杂乱无章的信息流转化为可挖掘的金矿,为企业数字化转型提供坚实的数据底座。 一、多源异构数据的无缝对接:打破“数据孤岛”壁垒系统具备强大的跨平台、多格式数据接入能力,无论是结构化数据库、半结构化日志文件,还是非结构化的音视频素材,均可通过标准化接口实现统一纳管。 五、自适应迭代优化循环:与企业发展同频共振系统具备自我进化的自适应迭代能力,通过持续收集用户反馈和使用习惯数据AI引擎会自动调整采集策略优先级。 六、典型应用场景示例:赋能多行业数字化转型AI数据采集管理系统已在多个行业落地应用,创造显著价值:在智能制造领域,系统实时监控生产线参数波动,提前预警设备故障风险,帮助企业将良品率提升15%;智慧城市建设中 八、未来演进方向展望:开启数据智能新篇章随着联邦学习、隐私计算等新技术的成熟,下一代AI数据采集管理系统将实现更多突破:通过联邦学习技术,实现跨组织联合建模而不共享原始数据,打破数据协作的隐私壁垒;采用边缘节点自主决策与云端协同优化模式

    53910编辑于 2025-10-16
领券