Stream变量所引用对象具有一下一种或多种功能: n读:通过Read()或ReadByte()方法实现读数据; n写:通过Write()或WriteByte()方法实现写数据; n定位:通过Position 类MemoryStream封装以无符号字节数组形式存储的数据,该数组在创建MemoryStream对象时被初始化,或者该数组可创建为空数组。可在内存中直接访问这些封装的数据。 FileStream对象与MemoryStream对象有很大区别,主要体现在以下方面: nFileStream对象的数据来自文件,而MemoryStream对象的数据来自内存缓冲区。 nMemoryStream的数据来自内存中的一块连续区域,这块区域称为“缓冲区(Buffer)”。可以把缓冲区看成一个数组,每个数组元素可以存放一个字节的数据。 它提供从基础数据源或储存库读取字节以及将字节写入基础数据源或储存库的实现。使用BinaryReader和BinaryWriter读取和写入其他数据类型。
在原生 Python 中,如果我们想计算一个元素为数值型的可迭代对象中所有元素的和,可以使用 Python 内置的 sum 函数。在 NumPy 中不仅支持 Python 内置的 sum 函数,而且还提供了优化后的 numpy.sum。
代码清单3-8 int nTargetLen = N + 1; // 设置目标长度为总长度+1 int pBegin = 0; // 初始指针
练习3-8 查询水果价格 给定四种水果,分别是苹果(apple)、梨(pear)、桔子(orange)、葡萄(grape),单价分别对应为3.00元/公斤、2.50元/公斤、4.10元/公斤、10.20
表3-5是餐饮系统对应的菜品盈利数据,绘制菜品盈利帕累托图,如代码清单3-8所示。 ▼表3-5 餐饮系统菜品盈利数据 ? 代码清单3-8 绘制菜品盈利数据帕累托图 # 菜品盈利数据帕累托图 import pandas as pd # 初始化参数 dish_profit = '.. plt.ylabel('盈利(比例)') plt.show() 关于作者:张良均,资深大数据挖掘与分析专家、模式识别专家、AI技术专家。 有10余年大数据挖掘与分析经验,擅长Python、R、Hadoop、Matlab等技术实现的数据挖掘与分析,对机器学习等AI技术驱动的数据分析也有深入研究。 本文摘编自《Python数据分析与挖掘实战》(第2版),经出版方授权发布。
美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据和AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
火山方舟 + Deepseek,轻松实现博客 AI 摘要一、AI摘要:为博客注入智慧之眼在信息爆炸时代,读者常陷入"文山字海"的困境。 为博客接入AI智能总结功能,如同为每篇文章配备一位博闻强识的"数字书童":3秒提炼:2000字长文→3句核心摘要智能标注:自动提取3-8个关键词阅读转化率提升:实测用户停留时长增加40%二、平台选择:火山方舟的三大优势想给博客加 3.3.1 后端(Java)处理用 Flux 处理连续数据流,代码示例如下: // Java流式响应示例 Flux.create(sink -> { service.streamChatCompletion doOnComplete(sink::complete) .subscribe(); });3.3.2 前端处理用微软的@microsoft/fetch-event-source库处理双向数据流 排除次要细节和例子 - 使用客观中立的表述 二、关键词提取规则: - 选择能反映文章主题的术语 - 包含专有名词和核心概念 - 优先选择高频重要词汇 - 数量控制在3-
AI和大数据已经形成了一种真正的共生关系,彼此需要相得益彰。 美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
一篇关于數據倉庫建設、人工數據分析、AI數據分析的讲义 數據Data&信息Information 信息 信息是一個客觀存在物體的自然表現,比如說“I am a local villain.” 隨著數據的不斷累積和堆積在數據背後發現了驚人的統計規律,隨著這些統計規律的發展漸漸的出現了AI分析和數據分析。 數據&數據分析&AI 如下圖是建立數據分析工程的過程 ? 根據需要訓練AI模型。 數據倉庫的建立 聯機事物型系統&決策分析系統 在數據能力上,通常將系統的數據結構模型分為2類,聯機事物型、決策分析型。 數據倉庫案例展示superset 地址:http://192.168.0.212:8088 賬號:admin 密碼:admin 數據分析到AI訓練 進過大量的數據演練,可以逐漸的發現數據背後的統計規律。
一位在数据领域深耕多年的创业者告诉我,早期AI在数据工程领域的切入点其实很务实——那些原本需要大量人工的数据治理工作,恰恰是大模型最擅长的地方。 比如从海量数据中提炼关键信息、自动生成数据文档、识别重复和冗余的表结构。这些事情以前要靠专人花时间梳理,现在AI可以快速完成。 但这只是第一步。 更深层的变化在于,数据工程的需求本身正在被AI重塑。 以前的交付物很明确:一张张处理好的数据表,加上一个Dashboard,业务方看数据就够了。 现在呢?业务方不仅看Dashboard,还想直接跟数据对话——问AI一个问题,AI直接给出答案。 好的数据工程,应该配合AI在事中就做好管理和体系搭建。” 这句话背后是一个残酷的现实:以前数据工程师的工作更像是管道工——把数据从A搬到B,分层、清洗、汇总。 现在的要求变成了规划师——不仅要搬数据,还要让数据能被AI正确理解和调用。 这需要的不仅是技术能力,更是思维方式的转变。
客户从哪来、客户怎么留,这两个问题在AI搜索时代有了新的技术答案。我做了13年SEM投放,最深的体会是停投即归零——单产品日耗3-8万是常态,年消耗千万级,账户一停咨询量断崖下跌。 这篇文章我从技术链路、平台差异、数据实测三个角度拆解这个机制。引用链路拆解:AI不直接发现你,AI通过平台发现你很多人以为AI引擎是全网搜索后自己判断哪个内容好。实测下来不是。 AI合成答案时,你的信息块能作为「某服务商的产品数据显示……」被直接引用。 每月用固定提问词在豆包、DeepSeek、Kimi各跑一遍,记录你的出现次数和引用来源变化,按数据调整内容结构。把AI搜索可见性当数据实验做,不当玄学做。 一篇能被AI引用的文章,平均生产时间4-8小时。一个编辑一周能稳定输出3-5篇,月薪市场价1-2万。企业档内容团队(1名编辑+1名运行)月成本1.5-3万,远低于SEM日耗3-8万。
2. 2-3人起步小队:轻量化协作的最小商业化单元在单人副业与3-8人工作室之间存在一个常被忽视的过渡形态:2-3人核心小队。 、AI生图生视频、参数调试、画面瑕疵修复主流AI工具熟练操作、视觉风格统一调试、基础后期修复运营兼商务内容分发、数据复盘、账号维护、商单线索初步筛选多平台分发规则、基础数据分析、客户沟通对接这一配置的关键在于 3. 3-8人中小型工作室:拆分专职岗位,同步承接多类商单当产能需求突破月度50集、同时运营多条剧集系列时,2-3人小队的弹性补位机制会触及效率上限——频繁的岗位切换导致专注度下降、质量波动加剧。 标准分工形成闭环:编剧:专注剧情策划、脚本打磨与世界观统一,保障内容逻辑与短剧节奏;AI制作专员:负责AI生图生视频、人设固化、参数调试、画面瑕疵修复,稳住成片视觉一致性;流量运营:负责内容分发、数据复盘 ;全域投放部门:负责多渠道流量运营、数据复盘、矩阵账号管理与分赛道变现优化,最大化单项目商业价值。
这一事件不仅暴露了AI宣传与科学严谨性之间的失衡,也引发行业对AI工具本质价值的重新思考。 数学家陶哲轩指出,AI当前最直接的价值在于加速文献梳理、代码生成等辅助工作,通过“工业化”流程提升研究效率-6-7。换言之,AI并非替代人类专家,而是成为增强生产力的重要工具。 -5 这种“按需组合”的策略,尤其适合中小企业快速验证AI应用原型。三、行业启示:理性看待AI能力边界GPT-5的争议事件为AI行业敲响警钟:技术宣传需与真实能力匹配。 DeepMind CEO哈萨比斯多次强调,AI创新应聚焦解决实际问题,而非追逐营销热点-3-8。对开发者而言,选择工具时也应关注其技术稳定性、数据安全性及长期性价比,而非仅被“突破性”标签吸引。 例如,部分平台通过私有化部署支持数据本地化,兼顾了灵活性与安全需求-5,为金融、医疗等敏感领域提供了应用可能。结语AI技术的前进之路,始终伴随炒作与理性的博弈。
老板问“AI搜索到底有没有用”那天,我沉默了好一会儿。以前他问搜索广告效果,我直接甩出今天的消耗和订单数:单产品日耗3-8万,每一分钱都有归因。 Princeton2023年底发在arXiv上的一篇论文测过一组数据:答案里带引用来源,被AI引擎引用的概率提升34.4%;带统计数据提升32.1%;带直接引语提升29.7%。 你按市场价算一笔账:企业档内容团队,1名编辑加1名运行,月成本1.5-3万,这个数字远低于搜索广告的日耗3-8万。两边成本摆在一起看,同样是获客,一个按天烧钱,一个按月养人。 把覆盖面从10%提到40%,这个过程就是可以写进报告的数据。把AI搜索优化当实验做,不当玄学做。每月用固定提问词在三个引擎各跑一遍,记录你的出现次数和引用来源变化,按数据调整内容结构。 这套方法你自己就能复现,而且每一次跑完都有新数据能拿去汇报。动手前先问自己:内容敢不敢让客户当面对质做AI搜索优化之前先问自己:我的产品、内容、承诺,敢不敢让客户当面对质?
开篇介绍AI训练的瓶颈往往不是模型计算,而是数据预处理。openEuler提供高效的数据处理管道,支持并行加载、GPU预处理、数据增强等优化。今天聊聊如何加速AI数据处理。 数据处理优化:多进程DataLoader并行加载提升5-10倍,DALIGPU预处理释放CPU,预取机制减少等待时间,数据缓存避免重复读取。 存储优化:NVMeSSD提升I/O吞吐,分布式文件系统支持大规模数据集,数据格式优化TFRecord/Parquet提升读取效率。 QPS提升40%,Web服务器并发提升50%,大数据任务快35%。 优化要基于数据驱动,每次都要测试对比,确保有效且稳定。
流水线中的数据存储类型和量级 图片 每个AI流水线中都涉及到数据存储 数据源-数据提取过程中涉及到: PB级别的顺序写 数据准备过程中: TB级别的顺序读 模型训练过程中: GB级别的随机读 检查点和恢复过程中 中间采用高性能全闪存,通过是TLC, 弥补机械盘性能, 总容量比HDD少 右边采用对象存储, 存储集群或JBODS, 包含大量机械盘, 总容量占比高 AI集群中的数据移动 图片 1.数据采集阶段,原始数据按顺序写入对象存储层 RAG 还可以创建额外的 I/O 活动 5.归档流程: 模型输入和输出被捕获并写入对象存储层的磁盘 旨在优化 AI 存储效率的产品组合 QLC 提升新型 AI DC(数据中心) 构建的电源效率 每个 DGX 有关建模详细信息,请参阅附录“QLC 功率效率与 HDD” 模型训练与数据存储 AI 数据穿越存储层之旅 最近的检查点基本在SSD上 早期的检查点数据在HDDS AI数据量级和性能 检查点:提高存储容量和吞吐量 Blob 存储层一次性访问可实现高吞吐量 AI负载中的存储扩展性 总结 AI集群流程中的数据存储需要根据实际业务的量级和性能要求做分层存储, 这样成本可控且性能满足需求 AI行业也会带动存储行业发展,
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
# Next.js App Router│ │ ├── api/ # API 路由│ │ │ ├── ai-completion/ # AI 辅助功能│ # 工具函数│ │ ├── api.ts # API 调用│ │ └── utils.ts # 工具函数│ ├── ai / # AI 相关功能│ └── styles/ # 样式文件└── public/ # 静态资源核心功能实现 用户行为追踪自定义事件追踪开发工具代码质量ESLint - 代码规范检查Prettier - 代码格式化TypeScript - 类型安全包管理PNPM - 快速、节省磁盘空间的包管理器游戏流程初始化:选择单词长度(3- 可变单词长度支持 3-8 个字母的单词,增加游戏难度选择2. 智能单词生成避免重复,确保每次游戏都有新鲜感3. 实时反馈即时的视觉和交互反馈,提升用户体验4. 无限游戏没有次数限制,可以连续游戏5.
随着AI应用对多源异构数据的需求增加,企业对于非结构化数据的价值化需求也在加速释放,而相应的数据治理模块也将获得进一步的关注与优化。 对于部署AI应用的企业来说,数据资源的质量直接决定了AI应用能否成功落地。因此,在推进AI应用的过程中,开展针对性的数据治理工作是首要且必要的步骤。 AI模型对数据高度敏感,低质量的数据会导致“garbage in, garbage out”的问题,即输入数据的缺陷会直接影响到输出结果的质量。 为了确保AI模型的有效性和准确性,必须保证数据的完备性和准确性。有效的数据治理不仅可以为AI模型提供高质量的数据原料,还能提高模型的拟合效果,进而增强AI应用的实际性能。 在金融、医疗、零售、工业以及互联网等数据基础建设较好的行业中,面向AI时代的数据治理正在逐步显现其优势。