Process finished with exit code 0 注意:上述代码说明两个点,一个是%r 的作用,是占位符,可以将后面给的值按原数据类型输出(不会变),支持数字、字符串、列表、元组、字典等所有数据类型 原因在于 %r 格式化字符后是显示字符的原始数据。而字符串的原始数据包含引号,所以我们看到其他字符串被格式化后显示单引号。
训练机器学习模型的目的不是为在训练集上有非常好的测试结果,而是希望在面对未知的数据集上有非常好的结果。 这里为了进一步加深对模型泛化的理解,举一个简单的小例子,这好比参加考试,在参加考试之前我们需要做很多的练习题来进行备考,这些练习题可以看做是训练数据集,我们的目的不是为了在这些练习题上达到满分,而是为了通过这些练习题让我们应对那场真正的考试 ,显然在真正的考试中那些题目都是我们没有见到过的,备考过程中得到最终考试得到更高的分数,其实和机器学习训练模型的过程是一样的,那些训练数据集就好像是我们平时做的练习题,而未来在真实生产环境中见到的新的数据则像是那场真正的考试
习题8-10 输出学生成绩 本题要求编写程序,根据输入学生的成绩,统计并输出学生的平均成绩、最高成绩和最低成绩。建议使用动态内存分配来实现。
1.1 Skill vs MCP:别搞混了 这两个概念很多人分不清: MCP(Model Context Protocol):是工具连接协议——让Claude Code能调用外部API、数据库、Jira **时效性(权重30%)** - 24小时内发布:8-10分 - 3天内:5-7分 - 超过一周:1-3分 2. **争议性(权重25%)** - 评论区有明显对立观点:8-10分 - 有讨论但方向一致:4-6分 - 几乎无讨论:1-3分 3. **受众覆盖(权重15%)** - 全栈/架构师都关心:8-10分 - 特定技术栈但人数多:4-6分 - 极度小众:1-3分 5. 生成结构化的PR描述 /changelog:扫描最近N个commit,生成面向用户的更新日志 /api-doc:扫描路由文件,自动生成API文档 /db-migrate:分析Schema变更,生成安全的数据库迁移脚本
AI和大数据已经形成了一种真正的共生关系,彼此需要相得益彰。 美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
✨核心特性⚡极低延迟:延迟仅8-10纳秒,性能优异轻量级:代码体积小,资源占用少header-only设计:无需编译和链接,集成简单日志回调:支持自定义日志回调函数频率限制:支持日志频率限制,避免日志泛滥简单易用 :API设计简洁,学习曲线平缓跨平台:支持多种操作系统和编译环境格式化支持:支持类似printf的格式化语法⚖️优缺点分析✅优点⚡极低延迟:8-10纳秒的延迟,性能优异轻量级:代码体积小,资源占用少集成简单 gitclonehttps://github.com/MengRao/fmtlog.git#将头文件复制到项目中cpfmtlog/fmtlog.hyour_project/include/包含头文件展开代码语言:C++AI 代码解释#include"fmtlog.h"快速上手示例展开代码语言:C++AI代码解释#include"fmtlog.h"intmain(){//初始化fmtlogfmtlog::setLogLevel 低中中低功能丰富度简单高中高极高简单集成难度极易易中中中跨平台是是中(Windows支持较弱)是是适用场景性能要求高的项目嵌入式/高性能企业级项目高度定制化项目C语言项目、嵌入式总结与推荐fmtlog是一个轻量级、高性能的C++日志库,以其极低的延迟(8-
美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据和AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
一篇关于數據倉庫建設、人工數據分析、AI數據分析的讲义 數據Data&信息Information 信息 信息是一個客觀存在物體的自然表現,比如說“I am a local villain.” 隨著數據的不斷累積和堆積在數據背後發現了驚人的統計規律,隨著這些統計規律的發展漸漸的出現了AI分析和數據分析。 數據&數據分析&AI 如下圖是建立數據分析工程的過程 ? 根據需要訓練AI模型。 數據倉庫的建立 聯機事物型系統&決策分析系統 在數據能力上,通常將系統的數據結構模型分為2類,聯機事物型、決策分析型。 數據倉庫案例展示superset 地址:http://192.168.0.212:8088 賬號:admin 密碼:admin 數據分析到AI訓練 進過大量的數據演練,可以逐漸的發現數據背後的統計規律。
一位在数据领域深耕多年的创业者告诉我,早期AI在数据工程领域的切入点其实很务实——那些原本需要大量人工的数据治理工作,恰恰是大模型最擅长的地方。 比如从海量数据中提炼关键信息、自动生成数据文档、识别重复和冗余的表结构。这些事情以前要靠专人花时间梳理,现在AI可以快速完成。 但这只是第一步。 更深层的变化在于,数据工程的需求本身正在被AI重塑。 以前的交付物很明确:一张张处理好的数据表,加上一个Dashboard,业务方看数据就够了。 现在呢?业务方不仅看Dashboard,还想直接跟数据对话——问AI一个问题,AI直接给出答案。 好的数据工程,应该配合AI在事中就做好管理和体系搭建。” 这句话背后是一个残酷的现实:以前数据工程师的工作更像是管道工——把数据从A搬到B,分层、清洗、汇总。 现在的要求变成了规划师——不仅要搬数据,还要让数据能被AI正确理解和调用。 这需要的不仅是技术能力,更是思维方式的转变。
了解地理空间数据可视化知识,了解和学习地理空间数据可视化三种典型可视化方式,即点、线与区域。 2. 学习并掌握获取地图上位置信息的方法。 3. 根据《鲜活的数据》第8章8.2.3介绍的方法与提供的数据,在R中绘制基本地图与散点图,并存为PDF文件; 3. 将上一步所得的PDF文件,导入Illustrator,以教材图8-10为模板,并在图中增加中国的数据,完成图8-10,并添上自己的署名,最终成图请以中文版为参考。图8-10英文版如下图所示: ? 再次提醒:最终成图是在参考图8-10的基础上,增加中国的数据。 三. 实验报告 实验报告中的实验过程请根据实验内容结合自己的具体实验过程填写; 实验结果:(1)自己家乡及其位置信息;(2)图8-10,可以手绘,可以文字描述,也可以将图缩小打印贴上; 实验分析部分可以对整个实验过程进行回顾与总结
单例CT影像约300MB,年均产生200TB数据,需按门诊15年、住院30年标准存储,本地存储造价高昂。医生诊断效率低下,单例阅片与报告撰写耗时8-10分钟,其中80%时间用于书写报告。 跨院区数据割裂导致业务协同困难,受限于院内网络环境(来源:腾讯健康医疗影像痛点分析)。 云端一体化解决方案重构诊疗流程 腾讯觅影影像云平台通过"云存储+云连接+云智能"技术架构实现突破。 平台支持多模态医学影像(放射、超声、心电、内镜等)云端存储,解决物理胶片依赖;通过远程会诊系统实现院际数据互联互通,支持多端接入远程办公;集成肺炎AI、青光眼AI、结直肠AI等辅助诊断工具,并搭载大语言模型 临床准确性经多中心试验验证:青光眼AI辅助诊断敏感性达96%、特异性92%;结直肠AI辅助检查可降低息肉漏诊率20%以上(来源:腾讯觅影临床试验数据)。 三大核心AI产品(肺炎AI、青光眼AI、结直肠AI)均获国家三类医疗器械注册证,其中结直肠AI辅助检测软件于2023年6月获创新医疗器械批准(注册证号:国械注准20233210707),是目前唯一支持单系统多设备连接的解决方案
据《日经新闻》12月17日报道,受益于AI旺盛的需求带动,全球主要11家半导体厂在今年第三季度(2025年7-9月、部分为6-8月或8-10月)合计净利润同比暴涨130%至801亿美元,创下了有数据可供追溯的 报道指出,在第三季的全球11大半导体厂中,与AI相关的半导体企业表现亮眼,英伟达、台积电等9家厂商第三季获利呈现增长或转盈,另一方面,车用芯片厂商则陷入低迷。 具体来说,AI芯片龙头英伟达上季净利润大涨65%至319亿美元,在整体获利(11大半导体厂获利)中,贡献比高达约40%。 同样,帮助英伟达代工AI芯片的台积电上季净利润也暴增50%至151亿美元,连续两个季度创下新高,占整体获利比重约20%,贡献度排名第二。 存储芯片大厂美光(Micron)排名第五,其上季净利润暴涨260%至32亿美元,目前美光还正在日本广岛工厂扩产HBM,同时还宣布退出自己的消费类品牌,以便将产能供给利润更高的数据中心存储产品。
数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。
流水线中的数据存储类型和量级 图片 每个AI流水线中都涉及到数据存储 数据源-数据提取过程中涉及到: PB级别的顺序写 数据准备过程中: TB级别的顺序读 模型训练过程中: GB级别的随机读 检查点和恢复过程中 中间采用高性能全闪存,通过是TLC, 弥补机械盘性能, 总容量比HDD少 右边采用对象存储, 存储集群或JBODS, 包含大量机械盘, 总容量占比高 AI集群中的数据移动 图片 1.数据采集阶段,原始数据按顺序写入对象存储层 RAG 还可以创建额外的 I/O 活动 5.归档流程: 模型输入和输出被捕获并写入对象存储层的磁盘 旨在优化 AI 存储效率的产品组合 QLC 提升新型 AI DC(数据中心) 构建的电源效率 每个 DGX 有关建模详细信息,请参阅附录“QLC 功率效率与 HDD” 模型训练与数据存储 AI 数据穿越存储层之旅 最近的检查点基本在SSD上 早期的检查点数据在HDDS AI数据量级和性能 检查点:提高存储容量和吞吐量 Blob 存储层一次性访问可实现高吞吐量 AI负载中的存储扩展性 总结 AI集群流程中的数据存储需要根据实际业务的量级和性能要求做分层存储, 这样成本可控且性能满足需求 AI行业也会带动存储行业发展,
随着AI应用对多源异构数据的需求增加,企业对于非结构化数据的价值化需求也在加速释放,而相应的数据治理模块也将获得进一步的关注与优化。 对于部署AI应用的企业来说,数据资源的质量直接决定了AI应用能否成功落地。因此,在推进AI应用的过程中,开展针对性的数据治理工作是首要且必要的步骤。 AI模型对数据高度敏感,低质量的数据会导致“garbage in, garbage out”的问题,即输入数据的缺陷会直接影响到输出结果的质量。 为了确保AI模型的有效性和准确性,必须保证数据的完备性和准确性。有效的数据治理不仅可以为AI模型提供高质量的数据原料,还能提高模型的拟合效果,进而增强AI应用的实际性能。 在金融、医疗、零售、工业以及互联网等数据基础建设较好的行业中,面向AI时代的数据治理正在逐步显现其优势。
(辅助管理决策、助力临床科研、AI 智能诊疗)、患者全流程管理、医院舆情监控及品牌建设、药械研发、保险控费等一体化服务。 目前 Hubble 系统“肺癌淋巴结跳跃转移风险预测”模块可避免肺癌病人由于误判而导致提前 8-10 个月的复发,每年能让近两万病人的生命再延长 8-10 个月。 Hubble 系统“ AI - 肺结节智能诊断”模块全自动地识别 CT 影像中所有的结节,识别率达 91.5%。 [1240] 支撑 LinkDoc 业务的底层数据库平台也面临着医疗行业新领域的技术 & 业务挑战,如数据量的快速增长(亿级别)、大数据量下的清洗逻辑的数据擦写、分析型事物对数据库的读压力都要求我们在数据库平台进行重新探索 ,选择一款适合医疗大数据业务的数据库解决方案。
这也是很多大数据部门领导非常焦虑的地方。 那么出路在哪里呢? All In AI 事实上,真正能帮助业务提高效能,提供创新产品的必然是AI,AI是一种模式的输出。 从上面我们可以看到,数据部门的最大价值,最终会通过AI来进行落地,并且还会给部门/公司提供了极为丰富的想象空间。 如何 All In AI? 对于这件事情,我们要仔细研究一个核心的东西: 资源。 我们知道,AI平台是基于数据平台的之上的,其结构是一个金字塔形状的。所以第一步你需要有一个良好的数据平台,其次你还需要有一个AI平台,让单一算法落地变得容易。 现阶段,按我的了解,AI平台通常只能做到针对单一算法的自助化。那么为了让组织更加合理高效,重构数据部门团队就很有必要了。 总结 本文我们说了为什么要All In AI,要实现All In AI 不仅仅需要有一个好的平台(数据、算法平台),也需要有良好的动员人力资源的能力,采用一个合理的算法组织架构充分利用人力资源。
上个月参加一个AI技术沙龙,我问了在座的技术负责人这样一个问题。 原本以为会听到关于算力、算法或者成本的回答,结果大家的答案出奇一致——数据质量。 一个创业公司的CTO感慨地说:"我们现在花的钱,80%都在找数据、清洗数据、标注数据,真正的模型训练反而是小头。" 这个回答让我意识到,我们正处在AI发展的一个重要转折点。 解密高质量数据集的三张面孔 很多人对数据集的理解还停留在"图片+标签"的层面,认为只要有数据就能训练AI模型。但实际上,高质量数据集远不止这么简单。 从数据模态来看,现代AI需要的是多维度的数据生态。 2025年,AI智能体和高质量数据集建设的双重推进,将把人工智能带入一个新的发展阶段。这个阶段的特征是数据质量成为决定性因素,技术创新与数据资源同等重要。 数据质量决定AI命运,也决定我们在AI时代的命运。
这也是很多大数据部门领导非常焦虑的地方。 那么出路在哪里呢? 02 ALL IN AI 事实上,真正能帮助业务提高效能,提供创新产品的必然是AI,AI是一种模式的输出。 从上面我们可以看到,数据部门的最大价值,最终会通过AI来进行落地,并且还会给部门/公司提供了极为丰富的想象空间。 03 如何All In AI? 我们知道,AI平台是基于数据平台的之上的,其结构是一个金字塔形状的。所以第一步你需要有一个良好的数据平台,其次你还需要有一个AI平台,让单一算法落地变得容易。 现阶段,按我的了解,AI平台通常只能做到针对单一算法的自助化。那么为了让组织更加合理高效,重构数据部门团队就很有必要了。 04 总结 本文我们说了为什么要All In AI,要实现All In AI 不仅仅需要有一个好的平台(数据、算法平台),也需要有良好的动员人力资源的能力,采用一个合理的算法组织架构充分利用人力资源。