首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏开源心路

    OpenAI领航:日产千亿单词,5-7万亿AI芯片巨资揭秘,人类语言产出将被超越?

    而支撑这一切的,是一个震撼天地的5至7万亿美元的AI芯片投资大计。你能想象吗?这比许多国家的GDP还要高! 想象一下,你手握7万亿美元,这笔巨款足以买下西班牙的每一寸土地! 这背后的技术魔法,让人不禁对AI的力量产生无限遐想。 想想看,人类一生中最多能读到数十亿个单词,而OpenAI的日产量却达到了这个数字的数千倍。 AI生成风口刚起步,未来三年内,我们是否能看到单词生成和价值动态的颠覆性变化? 需要更多GPUs,为了满足不断增长的计算需求,OpenAI正在积极推进芯片计划。 AI芯片供不应求,限制了OpenAI及整个行业的发展。 Altman欲启动项目提升全球芯片制造能力,正与多方投资者谈判。但资金需求巨大,或需筹集5至7万亿美元。 我是李孟聊AI,独立开源软件开发者,SolidUI作者,对于新技术非常感兴趣,专注AI和数据领域,如果对我的文章内容感兴趣,请帮忙关注点赞收藏,谢谢!

    28500编辑于 2024-05-24
  • 来自专栏各类技术文章~

    Vue-基础入门(上)--Part.2(5-7)

    app.mount('#root'); </script> 复制代码 这个div上的class属性是动态绑定到color,当我们在控制台把color改为 blue,内容颜色也会变成blue 这里class能绑定的数据有很多种

    ` }) const vm = app.mount('#root'); </script 复制代码 这个v-for里有两个参数,第一个item也就是数组里的数据项 ,第二个index就是每个数据项的下标 v-for不仅可以循环展示数组里面的内容,还可以循环展示对象里的数据
    {{value}} -- {{key}} -- {{index}}
    复制代码 第一个value就是对象里数据的值,key则是数据的"名称",index就是下标 我们再添加一个功能 index) in listArray" :key="index"> {{item}} -- {{index}}
    复制代码 至于原因涉及vue的底层原理,后面再细讲 点击在对象里添加数据项

42020发布于 2021-11-05
  • 来自专栏AI机器学习与深度学习算法

    机器学习入门 5-7 多元线性回归和正规方程

    使用正规方程解求解参数的优点就是我们不再需要对数据进行归一化的处理,因为通过这个数学分析就知道了,最终估计出来的θ无非就是原始的数据进行数学运算的结果,在这种计算的过程中不存在量纲的问题的。 而最终得到的θ也是相应样本特征的系数而已,他没有量纲的问题,所以我们在上一章介绍的在使用kNN算法前,最好对数据进行归一化处理,但是对于多元线性回归问题来说,我们没有必要进行数据的归一化。

    1.5K10发布于 2019-11-13
  • 来自专栏人工智能与演化计算成长与进阶

    14降维5-7重建压缩表示主成分数量选取PCA应用误区

    100 维特征,或将三维数据压缩到一二维表示。 即是否能通过某种方法将 z 上的点重新恢复成使用 和 二维方式表示的数据。 (Total Variation):定义为原始数据样本的长度的均值: \frac1}{m}\sum^{m}_{i=1}|x^{(i)||^{2} 意为:平均来看原始数据距离零向量的距离。 PCA 不是必要的方法 PCA 是当数据量大,所以要 压缩数据维度,减少数据占用内存,加快训练速度 时使用的,或者是需要通过 数据可视化 理解数据时使用的, 而 不是一种必需的方法。 由于 PCA 会损失掉一部分数据,也许正是数据中十分关键的维度 ,所以机器学习系统应当首先 不考虑 PCA 的使用 ,而使用常规的训练方法, 只在有必要的时候(算法运行太慢或者占用太多内存) 才考虑采用主要成分分析

    1K30发布于 2020-08-14
  • 来自专栏HansBug's Lab

    【作业2.0】HansBug的5-7次OO作业分析与小结,以及一些个人体会

    这是一种很廉价且在数据规模不大的情况下很靠谱的策略。 关于静态数组 据笔者观察,貌似很多的同学至今仍热衷于使用静态数组来进行数据的存储。 起初,笔者十分不解,在Java这样的OOP语言中,相关的数据结构封装类可谓相当完备,为啥还要使用数组呢? 很多人对工程性之类的事情全无认识,认为程序能运行即可 然而,静态数组实际上有很致命的缺陷: 数据量较小的时候,空间浪费相当严重。 数据量较大的时候,会不可避免的数组越界导致crash。 建议使用Java内置的数据结构,诸如List、Vector、ArrayList类,这些类均进行过有效的代码封装和性能优化,各方面性能均有保证,且不会很容易的出现错误。

    1.1K40发布于 2018-06-13
  • 来自专栏企鹅号快讯

    AI需要大数据,而大数据也需要AI

    美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 然而,Manchett警告说,AI尚不足以满足非技术业务的需求。“为了实现大数据和AI的目标,你仍然需要理解提取、转换和加载的概念,以及机器学习是什么,可以做什么。” 数据占据了中心位置。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。

    904100发布于 2018-01-18
  • 来自专栏PowerBI入门100例

    2.29 PowerBI数据建模-多个度量值合并为一个共有维度的度量值

    不同事实表分别算出来的多个度量值,它们没有对应到一个共有维度表上,需要合并为一个度量值,用一套共有的新维度去展示数据。 举例1 子公司1和子公司2的数据在一个表中,子公司3和子公司4的数据在另一个表中,且两个表都有子公司字段,建立关系然后加和。 度量值组合数量5-7_VAR过程表 = VAR _vt_5 = SUMMARIZECOLUMNS('Dim_子公司5-7'[子公司], FILTER('Dim_子公司5-7', [子公司]= "子公司5 "),"数量", [子公司5数量])VAR _vt_6 = SUMMARIZECOLUMNS('Dim_子公司5-7'[子公司], FILTER('Dim_子公司5-7', [子公司]= "子公司6") 'Dim_子公司5-7'[子公司]= "子公司6",[子公司6数量], 'Dim_子公司5-7'[子公司]= "子公司7",[子公司7数量] ))5 生成计算表,有利于提升报告页面刷新速度。

    1.1K10编辑于 2025-02-24
  • 来自专栏ATYUN订阅号

    【观点】AI需要大数据,而大数据也需要AI

    AI和大数据已经形成了一种真正的共生关系,彼此需要相得益彰。 美国知名AI作家Bernard Marr 说过:“过去,由于有限的数据集、非实时的数据和无法在数秒内分析大量数据,而导致AI发展受阻。 今天,可以实时访问数据和工具,实现快速分析,从而推动了AI和机器学习,并允许向数据优先的方法过渡。我们的技术现在已经足够灵活,可以访问这些庞大的数据集,以快速推进AI和机器学习应用程序。” AI和大数据形成了一种真正的共生关系,彼此需要。 “通过云计算,任何人都可以轻而易举地获得数据,大数据和AI的可能性在我们的生活中变得越来越真实。”然后,AI和机器学习将变得司空见惯。

    59870发布于 2018-03-06
  • 来自专栏AI系统

    【AI系统】数据并行

    数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。

    1.3K10编辑于 2024-12-07
  • 来自专栏技术墨客

    从数据到AI

    一篇关于數據倉庫建設、人工數據分析、AI數據分析的讲义 數據Data&信息Information 信息 信息是一個客觀存在物體的自然表現,比如說“I am a local villain.” 隨著數據的不斷累積和堆積在數據背後發現了驚人的統計規律,隨著這些統計規律的發展漸漸的出現了AI分析和數據分析。 數據&數據分析&AI 如下圖是建立數據分析工程的過程 ? 根據需要訓練AI模型。 數據倉庫的建立 聯機事物型系統&決策分析系統 在數據能力上,通常將系統的數據結構模型分為2類,聯機事物型、決策分析型。 數據倉庫案例展示superset 地址:http://192.168.0.212:8088 賬號:admin 密碼:admin 數據分析到AI訓練 進過大量的數據演練,可以逐漸的發現數據背後的統計規律。

    1K50发布于 2019-11-21
  • AI Agent + 数据工程

    一位在数据领域深耕多年的创业者告诉我,早期AI在数据工程领域的切入点其实很务实——那些原本需要大量人工的数据治理工作,恰恰是大模型最擅长的地方。 比如从海量数据中提炼关键信息、自动生成数据文档、识别重复和冗余的表结构。这些事情以前要靠专人花时间梳理,现在AI可以快速完成。 但这只是第一步。 更深层的变化在于,数据工程的需求本身正在被AI重塑。 以前的交付物很明确:一张张处理好的数据表,加上一个Dashboard,业务方看数据就够了。 现在呢?业务方不仅看Dashboard,还想直接跟数据对话——问AI一个问题,AI直接给出答案。 好的数据工程,应该配合AI在事中就做好管理和体系搭建。” 这句话背后是一个残酷的现实:以前数据工程师的工作更像是管道工——把数据从A搬到B,分层、清洗、汇总。 现在的要求变成了规划师——不仅要搬数据,还要让数据能被AI正确理解和调用。 这需要的不仅是技术能力,更是思维方式的转变。

    42910编辑于 2026-02-28
  • 腾讯云AI游戏全链路解决方案:打破研发成本瓶颈与产能重塑

    以游戏皮肤生产管线为例,头部游戏实践最长需9个月,其中概念设计和制作实现占据60%以上的人力投入;传统3D研发管线包含10大环节,耗时5-7天,单件成本高达数千元。 支持“存算分离”,闲时关机保留数据,释放闲置算力以节省运维成本。 游戏AI智能NPC: 基于混元大模型(Hunyuan-large-role / Turbo S),结合RAG(检索增强生成)与向量数据库,赋予NPC长期记忆、性格设定及多轮复杂任务执行能力。 兑现工业化降本增效:3D资产与营销投放的量化回报 全栈AI方案在实际业务场景中展现了高度确定的投资回报率,核心业务指标量化如下: 3D资产生产效率提升 >70%: 混元3D AI游戏管线将传统需5-7天的制作周期压缩至 买量营销ROI提升 6倍: 依据DataEye研究院数据,使用游戏AI素材进行投放,广告回报率提升6倍,同时CPM(千人展现成本)下降50%。

    1.1K10编辑于 2026-05-29
  • AI一键搞定全流程,不妨试试它|万象有声

    数据显示,中国有声书市场规模已经突破百亿,而且每年还在高速增长。但问题来了:想制作一本有声书,到底怎么搞? 今天小编就给大家介绍一个一站式的AI有声内容创作平台——万象有声。万象有声是什么?万象有声是由原懒人听书核心创始团队打造的新一代AI有声内容创作平台。 实际效率对比,数字说话拿一本20万字玄幻有声书举例:环节传统方式万象有声画本3-5天10分钟配音7-14天AI配音1-2天;混合3-5天对轨3-7天30分钟-1小时后期5-7天2-3天审听2-3天半天总计 30-60天5-7天核心省时间的环节就是画本和对轨,这两个环节的效率提升是断层式的。 传统做一本有声书30-60天,用它5-7天就能出成品。智能画本省掉画本环节90%的时间,智能对轨更是行业独一份的方案——光这两个功能就值回票价。

    78310编辑于 2026-06-16
  • $200月费替代一支团队:2026做AI SaaS的闷声发财路

    我最近在Twitter上看到一组数据——有点坐不住。 一个在里斯本的独立开发者,用AI辅助编程,47天把一个SaaS产品从零做到10K MRR。她从没写过一行手写代码。 现在用Cursor+Claude,一个人5-7天推上线。我自己的PNG部落(AI生图工具站)就是这么做的——从想法到上线,48小时,用的就是Cursor+Supabase+Vercel这套组合。 模式一:Micro-SaaS Launch Partner 做法很简单:给特定客户快速搭建小型工具——用Supabase做后端、Vercel部署、Stripe收款,5-7天交付一个成品,然后交钥匙走人。 一些实际数据(来自Indie Hackers社区的公开报告): • AI内容营销服务:2K-5K/客户/月 • AI视频广告制作:500-2K/条 • AI网页开发:5K-20K/项目 一个人能同时服务 ⚠️ 数据来源:第三方社区报告,非一手验证。 这个模式有一个关键前提——你不能卖「我能用AI帮你做XX」,你要卖「你得到XX结果」。

    2.1K10编辑于 2026-06-25
  • openEuler 高效 AI 数据管道

    开篇介绍AI训练的瓶颈往往不是模型计算,而是数据预处理。openEuler提供高效的数据处理管道,支持并行加载、GPU预处理、数据增强等优化。今天聊聊如何加速AI数据处理。 数据处理优化:多进程DataLoader并行加载提升5-10倍,DALIGPU预处理释放CPU,预取机制减少等待时间,数据缓存避免重复读取。 存储优化:NVMeSSD提升I/O吞吐,分布式文件系统支持大规模数据集,数据格式优化TFRecord/Parquet提升读取效率。 QPS提升40%,Web服务器并发提升50%,大数据任务快35%。 优化要基于数据驱动,每次都要测试对比,确保有效且稳定。

    40210编辑于 2025-12-03
  • 来自专栏AI

    AI中的数据存储

    流水线中的数据存储类型和量级 图片 每个AI流水线中都涉及到数据存储 数据源-数据提取过程中涉及到: PB级别的顺序写 数据准备过程中: TB级别的顺序读 模型训练过程中: GB级别的随机读 检查点和恢复过程中 中间采用高性能全闪存,通过是TLC, 弥补机械盘性能, 总容量比HDD少 右边采用对象存储, 存储集群或JBODS, 包含大量机械盘, 总容量占比高 AI集群中的数据移动 图片 1.数据采集阶段,原始数据按顺序写入对象存储层 RAG 还可以创建额外的 I/O 活动 5.归档流程: 模型输入和输出被捕获并写入对象存储层的磁盘 旨在优化 AI 存储效率的产品组合 QLC 提升新型 AI DC(数据中心) 构建的电源效率 每个 DGX 有关建模详细信息,请参阅附录“QLC 功率效率与 HDD” 模型训练与数据存储 AI 数据穿越存储层之旅 最近的检查点基本在SSD上 早期的检查点数据在HDDS AI数据量级和性能 检查点:提高存储容量和吞吐量 Blob 存储层一次性访问可实现高吞吐量 AI负载中的存储扩展性 总结 AI集群流程中的数据存储需要根据实际业务的量级和性能要求做分层存储, 这样成本可控且性能满足需求 AI行业也会带动存储行业发展,

    2K11编辑于 2024-09-18
  • 转载:【AI系统】数据并行

    数据并行是一种广泛应用于分布式 AI 系统中的技术,旨在通过将数据集划分为多个子集并在不同计算节点上并行处理这些子集,以提高计算效率和速度。 分布式数据并行 DDP分布式数据并行(Distributed Data Parallel, DDP)是数据并行的一种高级形式,它综合了多种优化,是当前应用最广的并行算法之一,通常用于大型 NPU AI 集群和 AI 系统中。 在通信的同时也会继续计算梯度,这样就无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,从而将通信过程覆盖到计算时间内,充分利用 AI 集群,提高了 AI 集群使用率。 DDP 反向传播中计算与通信的重叠导致无需等待所有计算完成后再集中进行通信,也不必在计算完成后等待通信完成,提高了 AI 集群的使用率。

    62610编辑于 2024-12-13
  • AI+Data:AI时代的企业数据治理

    随着AI应用对多源异构数据的需求增加,企业对于非结构化数据的价值化需求也在加速释放,而相应的数据治理模块也将获得进一步的关注与优化。 对于部署AI应用的企业来说,数据资源的质量直接决定了AI应用能否成功落地。因此,在推进AI应用的过程中,开展针对性的数据治理工作是首要且必要的步骤。 AI模型对数据高度敏感,低质量的数据会导致“garbage in, garbage out”的问题,即输入数据的缺陷会直接影响到输出结果的质量。 为了确保AI模型的有效性和准确性,必须保证数据的完备性和准确性。有效的数据治理不仅可以为AI模型提供高质量的数据原料,还能提高模型的拟合效果,进而增强AI应用的实际性能。 在金融、医疗、零售、工业以及互联网等数据基础建设较好的行业中,面向AI时代的数据治理正在逐步显现其优势。

    1.4K10编辑于 2025-01-03
  • 来自专栏祝威廉

    数据部门如何All In AI

    这也是很多大数据部门领导非常焦虑的地方。 那么出路在哪里呢? All In AI 事实上,真正能帮助业务提高效能,提供创新产品的必然是AI,AI是一种模式的输出。 从上面我们可以看到,数据部门的最大价值,最终会通过AI来进行落地,并且还会给部门/公司提供了极为丰富的想象空间。 如何 All In AI? 对于这件事情,我们要仔细研究一个核心的东西: 资源。 我们知道,AI平台是基于数据平台的之上的,其结构是一个金字塔形状的。所以第一步你需要有一个良好的数据平台,其次你还需要有一个AI平台,让单一算法落地变得容易。 现阶段,按我的了解,AI平台通常只能做到针对单一算法的自助化。那么为了让组织更加合理高效,重构数据部门团队就很有必要了。 总结 本文我们说了为什么要All In AI,要实现All In AI 不仅仅需要有一个好的平台(数据、算法平台),也需要有良好的动员人力资源的能力,采用一个合理的算法组织架构充分利用人力资源。

    52320发布于 2018-08-27
  • 数据质量决定AI命运

    上个月参加一个AI技术沙龙,我问了在座的技术负责人这样一个问题。 原本以为会听到关于算力、算法或者成本的回答,结果大家的答案出奇一致——数据质量。 一个创业公司的CTO感慨地说:"我们现在花的钱,80%都在找数据、清洗数据、标注数据,真正的模型训练反而是小头。" 这个回答让我意识到,我们正处在AI发展的一个重要转折点。 解密高质量数据集的三张面孔 很多人对数据集的理解还停留在"图片+标签"的层面,认为只要有数据就能训练AI模型。但实际上,高质量数据集远不止这么简单。 从数据模态来看,现代AI需要的是多维度的数据生态。 2025年,AI智能体和高质量数据集建设的双重推进,将把人工智能带入一个新的发展阶段。这个阶段的特征是数据质量成为决定性因素,技术创新与数据资源同等重要。 数据质量决定AI命运,也决定我们在AI时代的命运。

    41410编辑于 2026-02-02
  • 领券