首页
学习
活动
专区
圈层
工具
发布

#音频

Python 将文本内容转换为语音播放并保存为音频文件

用户11081884

文本转语音(Text-to-Speech, TTS)技术能够将书面文字转换为自然语音输出,广泛应用于辅助阅读、语言学习、无障碍服务等场景。Python py...

1700

IMA,这样用,为知识发声

用户11081884

IMA能存、能搜、能读、能写,能做数据分析和专业领域的AI知识库,越用越懂你。现在IMA支持生成双人自然对话播客,把知识发给IMA,它会自动生成普通话语音直接播...

900

爆了,已获8.5K star !轻量小巧的开源录屏神器来了!

OpenNiuma

原生支持系统音频回录,不用安装虚拟音频驱动,同步收录系统音效与人声讲解,音画同步延迟控制在毫秒区间,适配网课、游戏、线上会议录制。

1900

阿里出手!效果炸裂!不再忍受即梦排队之痛!AI 短剧神器欢乐马“HappyHorse”重磅上线免费使用

OpenNiuma

榜单数据相当硬气:在无音频的文生视频赛道,HappyHorse Elo得分约1330+,领先Seedance 2.0超过100分;图生视频同样断层第一。仅在带音...

3300

完整FreeSWITCH语音处理模块mod_audio_stream技术实现细节分享

杜金房

本文档涵盖 mod_audio_stream,这是一个 FreeSWITCH 模块,用于从活动通话信道捕获音频,并通过 WebSocket 或 TCP 连接将其...

8010

Google Gemma 4:把多模态、推理和端侧效率塞进一套模型

唐国梁Tommy

音频路径更直接:16kHz 原始音频按 40ms 切片,每段形成 640 维向量,然后直接投影进语言模型。论文的意思并不是“模型不再需要任何前处理”,而是不再依...

10110

ECCV 2026 | 武大提出Unison:统一的音视频协同生成框架

Amusi

本文介绍了武汉大学行为理解与视觉感知实验室(HUVPR-Lab)在ECCV2026上发表的研究成果。该工作针对以人为中心的音视频联合生成中长期存在的"语音-音...

6510

从lx-music看Electron应用的插件化架构设计:音源模块的解耦与动态加载

PC电脑医生

在桌面端跨平台应用开发中,Electron凭借前端技术栈 + Node.js能力的组合,成为不少开源项目的首选方案。lx-music-desktop(洛雪音乐助...

9510

webrtc v4.2.16 最新发布:音频封装增强、多轨 OGG 写入上线、ICE 与 DTLS 新增上下文启动能力、依赖全面升级与稳定性修复

福大大架构师每日一题

对于很多项目来说,实时音频只是链路的一部分,另一部分是落盘、转存、归档或者后处理。以前如果在音轨标签信息方面支持不足,就可能需要额外处理,而现在这一能力已经进入...

14510

别再把长PDF硬塞给聊天框了,用这个免费工具更稳

袁锐钦

把你指定的资料变成一个「只根据这些材料说话」的研究助手,还能直接出音频概览、报告、测验、信息图一类成品。

8500

视频推理框架进展I

用户10637292

摘要:近年来,测试时间优化的进步使得大模型(LLM)在推理能力方面取得了显著的提升,使它们能够解决数学和编码方面高度复杂的问题。然而,多模式大模型(MLLM)的...

9110

video-use:Agent 剪视频的关键,不是“看视频”,而是“读视频”

唐斩

第一层是音频转写。每个词都有时间戳,停顿、口误、重复、笑声、掌声都会变成可读信号。对口播、访谈、教程这类内容来说,剪辑的主要决策本来就来自语言节奏。

11110

影石Mic Air x TRAE 无线麦「Vibe Coding 版」来了!这设计,老罗看了都想当场退役

不惑

腾讯云TDP | 产品KOL (已认证)

但在TRAE联名版里播放的时候,联名版的音频明显更干净。后来我才知道,联名版在软件层面加了一层AI音频增强处理。它会在转写之前对音频做一次预处理,去除底噪、压缩...

11800

HappyHorse 是谁家的,这个问题今天炸了全球AI圈

不惑

腾讯云TDP | 产品KOL (已认证)

有一个小细节要说清楚,加了音频之后情况有变化。加入音频维度,Seedance 2.0 反超 HappyHorse 拿到第一,差距是有音频文生视频赛道 14 分,...

10900

写作和思考,应该被AI改变么?

程序新视界

随后,在阅读的过程中,整理了一些文章中表达视角不同或理解错误(音频转换导致的)的词句,一篇完全是自己思想的表达,由自己口述,由AI整理的文章就成稿了,没有错别字...

7510

做一本100万字的有声书大概多少钱?从画本、演播、后期到审听完整拆解有声书制作成本

声音那些事

最根本的原因,是有声书的制作模式不同。 而在每种模式背后,AI技术的深度介入,也正在悄然改变着有声书制作流程中每一个环节的成本结构。

10410

【直播】AI时代的“工具价值”:还需要学习软件吗?

Tableau喜乐君

以下是话题二(技术公式与AI)、话题三(分析师职业终局)、话题四(工具与思维训练)的完整精修逐字稿。

10700

19K stars:Meetily 把会议录音从云端搬回本机

智能时代蛮子

Meetily 是一款基于 Tauri + whisper.cpp + Ollama 的全本地 AI 会议助手,把 Otter.ai / Fireflies.a...

27210

一本小说真的可以一键变成多人有声剧吗?全自动AI多播有声剧生产流程揭秘

声音那些事

全自动方案的生产成本较传统人工制作有显著降低,具体因所选模型方案、音色数量和音频质量要求而异。对比传统人工制作通常需要的成本,差距在一个数量级以上。⚠ 实际成本...

13410
领券