首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏bunny的专栏

    【玩转Lighthouse】轻松搭建视频配音工具晓晓配音

    今天我们将给大家介绍如何使用Lighthouse轻量服务器搭建一个属于自己的在线视频配音工具,可以将文案制作为mp3文件并且生成对应的字幕视频,以便大家在制作视频的过程中方便地为自己的视频添加自然逼真的配音 ,并且为其它视频创作者提供帮助 LiuChangFreeman/ms-tts-web (github.com) github.png 一、购买一台轻量服务器 腾讯云的学生优惠是相当给力的,2核4G一年只要 推荐同学们买一台作为学习使用,用来部署晓晓配音完全绰绰有余 image.png 购买完成后我们可以在控制台重置其系统为Ubunut+Docker专版,由于此系统自带了Docker环境,我们上手就能立刻开始部署 我们需要在防火墙放行对应的端口,推荐一次性开一个范围的端口,这样我们在部署服务的时候就可以不用每次都到控制台编辑规则了 20220414190405.png 登录我们的轻量服务器,然后在任意目录克隆晓晓配音的源代码 然后使用docker logs查看容器服务是否正常开启 docker logs ms_tts 当看到服务顺利监听到8019端口后,部署就完成了 run.png 最后我们就可以通过ip端口的方式访问晓晓配音服务了

    2K100编辑于 2022-04-14
  • 来自专栏星哥的AI自留地

    5分钟搞定视频翻译配音!开源极简工具KrillinAI

    5分钟搞定视频翻译配音! 不用复杂的技术配置,不用懂高深的AI原理,甚至不需要你有专业的视频剪辑基础,它能一站式完成「视频原声音频提取→AI翻译→目标语言配音→音频与视频合成」全流程,支持上百种语言的翻译与配音,覆盖主流语种(中英日韩法德等 ,配音自然流畅,无机械感配音生硬,语调呆板,缺乏情感适配格式兼容支持MP4、MOV、AVI等主流视频格式,导出多规格格式限制多,仅支持少数视频格式免费属性开源免费,基础功能无付费门槛基础功能免费,高级功能高额收费简单说 我以「中文视频翻译成英文并配音」为例,给大家一步步演示,全程5分钟就能搞定,跟着做就行。 不用花大价钱买付费工具,也不用花时间学习复杂的剪辑和翻译技巧,5分钟就能搞定多语言视频翻译配音,对个人创作者和小型团队来说,绝对是值得收藏的实用工具。

    26410编辑于 2026-06-26
  • 来自专栏云瓣

    基于RN开发的一款视频配音APP(开源)

    一些功能模块: 启动界面轮播效果的实现; 通过短信验证码登入; 视频的上传以及静音处理; 音频的上传; 视频和音频的整合; 用户资料的更新; 评论模块 点赞模块

    1.2K80发布于 2018-05-02
  • 来自专栏三太子敖丙

    谷歌Gemini被曝视频造假!多模态视频是剪辑配音,击败GPT-4靠「作弊」?

    GPT-4的86.4%分数是基于行业评估标准,即「5-shot」。 然而,Gemini Ultra 90%的得分是基于谷歌研究人员开发的一种基于「32个样本的思维链」的方法。 但是,在使用行业标准5-shot MMLU的情况下,GPT-4的86.4%要高于Gemini Ultra的83.7%。 要知道,OpenAI的GPT-5,应该已经在路上了。 似乎是内部知情人士艾特了Sam Altman,问他还要把宝贝捂到什么时候?还不赶快拿出来? 今年5月的谷歌开发者大会I/O上,劈柴首次官宣,谷歌正在训练一个新的、更强大的PaLM继任者,名为Gemini。 5月,该公司宣布了一款名为Gato的AI模型,能够学习执行各种任务,包括玩Atari游戏、为图像添加字幕,以及使用机械臂堆叠积木。

    64710编辑于 2023-12-12
  • AI 情感配音与声纹克隆:5 秒样本如何复刻演员音色?

    摘要 从拼接合成到VITS再到大模型情感TTS,AI配音已能5秒样本克隆音色并带哭腔朗读10分钟。 如需高情感克隆配音(9 元/分钟)+ 压制字幕(0.063 元/分钟):总配音成本约为 200 × 9.063 = 1812.6 元。 在视频转译出海场景下,AI 译制可将成本降至传统人工的 1/10,交付周期大幅缩短。 九、与 MAIS 其他能力的组合 大模型视频理解(1.5 元/分钟)+ AI 配音视频转播客、课程配旁白; ASR(0.03 元/分钟)+ 大模型翻译(0.2 元/分钟)+ AI 配音:中文视频 → MAIS 有大规模商业语料支撑、中文专用优化、及对接字幕/视频流水线的工程链路。 十一、立即体验 产品入口:腾讯云媒体 AI(MAIS) 从 VITS 到情感大模型,5 秒克隆早已不是科幻。

    41310编辑于 2026-06-01
  • 做短视频解说时,我踩过最严重的AI配音

    最近重新整理短视频解说项目时,发现自己前期在AI配音上踩过不少坑。一开始总觉得:只要音色够像真人,视频听起来应该就不会有问题。 但真正做了一段时间后才发现,很多播放数据差的视频,并不是剧情不行,而是:旁白让人听着“很累”。尤其影视解说、悬疑旁白、小说推文这种内容,一旦AI配音节奏不对,观众前几秒就会直接划走。 后面连续调整了几十条内容后,我发现之前踩得最严重的坑,其实并不是模型,而是:“把AI配音当成真人录音去用。” 一开始为了省事,我会统一设置:speed=1.1整条视频全程一个速度。结果听久后,会明显感觉:特别机械。 主要测试:男声风格停顿节奏情绪强度多角色语气目前比较常用的试听方案,包括:叮叮配音配朵朵媒小三配音主要目的不是正式生产。

    27000编辑于 2026-05-10
  • 短剧视频翻译配音为什么总有翻译腔?对话级NMT实战方案

    所以短剧视频翻译不能只看 BLEU 或逐句准确率。真正影响成片观感的是:台词能不能接得上、角色有没有同一套语言风格、配音演员读出来是否自然。对话级 NMT 怎么改造视频翻译 pipeline? 口语化 post-editing:让翻译结果适合配音而不是只适合阅读视频翻译最终要进入 AI 配音或人工配音,文本不能只追求字面对齐,还要考虑可读性和节奏。 如果团队使用 VividDub 这类一站式 AI 视频翻译方案,重点不是只看“能不能翻译”,而是看它能不能把 AI 视频翻译、AI 配音、多角色识别、字幕生成和字幕压制串成稳定链路。 配音是否读得顺:翻译文本要适合 TTS 或声音克隆,不要保留太多书面长句。字幕是否跟时间轴匹配:译文长度要能放进原视频节奏,否则后续配音和字幕都会返工。 结论:短剧翻译要从“逐句准确”走向“对话可演”通用 NMT 适合解决大多数文本翻译问题,但短剧配音是更复杂的视频本地化任务。

    23210编辑于 2026-05-27
  • 来自专栏量子位

    这个AI能自动给视频配音,真假难辨(不服来试)

    视频内容 你将看到两段画面相同的视频,请判断哪段来自视频原声,哪段是AI根据视频画面配上的假声? 莫非两个都是真的?不可能,答案文末揭晓。 (还有更多真假难辨的视频原声和配音大对比) 真假难辨,简直让人怀疑耳朵。模型合成的假音效,什么时候都这么逼真了?一切还得从这个自动为自然环境下的视频配音的项目说起。 ? 视听关联 看闪电,知雷声。 值得注意的是,m通常远远小于n,因为音频的采样率远高于视频的采样率,因此音频波形序列比同步视频视频帧序列长得多。 大体来说,这个模型由两部分构成,即声音生成器和视频编码器。 在这个实验中,他们把所有测试视频中的音频都合并到一起,构成一个包含1280段音频的数据库,并对每个测试视频进行音频检索性能测试。 ? △ Top 1和Top 5音频检索的准确性。 每个场景的配音均为一真一假,当场揭晓答案,猜猜你能对几个——

    3.1K50发布于 2018-04-02
  • 来自专栏Java项目实战

    阿里5.2kStar给Sora配音的EMO音视频项目开源了

    这是一个音频驱动的AI肖像视频生成系统,能够通过输入单一的参考图像和语音音频,生成具有表现力的面部表情和各种头部姿势的视频。 EMO生成的视频不仅内容丰富,而且具有极高的表现力。它能够精准捕捉并再现人类面部表情的细微变化,包括那些难以察觉的微表情。同时,视频中的头部运动与音频节奏完美匹配,增强了视频的整体观赏性和真实感。 借助先进的FrameEncoding模块,EMO能够在视频生成过程中始终保持角色身份的一致性。这意味着无论视频内容如何变化,角色的外观始终与输入的参考图像保持一致,增强了视频的连贯性和真实感。 为了提高视频生成的稳定性,EMO采用了多种控制机制,包括速度控制器和面部区域控制器等。这些机制有效避免了视频崩溃等问题,确保了视频生成的顺利进行。 生成视频 在推理阶段,EMO运用DDIM采样算法,通过迭代去噪过程,生成与输入音频同步的肖像视频片段。

    81910编辑于 2024-03-07
  • 视频配音翻译多角色识别Speaker Diarization 工程实践与踩坑记录

    重点不是介绍一个工具,而是解释为什么 diarization 在视频配音翻译里经常出错,以及怎么把错误压到后续配音流程能接受的范围内。为什么短剧里的 diarization 更容易翻车? 一条可落地的多角色识别 pipeline在视频翻译配音里,speaker diarization 通常不应该直接吃原始视频音轨。 接入视频翻译 pipeline 时要注意什么?在视频翻译配音里,diarization 的输出不是给人看的终点,而是给下游模块使用的结构化输入。 在实际项目中,我们把这套 diarization 方案集成到一条视频翻译 pipeline 里时,最大的收益不是“自动识别出几个 speaker”,而是让后续 AI 配音和声音克隆有了更稳定的角色轨道。 VividDub 这类视频本地化工作流,正是把 AI 视频翻译、AI 配音、字幕生成、硬字幕擦除和多语种输出放在同一条链路里处理,适合持续做短剧、课程、营销视频和内容库本地化。

    27700编辑于 2026-05-27
  • 来自专栏CoderJia的工作笔记

    KrillinAI:基于AI大模型的一站式视频翻译配音解决方案

    随着大语言模型(LLM)技术的迅猛发展,一款名为KrillinAI的开源工具横空出世,为内容创作者带来了革命性的视频翻译与配音解决方案。 项目概述 KrillinAI是一款基于AI大模型技术的全流程视频翻译和配音工具,旨在为内容创作者提供从视频下载到最终成品的一站式解决方案。 5. 多样化配音与语音克隆 完成翻译后,KrillinAI支持将文本转换为自然流畅的语音。 智能视频合成与格式转换 KrillinAI的视频处理能力不仅限于字幕和配音,还包括视频格式的智能转换。系统能够自动处理横屏和竖屏视频的转换,优化不同平台的显示效果。 配音合成模块:支持多种TTS(文本转语音)引擎,实现自然流畅的语音合成和声音克隆。 视频合成模块:处理字幕嵌入、音频替换和视频格式转换,生成最终成品。

    2.2K10编辑于 2025-04-16
  • 来自专栏全栈开发日记

    自动批量真人配音软件

    工具名称:自动批量配音软件 运行系统:Windows 工具大小:6.5MB 工具截图: 使用方法: 需要设置阿里参数或腾讯参数,点击相应参数后的【获取】,可自动跳转到相应的获取页面(免费)。

    2.1K20编辑于 2022-05-13
  • 做短视频配音,为什么很多人开始放弃剪映内置声音?

    第一刀:撞音色你刷十条视频,八条用的是同一个"甜美女声"。剪映内置音色就那么几十个,全网几千万创作者在抢。你精心剪的视频配音一开口,观众直接划走——不是内容不行,是声音太熟了,熟到没有记忆点。 短视频拼的就是前3秒的留存,声音没有辨识度,等于开场就输了。第二刀:长文案断句翻车剪映内置配音对付两三句话的口播没问题,但凡文案超过200字,断句就开始抽风。" 音色库1300+,情绪标签20种,至少不会让你的视频一开口就"剪映味"拉满。第三刀:情感是假的剪映的声音能把字读对,但读不出情绪。"你知道我等了你多久吗?" 短视频要的不是"读字",是让人停下来的那一下情绪冲击。这一点上,ElevenLabs确实做到了行业天花板,笑声、叹气、哽咽都能标注,情感颗粒度极细。但每月免费额度有限,属于"用过就回不去"的那种。 写稿、配音、字幕一条线跑通,AI生成的文案直接进配音环节,断句在生成阶段就对齐了,不用来回倒腾。音色按场景分好类,"悬疑男声""温柔女声"直接选,日更博主用它能把效率拉满。

    32710编辑于 2026-06-01
  • 来自专栏机器之心

    MIT、IBM联合打造AI配音师:检测动作自动添加音效,视频「无声」胜「有声」

    机器之心专栏 机器之心编辑部 从无声视频中生成音乐?这听起来很难。 (1)正确性:生成音乐与视频内容相关;(2)噪音量:生成音乐包含噪音最小;(3)同步性:生成音乐在时间上与视频匹配;(4)综合性:总体质量最佳。 研究者向 AMT 工作人员展示了四个视频,这些视频具有相同的视频内容,但具有不同的声音,分别由本文方法和三个基准方法合成。AMT 工作人员需要分别根据以上指标从中选择出最佳的视频。 音乐编辑 基于 MIDI 的可解释性和灵活性,可以通过 MIDI 文件轻松地进行音乐编辑,生成不同风格音乐,如图 5 所示。这对于以前使用波形或频谱图作为音频表示形式的系统而言难以实现。 ? 图 5:不同风格音乐。 © THE END 转载请联系本公众号获得授权

    1.2K20发布于 2020-08-28
  • 来自专栏用户4744681的专栏

    目前最好用的文字转语音、视频配音方法,一键合成,智能黑科技

    于是大家就问了:语音转文字的方法有了,那么文字转语音、视频配音该怎么做呢? 其实啊,文字转语音和视频配音也可以通过手机实现,操作方法很简单。 二、视频配音:导入文件合成语音 和上述操作一样,进入文件库的界面之后,点击“+”号,在弹窗界面中选择【导入文件】; 之后进入页面,选择出需要转换成语音的文本,文字内容就会显示在页面中; 同样,检查下是否存在文字错误 目前最好用的文字转语音、视频配音方法,一键合成,智能黑科技,这种方法,你学会了吗?

    4.3K30发布于 2019-05-14
  • 来自专栏翩翩白衣少年

    视频解说一键搞定!AI 自动视频生成器:给定一个主题,自动生成故事、配音、配图!

    在短视频时代,内容创作的效率和质量变得至关重要。 手动制作解说视频通常需要编写脚本、录制音频或找配音工具配音、查找和编辑图片,再将它们拼接成视频。 该视频可以直接用于发布,适合自媒体创作者和其他内容生成者。 03.使用方法 使用方法也超级简单,可以手动,将生成故事、配音、配图、合成视频,一步步手动点击确认。 等待个30-60s左右就可以生成出来一个完整的带配音、字幕及配图的视频了。 而且它会将每个阶段的结果,都在网页上展示出来,比如完整的故事文案、配音音频、每段文字的配图等等。 04.适用场景 • 自媒体创作:无需复杂的剪辑和配音,只需输入一个主题,就能快速生成高质量的视频内容。 • 营销内容:企业可以利用该工具,快速生成产品解说或推广视频,提高宣传效率。 • 新闻解说:对于新闻媒体人,输入一个新闻事件,系统即可生成新闻解说视频,快速响应热点事件。 • 教育视频:教师或教育机构可以利用该工具,快速生成解说视频,节省制作时间。

    5.6K11编辑于 2024-08-29
  • 来自专栏业余草

    HTML5视频video

    直到现在,仍然不存在一项旨在网页上显示视频的标准。 目前,大多数视频是通过插件(比如 Flash)来显示的。然而,并非所有浏览器都拥有同样的插件。 HTML5 规定了一种通过 video 元素来包含视频的标准方法。 当前HTML5只支持三种格式的视频。 /movie.ogg"> <source src="movie.mp4" type="http://www.w3school.com.cn/i/movie.mp4"> 你的浏览器不支持html5的 source 元素可以链接不同的视频文件。浏览器将使用第一个可识别的格式 支持的部分属性列举: 属性 值 描述 autoplay autoplay 如果出现该属性,则视频在就绪后马上播放。 preload preload 如果出现该属性,则视频在页面加载时进行加载,并预备播放。 如果使用 "autoplay",则忽略该属性。 src url 要播放的视频的 URL。

    2.3K31发布于 2019-01-21
  • 视频配音太折腾?实测7款工具,这3款让我彻底告别会员套路

    视频这几年,我在配音上踩过的坑能写满一页纸。自己录音嗓子受不了,充了会员发现好听的音色还要单独买,免费导出每隔10秒喊一句“本音频由XX制作”。直到2026年,我终于找到了一套不再折腾的组合方案。 花了300多个小时,我把市面上7款主流配音工具从头到尾测了一遍。今天按不同视频类型分开说,你做哪类内容,就直接看哪个。 每天登录送免费时长,一条3-5分钟的视频基本不花钱。偶尔做长片,签到两天也够了。一句话:日更影视解说、知识科普、高燃混剪的首选。月花费0元。 五、完全免费的应急方案→叮叮配音手机里常备的一款。完全免费,不限字数、不限时长,导出没有广告也没有水印。5000字文稿、40分钟播客、一天连导20条视频,全部免费。 :约207元八、一句话总结2026年做视频配音,别再乱充会员了。

    69110编辑于 2026-05-13
  • 来自专栏新智元

    AI配音版Sora视频刷屏!绝美逼真音效打破「无声电影」,或颠覆万亿美元产业

    语音初创公司ElevenLabs放大招,直接用AI给Sora经典视频完成了配音。网友惊呼离AI完全生成电影又近了一步。 需要补充的是,ElevenLabs的配音不是看视频直接生成的,还是需要prompt之后才能完成。 对此,英伟达高级科学家Jim Fan做了一个比较全面的分析: 为了精确配合视频内容,配音不仅需要文本信息,视频像素也至关重要。 Jim Fan挖出了5年前来自MIT团队的一项关于「The Sound of Pixels」的研究,或许从这里可以找到一些灵感。 这个项目中,研究人员提出了像素级声源定位系统PixelPlayer。 当你给定一个输入视频,PixelPlayer可以联合地将配音分离为目标组件,以及在图像帧上定位目标组件。 值得一提的是,它允许在视频的「每个像素」上定位声源。

    47510编辑于 2024-02-26
  • 来自专栏Springboot框架学习

    HTML5 操作视频

    》HTML5 在浏览器中播放视频 HTML5出现之前,我们想要在浏览器中进行视频的播放是很麻烦的,需要使用到浏览器中的插件,其中以flash插件为主,但是在HTML5中规定了浏览器可以播放视频的标准: 使用video标签可以控制播放给定格式的视频,因为HTML是标记语言,它所有的功能实现都是以标签为主,所以播放视频当然也使用了标签语法 HTML5 支持的视频格式   HTML5 规定了可以通过 video Ogg 视频文件 WebM video/webm 使用 VP8 视频编码 和 Vorbis 音频编码的 WebM 视频文件 HTML5 视频播放实例     我们在学习任何新东西的时候,直接从实例入手 ,先亲自动手操作他的整个运作过程,这样对于我们对新事物的认识和理解是非常深刻的,对于HTML5 播放视频,我们先看他如何编写,如下代码: 一、使用简单格式的video标签播放视频 <video src= 》HTML5 video标签的属性 属性名 属性值 描述 autoplay autoplay 如果在video标签中使用该属性,则视频在加载完成后马上播放 controls controls 如果使用该属性

    2.3K10编辑于 2022-08-17
领券