本条微博地址chenge_ge昨天发了padel的视频,字幕的错误其实蛮多的。一个朋友给我私信说让我试试open AI的Whisper。于是我去github下载了Budd,试用了一下,真的是震撼,彻底被颠覆的感觉。
从国内用户的反馈看这个比剪映好一点点。实际上国内用户是在清晰背景下清晰声音的处理,那确实差不多。但是要是背景噪音巨大,说话的人距离远,声音模糊,甚至是来自奇怪的方言,那么whisper简直是跟真人的辨识差不多了啊。把他和剪映比,简直就是一种错误,这是拿屠龙刀切豆腐。完全搞错了应用场景。
Whisper的问题是他模型库特别巨大要1.5G,在不直接调用GPU的情况下啊,处理一秒语音需要5秒的时间,实时处理压根还不行。手机上应用尤其不行。(他也有tiny模型,用在手机上,牺牲了能力,换取了速度)。不过这已经给人充分的遐想空间了,等芯片的处理能力比现在提升50倍,实时处理就没问题了。50倍是什么概念,按照新的摩尔定律,10年就实现了,再结合量子计算中心的商用渐近。所以我放一个赌局在这里,10年后翻译这个职业会彻底消失。
打一个广告,需要远程翻译服务的华人找我,我用whisper帮你。义务帮忙。
本条微博地址柴崎考拉首页有用ana的朋友吗...6.3更新后ana也跟着自动更新了,但一进行任何操作就报错,去github下了以前一模一样的也是这样
![[泪]](https://h5.sinaimg.cn/m/emoticon/icon/default/d_lei-4cdf6ee412.png)
![[泪]](https://h5.sinaimg.cn/m/emoticon/icon/default/d_lei-4cdf6ee412.png)
不能试新衣服我真的很急
搜索微博更多关键词-GitHub