Cuckooyun 把会议、采访、外勤拜访与门店沟通全程录音,自动转写成区分说话人的结构化文本, 再由大模型生成纪要、待办与思维导图 —— 从「录下来」到「用起来」,只差一次上传。
这次改版的核心目标是把新用户首日留存从 31% 提到 45%,优先级排在付费转化前面。
同意,但投放侧需要一个月的数据窗口,建议先做 A/B 实验再全量。
埋点改造下周三可以提测,风险主要在老版本兼容,我会同步一份回滚方案。
录音采集、语音转写、说话人区分、AI 总结、协作分发,全部在一个平台内闭环。
长时会议一键上传或设备快传,自动输出带时间戳的分段文本,支持波形定位、快进快退、分段回放。
记者访谈、用户调研、口述历史的整理利器。区分提问者与受访者,快速定位金句并导出成稿。
三层递进:引擎原生声纹分离 → 音频静默分析 → 人工校准。不靠标点猜,靠音频算。
接入千问、DeepSeek、豆包、GPT、Gemini 等主流模型,生成可编辑的纪要、待办与思维导图。
中、英、日、韩、法、德、西、葡、俄、阿等语种互译,逐段对照,跨语言会议也能直接出稿。
选中任意分段直接追问大模型;转写、总结、导图、录音(MP3/WAV)均可复制或导出分享。
标点拆分文本的「伪区分」在真实会议里必然失效。Cuckooyun 采用三层递进方案, 从声纹到音频能量再到人工校准,逐层兜底。
接入讯飞实时转写(角色分离)、阿里云说话人分离与自建 FunASR + CAM++ 声纹服务,直接输出带角色标记的分段结果。
对无原生能力的引擎,用 PCM 能量(RMS)自适应噪声阈值检测静音间隙,启发式切分说话人,结果标注 ? 提示可修正。
说话人可重命名为真实姓名、可合并、可批量应用到全部段落;连续同一说话人停顿 ≤5 秒自动合并为一段,避免碎片化。
覆盖会议、媒体采访、外勤销售与连锁门店,团队规模从 20 人到 3000 人。
研发与市场每周 12 场评审会,过去靠轮值记录,决议经常丢失。接入后会议录音自动转写并区分 8 位固定发言人。
记者每月 30+ 场人物访谈,单场 90 分钟。过去整理需要 6–8 小时,现在转写 + 分角色后只需校对。
600 名区域销售每日拜访,CRM 填报率不足 40%。改为佩戴录音工牌后,拜访纪要自动生成并回写客户档案。
预约 30 分钟线上演示,我们会用你的一段真实录音,跑通「转写 → 区分说话人 → AI 报告」全流程。