跳到报告正文
2026 年研究版 · 匿名人工听审

AI Music Benchmark · 音乐生成模型评测

2026 AI 音乐生成模型人工听审评测报告

基于五个前沿模型、十三个分析场景与匿名成对听审,系统比较模型总体偏好、场景能力、听众差异及质量失效模式。

1,000主要样本听众
7,124千人队列有效判断
1,040模型生成样本
13分析场景
104创作案例
5参评模型

核心结果 · 综合总榜

五模型综合排名

总榜纳入 1,000 名六轮完成者。表格直接展示听众投票规模;综合名次同时参考各大场景的表现,避免某一类题目出现次数较多而主导结果。
综合名次模型综合结果结果波动范围第一名稳定性
01Mureka65.6%62.3%68.8%86.7%
02Suno62.5%59.1%66.4%13.3%
03Happy Shrimp47.8%44.2%50.9%0.0%
04MiniMax39.4%36.0%43.1%0.0%
05Lyria34.6%31.7%37.8%0.0%
统计分析榜的统计学含义

Bootstrap(自助法)是统计学和社会科学研究中常用的非参数重抽样方法,用于根据已观测样本估计统计量的抽样不确定性。本研究以 1,000 名听众为重抽样单位,进行 300 次有放回抽样;每次均保留同一听众前六轮判断的完整结构。由此得到「综合结果」的经验分布、「结果波动范围」(95% 区间)及「第一名稳定性」。综合结果对 13 个大场景等权,避免场景题量差异改变总体结论;结果波动范围越窄,说明该分数在重抽样下越稳定;第一名稳定性描述排名在样本扰动下的持续程度,不应解释为模型在现实世界中的绝对胜率。

统计分析榜用于检查直接票数所呈现的领先关系,在场景权重和听众样本发生合理波动时是否仍然成立。

查看完整结果与证据解释

研究范围 · 结论适用边界

评测对象、共同测试面与产品能力边界

五家产品在翻唱、续写、参考输入、局部编辑、分轨和实时交互方面存在显著差异。本次匿名听审集中比较统一创作任务中的音乐生成结果;综合排名反映共同任务下的听众偏好,完整产品选型仍需结合工作流能力。
01

大规模、多场景、多维度人工听审

研究覆盖 5 个指定模型版本、13 个分析场景、19 个测试条件和 104 个创作案例。偏好、双拒、理由标签、听审行为与问卷人群画像共同构成多维证据体系。

02

华语场景优先的研究范围

本轮主要研究中文歌曲创作与中国在线听众语境,并包含纯器乐和功能性音乐;没有系统纳入英文、日文、韩文或其他外文歌曲任务,因此不能把名次外推为外语演唱、跨语种歌词或全球市场表现。

03

相关研究检索与首创性边界

截至 2026-09-01,我们检索到 Music Arena、MusicPrefs、AIME、SongEval 等人类偏好研究,但尚未发现同时覆盖五个前沿模型、千名级听众、十三个分析场景(十九个测试条件),并公开参与者级不确定性分析的同类公开评测。该表述受公开可检索资料范围限制,不主张可证明的绝对“行业第一”。

产品能力背景

五家模型/产品公开能力矩阵

矩阵汇总各提供方截至检索日公开展示的产品能力,与本次听审得分相互独立。各项能力的实际可用性受套餐、地区、入口与指定参评版本影响。Suno 当前公开的端到端创作与制作链路最完整;其余产品在编辑、翻唱、图像作曲、实时交互或轻量创作上形成不同侧重。
公开产品能力Suno参评 V5.5Mureka参评 V9.5MiniMax参评 Music 3.0Lyria参评 3.5Happy Shrimp参评 1.0
A · 核心生成
一句话/提示词生成完整歌曲完整歌曲完整歌曲完整歌曲完整歌曲完整歌曲
自定义歌词生成歌曲自写歌词自写歌词自写歌词自写歌词自写歌词
纯器乐生成器乐模式器乐模式器乐模式器乐模式器乐模式
风格、人声、结构与技术参数控制风格/人声风格/人声风格/人声风格/人声自然语言主导
B · 参考与再创作
参考输入驱动创作音频参考音频参考音频参考图像参考未见可靠官方说明
翻唱/重编/风格重塑翻唱Remix翻唱未见可靠官方说明未见可靠官方说明
歌曲续写/延长ExtendExtend未见可靠官方说明未见可靠官方说明未见可靠官方说明
可复用音色/风格身份Personas参考能力,不等同固定身份未见可靠官方说明未见可靠官方说明未见可靠官方说明
C · 编辑与制作
局部段落重写或替换Replace Section任意片段重写未见可靠官方说明未见可靠官方说明未见可靠官方说明
人声分离/多轨分轨高级分轨人声与多轨分离独立人声分离产品未见可靠官方说明未见可靠官方说明
多轨时间线/DAW 工作流完整制作环境Studio/DAW 助手未见可靠官方说明未见可靠官方说明未见可靠官方说明
实时交互式音乐生成未见可靠官方说明未见可靠官方说明未见可靠官方说明Lyria RealTime未见可靠官方说明
图像生成音乐未见可靠官方说明未见可靠官方说明未见可靠官方说明图像作曲未见可靠官方说明
官方已公开提供或明确展示能力形态不同,或依赖特定产品面/套餐/地区截至检索日未见可靠官方说明
01

Suno:端到端链路最完整

从灵感和歌词生成,到翻唱、续写、音频上传、Personas、局部替换与高级分轨,再到 Studio 2.0 的多轨时间线、MIDI、效果器和自动化,公开产品面已经覆盖从生成到制作的完整闭环。

02

Mureka:编辑与制作能力紧随其后

除 Easy/Custom/Soundtrack、参考与 Remix 外,Mureka 公开提供片段重写、带歌词续写、精确裁剪、乐谱与人声/多轨分离,并正把自然语言制作任务延伸到 Studio 和 DAW 工作流。

03

MiniMax:聚焦生成控制

Music 3.0 的公开界面强调自定义歌词、纯器乐,以及在段落标签后添加编曲、人声和情绪指令。相较 Suno 与 Mureka,尚未看到同等完整的歌曲后期编辑链路。

04

Lyria:图像作曲与实时交互形成独特路线

Lyria 3.5 支持粗略灵感、自写歌词、真实人声、多语言、指定时长与细致技术控制;产品家族还包含图像生成音乐和 Lyria RealTime,整体定位偏向高保真生成与交互式乐器。

05

Happy Shrimp:轻量的一句话完整成歌

公开产品面突出一句话生成、智能或自定义歌词、纯器乐、参考音频定制音色,以及复用歌曲配方再创作。其体验更收敛,但续写、局部编辑、分轨与多轨制作尚未见可靠官方说明。

研究问题

核心研究问题与统计解释单位

单曲作为随机化测试刺激进入听审。B01–B12 以相邻男女声条件配对为六个曲风场景,B15–P08 保持独立;B01-1 等单个案例不形成独立结论。
01

整体而言,听众更偏好哪个模型?

采用场景等权的总体偏好分数,避免样本量更大的场景支配报告的核心结论。

02

每个模型擅长和失手在哪里?

分别比较人声、纯器乐、商业功能性音乐和压力题,并明确展示统计不确定性。

03

这些结论有多稳定?

检验不同听众人群、票数汇总规则与扩展轮次下,结论是否仍然成立。

执行摘要

主要发现、证据强度与适用范围

面向研究者、模型团队、媒体与音乐行业读者,集中呈现核心判断、统计证据和结论边界。
01

听众把票投给了谁

在直接投票中,Mureka 被选中 1334 次,参与了 2419 次对比;这是当前总榜最直观的支持规模。

02

名次之外的关键细节

前两名直接比较时,Mureka 获得约 52.4% 的支持。这个结果用于理解两者正面对决,和总榜的综合排序一起阅读。

03

行业上应该怎样使用

优先查看 13 个大场景的能力画像,用它形成模型选型假设;不要把总榜直接翻译成商业可用率、生成成功率或对所有工作流的推荐。

04

证据范围与复现要求

分析队列包含 1000 名六轮完成者。每人只贡献前六轮,平局、双拒绝和加测记录均单独处理。

读者指南

专业读者的报告阅读路径

同一张榜单无法满足所有行业问题。以下阅读路径区分统计可信度、音乐判断、研发诊断、公共传播和生产决策。
01

高校 AI 实验室

先检查估计目标、实验单位、结果波动范围与数据发布计划,再使用模型排名。

查看方法与透明度
02

音乐院校与音乐研究者

重点查看场景定义、听众评价理由、音乐性构念与人群差异;偏好指标仅覆盖作品完整音乐学评价的一部分。

查看评价证据
03

AI 音乐模型研发团队

从两两矩阵、拒绝原因和场景例外定位相对短板;在获得生成协议前,不把差异全部归因于模型架构。

查看场景能力画像
04

AI 与科技媒体

区分点估计、置信区间与最终结论;报道时同时引用样本状态、直接比较和解释边界。

查看主要结果
05

音乐行业从业者

把结果当作模型选型线索,而非采购结论;真实生产还需要可用率、编辑成本、版权、稳定性与交付效率证据。

查看局限与行业边界

主要结果

6,000 次主要判断如何构成

总榜回答模型之间的相对位置;本节转而呈现听众实际作答的结构:多少次明确选出一首、多少次认为两首接近,以及多少次两首都未达到接受标准。
主要判断结果分布共 6,000 次判断
前六轮主要判断6,000
明确选择一首4,78379.7%

听众明确选择左侧或右侧作品,形成模型的直接被选票。

两首接近4026.7%

听众认为两首作品表现接近;统计分析中双方各计半票。

两首都不接受81513.6%

听众认为两首作品都未达到接受标准;该结果单独分析,不计入模型被选票。

明确选择、平局和双拒绝三类结果合计为 6,000 次主要判断。第 7–12 轮自愿加测不进入本图。

模型 × 模型

模型两两直接对比

每个单元格展示行模型在直接对比中被选中的比例;平局各计半票,双拒绝单独统计。
模型MurekaSunoHappy ShrimpMiniMaxLyria
Mureka·52.4%平 8.8%64.9%平 8.3%70.8%平 7.7%74.4%平 7.5%
Suno47.6%平 8.8%·62.3%平 8.4%68.2%平 7.8%72.1%平 7.6%
Happy Shrimp35.1%平 8.3%37.7%平 8.4%·57.6%平 8.6%60.8%平 8.2%
MiniMax29.2%平 7.7%31.8%平 7.8%42.4%平 8.6%·54.4%平 8.3%
Lyria25.6%平 7.5%27.9%平 7.6%39.2%平 8.2%45.6%平 8.3%·

单元格表示行模型在直接对比中被选中的比例,平局各计半票;50% 表示两者接近。颜色仅辅助阅读。

质量与稳健性

数据质量与稳健性检验

拒绝比例、可比较判断、扩展轮次和选择理由共同构成排名结果的质量诊断与稳健性证据。

主要分析听众

1,0001,000 名参与者完成六轮并纳入主要分析

双拒绝率

13.6%两首作品均未被接受;该结果不进入相对偏好模型并单独报告

进入相对偏好模型的判断

5,185原始平局率 6.7%;拒绝率 13.6% 并单独报告

稳健性检查

核心分析的样本边界

核心判断 6,000 · 千人队列共 7,124
6,000前六轮核心判断
1,124第 7–12 轮加测(不入主榜)

每位参与者仅以前六轮进入正式模型分析,确保所有人贡献相同数量的判断。第 7–12 轮形成的加测记录保留为数据规模信息,不用于模型排名、场景结果、理由汇总或结果波动估计。

判断依据

听众最常标记的选择理由

比例以 6,000 条主要判断为分母;同一次判断可以选择多个理由,因此各项比例允许合计超过 100%。
旋律更抓耳30.8%
情绪更匹配25.3%
风格更匹配21.9%
人声更自然20.1%
编曲更完整14.0%
中文咬字更好11.6%

场景索引

十三个分析场景的能力分布

104 个创作案例来自 19 个测试条件。B01–B12 按六种曲风合并男女声,其余七个场景独立展示;公开结论不根据单曲曝光或单首结果排名。
B01–B02

流行

主要判断 1518 · 可比较 1295 · 平局 5.1% · 拒绝 14.7%

01Mureka68.5%64.072.0
02Suno65.4%61.669.2
03Happy Shrimp50.7%47.254.1
04MiniMax36.6%32.840.4
05Lyria28.8%25.032.5
该场景最常出现的评价标签旋律更抓耳475人声更自然395情绪更匹配357
各场景独立估计。小样本场景的区间较宽,排名接近时不应仅凭点估计判断差异。

当前显示 13 / 13 个场景

编号测试场景场景分组人声条件场景结果
B01–B02流行等权合并 B01 男声与 B02 女声条件,评估主流流行音乐生成能力。人声正交组男声与女声
Mureka68.5%
B03–B04抒情等权合并 B03 男声与 B04 女声条件,评估以情绪表达为核心的抒情音乐。人声正交组男声与女声
Mureka70.0%
B05–B06国风等权合并 B05 男声与 B06 女声条件,评估国风音色、旋律与编曲表达。人声正交组男声与女声
Mureka60.9%
B07–B08说唱等权合并 B07 男声与 B08 女声条件,评估 Flow、节奏表达与制作能力。人声正交组男声与女声
Mureka68.7%
B09–B10摇滚等权合并 B09 男声与 B10 女声条件,评估摇滚写作、能量与乐队编配。人声正交组男声与女声
Mureka60.7%
B11–B12电子等权合并 B11 男声与 B12 女声条件,评估电子制作与人声融合能力。人声正交组男声与女声
Mureka66.6%
B15摇滚纯器乐考察编曲发展、器乐质感与 Solo 能力。纯器乐纯器乐
Mureka65.1%
B16国风纯器乐面向视频、游戏和背景音乐的国风氛围写作。纯器乐纯器乐
Suno80.3%
B17短视频神曲考察即时记忆点、Hook 密度与短内容适配能力。商业功能不限人声
Suno67.3%
B18游戏/预告片氛围曲考察叙事推进、张力、规模感与画面同步氛围。商业功能不限人声
Mureka73.4%
B19广告配乐考察功能性、品牌适配语气与商业可用性。商业功能不限人声
Suno66.0%
P07复杂指令执行考察多段落、多角色和多乐器约束的执行能力。压力测试不限人声
Mureka61.0%
P08长结构曲式考察七至九分钟扩展曲式中的持续结构一致性。压力测试男声
Suno68.6%

听众人群与问卷

听众样本结构与问卷画像

所有参与者在进入盲听前回答四项背景问题。这里报告完整人群构成、完成行为,并探索不同身份、年龄和音乐偏好下的模型结果是否一致。分群结果不改变主榜权重。
四题完整填写率100.0%1,000 份完整背景问卷
人均选择曲风2.77共记录 2,768 次曲风选择
愿意参与后续内测96.7%愿意 967 人 · 不愿意 33 人

参与漏斗

从报名到自愿加测

六轮完成者进入主要队列;第 7–12 轮完全自愿,只用于稳健性分析。
011,211提交背景问卷
021,000完成六轮听审
03195进入自愿加测
04184完成全部十二轮
六轮完成率 82.6% · 主要队列中的加测参与率 19.5%

问卷 01 · 用户身份

参与者如何描述自己

AI 音乐爱好者47.4%474
职业音乐人/制作人21.0%210
内容创作者19.7%197
轻松创作与亲友分享11.9%119

问卷 02 · 年龄

参与者年龄构成

18 岁以下1.3%13
18–24 岁14.5%145
25–34 岁34.2%342
35–44 岁28.6%286
45 岁以上21.4%214

问卷 03 · 音乐偏好

参与者平时喜欢听什么

1,000 名参与者共做出 2,768 次选择;每人可选一至三个曲风,因此各项比例之和会超过 100%。
流行70.4%704
中文歌曲38.3%383
国风23.6%236
民谣21.6%216
欧美14.7%147
R&B13.2%132
摇滚12.9%129
K-Pop7.7%77
说唱7.5%75
粤语6.7%67
轻音乐6.4%64
中国传统6.0%60

探索性分群

不同听众会得出同样的排序吗

切换人群维度和分组,比较场景等权的模型偏好点估计,同时观察完成率、加测率、平局率与拒绝率。
当前分组AI 音乐爱好者
六轮主要样本
474
报名后六轮完成率
100.0%
平局率
7.0%
双拒绝率
12.9%
加测参与率
19.4%
模型偏好点估计覆盖 13 / 13 个大场景
01Suno64.5%
02Mureka62.4%
03Happy Shrimp49.4%
04MiniMax37.8%
05Lyria35.9%
分群分析属于探索性结果,使用轻度正则化的 Davidson–Bradley–Terry 场景等权点估计,未计算分群结果区间。它用于发现值得后续验证的差异,不支持因果解释,也不应依据接近的点估计宣称人群存在确定差异。

听审行为与质量

听审行为、完成路径与数据质量

除模型偏好外,试听时长、六轮完成速度、最低试听达标率和每轮投票构成共同说明数据是否可信,也帮助识别随轮次变化的疲劳或判断策略。
完成六轮用时中位数12.1 分钟中间 50% 位于 8.2–20.6 分钟
每首作品试听时长中位数42.3 秒中间 50% 位于 28.7–70.4 秒
两首均达到最低试听要求100.0%主要判断全部通过双侧最低试听门槛
自愿进入第 7–12 轮19.5%195 名主要队列听众继续加测

轮次诊断

六轮投票构成如何变化

每行包含同样数量的听众。色块显示明确偏好、平局和双拒绝三类结果的构成,并列展示每首试听时长中位数、平局率和双拒绝率。
选择其中一首平局两首都不满意
第 1 轮
每首试听中位数 54.6 秒平局 4.2% · 双拒绝 12.3%
第 2 轮
每首试听中位数 43.8 秒平局 5.8% · 双拒绝 14.6%
第 3 轮
每首试听中位数 40.4 秒平局 7.9% · 双拒绝 12.6%
第 4 轮
每首试听中位数 40.8 秒平局 7.0% · 双拒绝 11.8%
第 5 轮
每首试听中位数 39.0 秒平局 7.8% · 双拒绝 15.8%
第 6 轮
每首试听中位数 37.0 秒平局 7.5% · 双拒绝 14.4%
轮次与测试场景并非完全独立,后轮次试听时长下降也可能包含界面熟悉效应。这里用于质量诊断,不把轮次趋势解释为模型能力变化。

自愿加测

完成六轮后,多少听众继续完成十二轮

以完成六轮的 1,000 名听众为分母,只报告继续完成全部十二轮的人数和比例。
184名听众完成全部十二轮/共 1,000 名六轮完成者18.4%

听众评价证据

双拒绝原因与自由评价证据

这里补充解释听众为什么做出选择,以及两首作品同时未被接受时出现了哪些问题。

双拒绝诊断

两首都不满意的原因

共 815 次双拒绝;比例以双拒绝判断为分母,一次判断最多选择两个问题。
旋律平淡37.5%306
风格不匹配26.9%219
情绪不匹配24.7%201
编曲混乱23.4%191
人声不自然23.3%190
歌词含混或错误19.4%158
音质问题8.3%68
歌曲不完整1.7%14

自由文本补充评价

用户自行填写的评价信息

当前纳入 1,304 条盲听补充评价与 0 条创作评价;页面只展示主题聚合,不直接公开原始文字。

预先规定的分析方案

研究设计、估计方法与稳健性分析

报告明确主要队列、分析单位、估计模型和稳健性口径,以控制统计选择空间。预注册状态依据带时间戳且不可修改的外部记录判定。
  1. 01

    冻结最先完成的 1000 名听众

    第 1000 位完成全部六轮的参与者出现时,主要样本立即停止纳入。每人的前六轮共同构成恰好 6000 条主要判断。

  2. 02

    以大测试场景为分析单位

    B01-1 等创作案例是用于打散生成随机性的重复测试刺激。B01–B12 先按曲风合并男女声条件,形成六个人声曲风场景;其余七个场景保持独立。

  3. 03

    在保留平局的前提下估计成对偏好

    使用 Davidson–Bradley–Terry 模型估计潜在偏好,同时保留平局结果,并将双拒绝作为独立质量指标报告。

  4. 04

    说明结果可能有多大波动

    按听众而非孤立票数计算 95% 结果区间,保留同一人多轮判断之间的关联。图表同时提供有效样本量,帮助读者判断结果的稳定程度。

  5. 05

    明确区分主要分析与稳健性分析

    核心结果对各场景等权,并固定使用每位参与者的前六轮。第 7–12 轮仅作为参与行为记录,不计算模型结果,不混入主要结论。

判断时隐藏模型身份
在大场景层面解释结果
核心总分对场景等权
可复现的版本化数据
学术附注:Bootstrap 参与者级重抽样

为量化样本本身带来的不确定性,我们以参与者为单位进行有放回重抽样。该方法保留每位听众前六轮判断的完整结构,避免把同一人的多次作答误当作彼此独立的票数。

重抽样对象
从 1,000 名六轮完成者中有放回抽取 1,000 人
保留的结构
每位入选听众完整保留前六轮判断及其场景关联
重复次数
重复 300 次,形成结果分布
统计产出
据此计算 95% 结果区间,并观察综合名次在重抽样中的稳定程度

综合名次稳定性参考

模型进入第一名的重抽样比例
Mureka86.7%
Suno13.3%
Happy Shrimp0.0%
MiniMax0.0%
Lyria0.0%

研究透明度档案

研究责任、数据来源与复现记录

本节集中说明研究责任、样本来源、模型与生成版本、音频处理、统计代码、治理要求和变更记录,支持外部审阅与结果复现。

研究身份卡

可核验的分析定义

研究状态
报告分析数据 · 1,000 名六轮完成者
主要估计目标
大场景等权条件下,模型面对其他参评模型时 P(胜)+0.5×P(平) 的平均值
公开解释单位
13 个分析场景;B01–B12 按曲风合并男女声,单曲只作为随机化刺激
投票结果
选择其中一首、平局或双拒绝;双拒绝不进入相对偏好似然并单独分析
不确定性估计
听众级百分位重抽样区间 · 300 次 · seed 20260829
数据快照
2026-09-01T14:45:25+08:00

已经明确

报告采用的分析规则

  • 主要指标场景等权偏好分数与两两条件偏好,并控制各场景票数差异。
  • 主要队列最先完成六轮的 1000 名参与者;第 7–12 轮只用于稳健性分析。
  • 解释层级所有公开结论止于大场景,不从 B01-1 或单首歌曲下结论。
  • 平局与拒绝平局进入 Davidson–Bradley–Terry 模型;双拒绝作为质量失败另行报告。
  • 听众不确定性按听众而非孤立票数计算结果区间,保留同一听众多轮判断之间的相关性。

治理与复现范围

研究治理、来源记录与复现材料

  • 作者与贡献声明列出研究设计、题库、工程、统计分析、数据复核和报告写作的责任人及 CRediT 角色。
  • 资助、利益冲突与伦理披露发起方与参评模型的商业关系、资金来源、参与者同意、隐私处理与伦理审查/豁免依据。
  • 招募与激励说明招募渠道、地区、活动曝光、奖励或证书机制、重复账号控制、纳入排除规则和未完成人群流失。
  • 模型身份与版本公开产品名、API/端点、准确版本、调用日期与地区。
  • 生成与筛选协议说明每个提示词生成次数、默认参数、失败重试、候选选择、人工筛除和后处理规则,避免选择性生成。
  • 音频呈现协议说明编码、响度归一化、裁切、静音处理、播放片段、设备建议、最低试听阈值和界面随机化实现。
  • 分析方案时间戳提供数据揭盲前的不可变协议链接;若不存在,应诚实称为预先规定方案,并附完整变更日志。
  • 复现与引用包发布代码版本、依赖环境、聚合数据、字典、校验和、许可证、引用格式与版本化永久链接。

解释边界

相对偏好指标的解释边界

这项研究估计的是特定题库、模型版本、听审界面与招募人群下的相对偏好。以下限制不仅是免责声明,也决定行业读者应该如何使用结果。
01

参与者采用自愿招募样本

样本集中于主动参与 AI 音乐活动的中文互联网用户,不能代表全国、全球或所有专业音乐人。

用途:描述本样本;不要推断总体民意。
02

偏好指标的构念范围

成对选择混合了旋律、风格、情绪、人声、制作和个人口味,不能替代音乐学、工程质量或创作原创性的独立测量。

用途:报告相对偏好;避免称为绝对质量评分。
03

区间未覆盖生成随机性

本报告的结果区间只重抽听众,题目案例与每次生成样本被视为固定刺激;因此区间没有回答换一批提示词或重新生成后结果会波动多少。

建议:增加题目/生成样本层级的层次重抽样或留一案例敏感性分析。
04

大量场景和分群会产生偶然发现

13 个分析场景、多个模型对和人群分层带来多重比较问题;单个场景领先或分群反转可能只是抽样波动。

建议:主结果保持少量预定假设,探索结果标注并提供 FDR 或收缩估计。
05

相对表现与生产门槛

报告没有人类制作基线、绝对可接受率、编辑工时、成本、版权风险或交付稳定性,因此不能直接形成采购结论。

用途:形成选型假设;另做真实工作流验证。
06

模型与服务会持续变化

在线模型、端点和默认参数更新后,历史排名可能迅速失效;品牌名相同也不保证底层版本相同。

建议:发布准确版本、生成时间、内容哈希与报告有效期。

参与者致谢

公开听审参与者致谢

本报告致谢名单收录 1,000 名至少完成六轮听审的参与者,并按照姓名拼音首字母排序。公开名称优先采用用户最后一次生成证书时填写的名字;未填写证书名字时,采用用户的系统名称;系统名称模糊或未设置时,采用系统唯一 ID。
1,000致谢名单参与者
名单排序
按照姓名拼音首字母排序
名称采用规则
优先展示最后一次证书填写的名字;未填写时采用用户的系统名称;系统名称模糊或未设置时,采用系统唯一 ID

参与者公开致谢名单与研究数据身份系统分离;本数据视图中的 181 个记录采用稳定参与者编号。

显示 160 / 1,000
  • 0001【歌手喵】初一
  • 0002^娜小陈^
  • 000392赫兹
  • 0004阿碧
  • 0005阿布
  • 0006阿杰
  • 0007阿卷
  • 0008阿里木江艾力
  • 0009阿力木
  • 0010阿森
  • 0011阿暄啊
  • 0012阿依本
  • 0013阿卆咪
  • 0014欸唉
  • 0015艾克热木·图尔贡
  • 0016艾特梨
  • 0017爱丽丝三分甜
  • 0018安妮泥泥
  • 0019安翔
  • 0020安雪儿
  • 0021
  • 0022白天垚
  • 0023半个错别字
  • 0024半闲
  • 0025半音节
  • 0026宝才哥
  • 0027宝姬公主
  • 0028贝小七
  • 0029比尔达斯
  • 0030彼得赛恩
  • 0031不凡
  • 0032不全
  • 0033不忘初心
  • 0034布丁
  • 0035蔡尚鹏
  • 0036蔡岩峻
  • 0037参商
  • 0038曹军
  • 0039曹昆
  • 0040曹一川
  • 0041曹勇
  • 0042曹hr
  • 0043曾馨仪
  • 0044昌军军
  • 0045沉寂的巨蟹
  • 0046陈大侠
  • 0047陈海波
  • 0048陈家忠
  • 0049陈家忠
  • 0050陈康腾
  • 0051陈珂
  • 0052陈林
  • 0053陈沛禹
  • 0054陈泊安
  • 0055陈书桓
  • 0056陈天
  • 0057陈信宏老婆
  • 0058陈育峰
  • 0059成长志
  • 0060程小雷
  • 0061橙子
  • 0062迟亮(粱Liang)
  • 0063炽雨
  • 0064楚沉
  • 0065船到桥头
  • 0066从知
  • 0067崔秉福
  • 0068崔青文
  • 0069大懒猫
  • 0070大山
  • 0071大圣
  • 0072大新
  • 0073大爺很忙
  • 0074大鱼
  • 0075呆萌小卧蚕
  • 0076蛋壳音乐实验室
  • 0077挡不牢
  • 0078道合志同创作
  • 0079地球上的火星人
  • 0080等到海棠依旧
  • 0081邓水金
  • 0082镫镫镫
  • 0083丁明明
  • 0084丁巳扬
  • 0085东东
  • 0086东海老翁
  • 0087東哥
  • 0088董静
  • 0089董静
  • 0090豆听音乐
  • 0091独孤夫子
  • 0092独孤夫子1
  • 0093杜宛庭
  • 0094哆咪索音乐工作室
  • 0095尔東
  • 0096耳姬不可爱
  • 0097饵块
  • 0098贰萌
  • 0099贰一
  • 0100帆 影
  • 0101樊心焚天
  • 0102饭饭
  • 0103范江炜
  • 0104非一般
  • 0105废墟上的白羊
  • 0106费吉米
  • 0107
  • 0108风起书间
  • 0109风青扬
  • 0110风无静
  • 0111风中行
  • 0112风中行是我
  • 0113枫雨
  • 0114枫之林
  • 0115疯狂的数据库
  • 0116锋鸣
  • 0117冯凯
  • 0118鳳槻觑
  • 0119佛叔
  • 0120付秀丽
  • 0121富星
  • 0122甘雨禾
  • 0123感觉
  • 0124高先生
  • 0125高原行者
  • 0126歌者景云
  • 0127格林
  • 0128耿占宇
  • 0129公振宇
  • 0130宫訫
  • 0131宫业程
  • 0132关外小胡子
  • 0133光大
  • 0134归凌
  • 0135歸宿
  • 0136郭大侠
  • 0137郭伟杰(水滴-GWJ)
  • 0138郭子城
  • 0139果果麻麻
  • 0140海狐
  • 0141海纳百川
  • 0142韩子柒
  • 0143航一白
  • 0144好好吃饭
  • 0145好运气
  • 0146郝好先生
  • 0147昊奇梦
  • 0148浩浩努力学Ai
  • 0149皓玲-实践吧!
  • 0150禾琪
  • 0151何飞
  • 0152贺安
  • 0153贺鸣 老师
  • 0154黑蛋
  • 0155黑美人
  • 0156黑皮
  • 0157黑TaoKING
  • 0158珩星
  • 0159弘信扬真
  • 0160宏达来了

开放研究数据集

AI 音乐人工听审开放研究数据集

机构申请制 · 工作邮箱验证

面向高校实验室、模型团队和行业研究者提供完整、版本化且可复现的数据包,用于模型评估、偏好建模、错误诊断和下一代 AI 音乐系统迭代。访问采用申请制,经机构工作邮箱与研究用途核验后发送限时下载链接。

01

匿名参与者与问卷

稳定匿名参与者 ID、粗粒度人群属性、音乐与 AI 使用背景、问卷回答、六轮完成状态和听审行为指标。不会包含用户名、证书姓名、邮箱、手机号、IP、设备标识或精确时间戳。

02

评测歌曲与生成信息

稳定歌曲 ID、模型与版本、大场景、创作案例、提示词与歌词、生成协议、音频技术信息、文件校验和,以及通过权利复核后可再分发的评测音频。

03

逐条听审明细

匿名参与者 ID、轮次、成对歌曲 ID、选择/平局/双拒绝、理由标签、试听时长、最低试听达标状态、场景和实验版本,可在三张主表之间稳定关联。

复现、引用与治理文件

版本化研究数据与复现材料

数据包附带数据字典、字段约束、版本清单、研究用途许可、分析脚本、依赖环境、引用格式和完整性校验。每次发布均标注不可变的数据版本。

隐私设计

能跨表关联,但不能反查真实用户

匿名 ID 由服务端使用本评测专属秘密密钥对内部 user_id 执行 HMAC 生成,不从 username、邮箱或简单哈希推导。相同参与者在参与者、问卷和听审表中保持同一 ID,并在本评测后续版本中稳定;密钥与映射表永不进入数据包。导出前执行碰撞检查,必要时自动延长 ID。participant_id = Base32(HMAC-SHA256(benchmark_secret, internal_user_id))[0:20]
01

直接身份字段全部删除

删除姓名、用户名、证书名称、邮箱、手机号、社交账号、IP、设备 ID、User-Agent、邀请关系和任何内部主键;贡献者公开名单与研究数据集彻底分离。

02

准标识符分箱与小组抑制

年龄使用区间,职业和地区使用较粗类别;交叉分组样本量小于 10 时合并或隐藏。绝对时间改为轮次或相对时长,避免用罕见属性组合重新识别。

03

不直接发布自由文本

用户附加评价可能包含姓名、机构或事件线索。默认只发布人工复核后的匿名主题编码;确需发布引文时逐条去标识并取得相应发布权限。

04

保留研究所需的唯一性

同一匿名 ID 可关联问卷、六轮判断和自愿加测,支持分群和重复测量分析;不提供匿名 ID 与站内账号之间的反向映射。

受控访问流程

从申请到下载的四个步骤

完整数据不使用公开永久 URL。每一次访问都绑定真实机构、用途声明、数据版本和许可条款,既支持可信研究,也为参与者保留最低限度的隐私与追责能力。
  1. 01

    提交机构与用途

    填写姓名、机构、职务、机构网站、国家/地区、计划用途、研究问题和预期产出,并接受研究用途协议。

  2. 02

    验证工作邮箱

    系统检查邮箱域名、MX 记录、一次性邮箱与公共邮箱黑名单,并发送验证链接。高校、研究机构和企业自有域名均可申请。

  3. 03

    自动检查与人工复核

    机构域名与网站一致、用途清晰且同意条款的申请可快速通过;域名不一致、敏感用途或批量申请转人工审核并保留审计记录。

  4. 04

    发送限时下载链接

    批准后仅向已验证工作邮箱发送对象存储签名链接,默认 72 小时有效、最多下载 3 次,并记录数据版本、校验和、申请编号和下载事件。

数据访问申请

告诉我们你来自哪里,以及将怎样使用这些数据

企业模型团队、高校实验室、音乐研究机构、行业公司和专业媒体均可申请。允许将数据用于商业机构内部的模型评估与迭代,但不允许重新识别参与者、对外转售原始数据或绕过申请流程再次分发。
只接受机构工作邮箱

拒绝 Gmail、QQ、163、Outlook、iCloud、一次性邮箱等公共域名;企业托管在 Microsoft 365 或 Google Workspace 上的自有域名不受影响。域名与机构网站不一致时进入人工复核。

  • 仅用于申请中声明的研究、评估或模型改进目的
  • 不得尝试重新识别、联系或画像任何参与者
  • 不得转售、公开镜像或向未获批第三方分发原始数据
  • 公开成果必须引用报告、数据版本和建议引用格式
建议至少 100 字;用途越明确,审核越快。

提交申请并通过审核后,我们将在 1–3 个工作日内将数据下载链接发送至已验证的工作邮箱。

不可变版本:每次发布使用语义版本、冻结时间、Git revision、数据清单与 SHA-256;修订不覆盖旧包。

音频权利:仅打包经过再分发权利复核的音频;不能再分发的文件以稳定 ID、技术元数据和受控试听方式替代。

访问审计:申请、邮箱验证、审核、许可版本、下载次数和撤销状态全部留痕;链接泄露或条款违反时可立即失效。