Experiment Configuration Guide

TRACE v1.0

如何把研究设计转化为平台配置?

本指南面向使用推荐算法实验平台的主试,说明如何将研究设计配置为可执行的算法态度实验流程。

Flow 实验流程配置

决定被试会经历哪些环节,以及正式实验中会出现哪些推荐处理条件。

Identity 被试身份

由被试号和实验编码共同确定,用于匹配主试、流程和记录。

Material 自定义新闻池

连接社交推荐、流行度推荐、随机推荐与实际展示材料。

Version 项目控制

自定义交互界面、指导语与测量项目,并按版本进行浏览和导出。

配置前需要确认的研究设计

SS社交推荐与社交标签
冷启动新闻池
SN社交推荐与无标签
冷启动新闻池
NS随机推荐与社交标签
冷启动新闻池
PP流行度推荐与流行度标签
流行度新闻池
PN流行度推荐与无标签
流行度新闻池
NP随机推荐与流行度标签
随机新闻池
NN随机推荐与无标签条件
随机新闻池

在进入平台配置前,主试需要先确认本次实验将纳入哪些推荐处理条件。平台当前支持三类推荐逻辑,并在此基础上形成 SS、SN、PP、PN、NN、NS、NP 七类处理条件。不同处理条件对应不同的材料准备、数据依赖和任务流程,建议先完成研究设计确认,再进入平台配置。

1. 社交推荐。社交推荐包括 SS 和 SN 两类处理。二者的主要差异在于界面是否显示“好友读过”标签提示。每类处理都会在正式实验任务中生成一个包含若干条新闻的推荐列表。 选择任一社交推荐处理后,平台会自动在实验流程中加入冷启动任务。冷启动任务是社交推荐的数据入口。被试将在该任务中浏览其所在冷启动组对应的新闻材料,并选择自己感兴趣的内容。平台会记录这些选择,并在正式实验中根据好友组的选择记录生成 SS 或 SN 等社交推荐列表。 社交推荐对被试关系有一定要求。建议主试在被试筛选阶段,优先选择已经存在先验社交关系的群体,这样可以提高社交来源标签的可信度,也有助于被试理解推荐列表中的社交线索。

2. 流行度推荐。这类算法包括PP和PN两类处理,二者差异在于是否显示“1000+阅读”的标签提示。每类处理都会在正式实验任务中生成一个包含若干条新闻的推荐列表。

3. 随机推荐。这类算法包括NN、NP和NS三类处理。每类处理都会在正式实验任务中生成一个包含若干条新闻的推荐列表。 其中,NN 是随机推荐与无标签条件,通常可作为基线条件。NP 的列表来源为随机推荐,但界面呈现流行度标签。NS 的列表来源同样为随机推荐,但界面呈现社交标签。因此,选择 NS 处理后,平台也会自动加入冷启动任务,以支持社交标签在实验情境中的合理性。

建议的配置顺序

1. 配置新闻库

新闻池是构成对应推荐列表的唯一内容来源。主试可以使用平台预设新闻池进行试运行,也可以在不同推荐类型下上传自定义新闻池。主试需要先为目标算法创建一个内容列表,再为该列表填充新闻来源。 主试可以根据研究设计来决定是否配置上传新闻的交互界面参数(包括媒体来源、作者认证、收藏数等)。若研究不涉及交互界面变量,可以在上传时选择跳过配置,并在实验配置页选择不显示对应参数。

① 社交推荐新闻池。
社交推荐属于实时推荐。主试需要提前配置社交推荐新闻池。该新闻池将同时用于冷启动任务和正式实验任务。由于正式实验中,所有被试都将只从其专属好友组的冷启动新闻池中进行筛选并构成SS和SN列表,这杜绝了两个任务中出现重复材料的可能。 社交推荐新闻池对材料数量要求较高。由于冷启动任务需要每个组产生足够的偏好选择记录,建议为每个冷启动组至少分配20条新闻(以10条选择为标准,约 50% 的偏好选择率估计);若被试兴趣较分散或组内人数较少,可以继续提高每组新闻数。

② 流行度推荐新闻池 。
流行度推荐属于模拟推荐。主试需要提前配置流行度推荐新闻池。该新闻池对应 PP 和 PN 条件。 若使用自定义材料,应确保上传材料已经按照研究设计中的流行度标准完成筛选。可参考的筛选依据包括阅读量、点赞量、评论量、转发量或综合热度。 平台将依据自定义的列表长度来组成内容组成流行度推荐列表。选择多个流行度推荐算法时,确保为每个算法处理都创建了对应列表,且每个列表中都填充了不少于列表目标长度的新闻素材。

③ 随机推荐新闻池。
随机推荐属于模拟推荐。主试需要提前配置随机推荐新闻池。该新闻池对应 NN、NS 和 NP 条件。 若使用自定义材料,应确保上传材料已经按照研究设计中的随机标准完成筛选。平台将依据最新上传的 15 条内容组成随机推荐列表。选择多个随机推荐算法时,确保为每个算法处理都创建了对应列表,且每个列表中都填充了不少于列表目标长度的新闻素材。

2. 配置项目

主试需要先创建一个新项目,并按流程完成项目参数配置。配置完毕后,项目将根据所选处理条件进入冷启动任务阶段,或直接进入正式实验阶段。若项目包含 SS、SN 或 NS 处理,系统会先进入冷启动任务阶段。
主试可以根据实验安排中断或继续运行项目。但实验正式开始后,不建议随意中断。中断操作可能影响被试端登录、任务进入和数据录入,进而影响实验数据的完整性。

3. 配置实验流程

进入实验配置页面后,主试可以按需上传前测信息,并自行设置前测完成码。前测完成码用于确认被试是否已经完成前测任务。随后,主试需要选择正式实验中要使用的算法处理条件。该设置决定被试进入平台后会经历哪些任务环节,也决定正式实验中会呈现哪些推荐列表。
完成处理条件选择后,主试可根据实验设计和研究目标,设置各类推荐列表的交互界面样式。

4. 录入被试

进入被试管理页面后,主试可以单条录入被试号,也可以批量导入被试号。实际实验中,被试需要填写当前实验编码和被试号,才能进入实验并完成数据录入。
建议主试在正式发放实验链接前,核对被试号、实验编码和分组信息是否一致,避免因录入错误影响被试进入实验。

5. 设置冷启动组和好友组

冷启动阶段用于收集社交推荐所需的偏好选择数据。冷启动组决定被试将浏览哪一组冷启动材料,好友组决定正式社交推荐将读取哪一组被试的冷启动选择记录。

在冷启动任务中,被试需要根据个人偏好,从冷启动新闻池中选择至少 10 条新闻。这些选择记录将作为社交推荐的基础偏好数据。当配置了多个需要冷启动任务的社交推荐算法时,每个算法处理都会引入一个冷启动子任务,所有冷启动子任务会自动整合进冷启动阶段。

若实验没有额外分层要求,主试可以使用自动分组功能。平台会随机、均衡地分配冷启动组,并同步生成社交推荐列表。若实验已经存在班级、批次、场次或其他分层安排,主试可以在被试表中手动调整冷启动组。保存后,平台会根据当前组数重新建立好友组关系,并更新相应的社交推荐数据。

6. 设置实验组和列表顺序

新闻池是实验材料库,推荐列表是被试最终看到的材料组合。主试可以使用平台预设新闻池进行试运行,也可以在不同推荐类型下上传自定义新闻池。

实验组用于控制正式实验中多个算法列表的呈现顺序,决定被试按照什么顺序看到已选算法列表。

若实验包含多个算法列表,并且需要控制顺序效应,可以启用自动拉丁方设计。平台会根据已选算法数量生成不同实验组的列表顺序,并将被试分配到相应实验组。被试登录后,将按照所属实验组对应的顺序完成列表浏览与评价。

若实验只展示一个算法列表,或研究设计不需要平衡列表顺序,则可以关闭自动拉丁方设计。此时,所有被试将按照同一默认顺序进入正式实验。具体处理顺序会在已有配置浏览页面中显示。

应用分组后,实验组和处理顺序会写入当前实验编码下的被试表。后续导出数据时,数据表会保留实验组、实际处理顺序和各列表作答结果,便于主试在后续统计模型中检查或控制顺序效应。

7. 配置指导语和测量项目

实验指导语在正式推荐任务开始前显示,用于说明被试即将完成的推荐浏览与评价任务。进入测量管理页面后,主试可以选择预设指导语,也可以自定义文本并保存。

测量指导语和测量项目会在每个算法列表展示时一同呈现,用于说明当前列表的测量要求,并记录被试对该列表的评价、判断或行为意向。主试可以使用平台预设量表,也可以根据研究需要自定义题项、选项、题型和必填状态。

8. 查看和导出数据

数据浏览页面用于检查当前实验的数据结构、完成情况和初步趋势。该页面适合进行质量核验和描述性查看。正式统计检验仍建议在专业统计软件或分析脚本中完成。

平台提供完成率、年龄分布、各算法条件均值、题项热力矩阵和被试内差值等快速浏览功能。主试可以使用这些结果判断数据是否完整、处理条件是否正常运行,以及不同算法列表是否呈现初步差异。

可导出的明细数据包括被试号、年龄、性别、实验编码、冷启动组、好友组、实验组、处理顺序、完成时间、指导语版本和具体作答内容等字段。主试可以导出 XLSX 文件,用于后续数据清洗、前测数据合并、统计模型建立和正式报告撰写。

前测二维码和完成码如何工作?

外部量表平台生成前测问卷
平台中配置前测完成码
被试回到平台继续实验

如有前测需求,我们建议直接使用外部量表平台。本平台可以接入前测入口、记录完成验证,并将被试带入后续推荐实验。

第一步,在外部量表平台生成前测问卷。前测可以包括知情同意、人口统计题、筛选题、注意力检验、先验态度、心理特质或其他研究所需变量。生成二维码后,主试回到实验配置页面,将二维码上传为前测入口。

第二步,在平台中配置前测完成码。完成码由主试设置,最多十位,可以使用数字或英文字符,并区分大小写。配置时,主试还需要注意在外部问卷的完成页/完成通知向被试展示同一个前测完成码。

第三步,被试回到平台继续实验。被试完成外部前测后,在本平台输入完成码。核验通过后,平台才允许其进入冷启动或正式推荐任务。完成码的作用是确认被试已经到达外部前测完成页,减少未完成前测却直接进入正式实验的情况。

这一设计将长问卷和复杂题型交给外部量表平台处理,同时使推荐算法实验平台保持对推荐处理、列表呈现和正式测量记录的控制。

被试身份与实验编码

被试身份由被试号和实验编码共同确定,且不涉及姓名等隐私信息。被试号用于识别个体,实验编码用于识别其所属主试和实验流程。只有当被试号已经被写入当前实验编码对应的被试表时,被试才能进入实验。

主试端需要录入被试号,以建立当前实验编码下的实验身份。平台随后为被试分配冷启动组、好友组和实验组。

被试端需要填写被试号和实验编码,平台据此完成身份匹配,并记录年龄、性别等人口统计信息。因此,确保向被试告知的信息包括:实验流程、被试号和实验编码。

实验设计

算法态度项目默认采用完全被试内实验设计。每名被试将按照主试设定的顺序,依次经历全部算法与标签处理,并在每轮任务后完成相应评价。

该设计便于比较同一被试在不同推荐条件下的态度差异,并减少个体差异对研究结果的干扰。

若需采用被试间设计,主试可以分别配置多个项目,并为每个项目添加不同被试。

被试数量的选择

被试数量选择与期望观测的算法处理数量息息相关。平台可以允许最多20个处理,但这并不意味着一项研究需要同时估计20种处理之间的全部差异。主试应先确定主要研究问题,并配置能够回答这些问题的少量核心处理。

对被试数量的选择则需要事先考虑效应量大小、被试内相关程度、算法处理与新闻内容属性的交互、预期失访和无效数据比例等各因素,并结合模拟功效分析程序确定。