超强阵容集结!小红书大模型论文分享会来了,四大国际顶会作者强势来袭
预约直播,多篇论文一作作者在线与你交流!你将获得关于大模型技术的最新见解,探讨未来的发展趋势,并交流如何利用这些前沿技术提升用户体验,推动平台智能化发展。
自洽性方法(Self-Consistency,SC)一直是思维链推理中广泛使用的解码策略,通过生成多个思维链并取多数答案作为最终答案,来提高模型的性能。但它是一种高成本的方法,需要进行预设大小的多次采样。在 ICLR 2024 上,小红书提出一种简单且可扩展的采样过程 —— 早停自洽性方法(Early-Stopping Self-Consistency,ESC),它能在不牺牲性能的情况下,大幅度降低 SC 的成本。在此基础上,团队进一步推导出一种 ESC 控制方案,以动态选择不同任务和模型的性能-成本平衡。三种主流推理任务(数学,常识和符号推理)的实验结果显示,ESC 在六个基准测试中显著降低了平均采样次数,同时几乎保持原有性能。
论文地址:https://arxiv.org/abs/2401.10480
小红书在 ACL 2024 中提出了 Fine-Grained Self-Consistency (FSC) 方法,能够显著提升自洽性方法在自由格式生成任务上的表现。团队首先通过实验分析了现有面向自由格式生成任务的自洽性方法的不足来自于粗粒度的共性样本选择,其无法有效利用不同样本细粒度片段之间的共性知识。在此基础上团队提出了基于大模型自融合的 FSC 方法,实验证实其在代码生成、摘要生成以及数学推理任务上都取得了显著更优的表现,同时保持了相当的消耗。
论文地址:https://github.com/WangXinglin/FSC
小红书在 ACL 2024 中提出了 BatchEval 方法,能够以更低的开销达到类人水平的文本评测效果。团队首先从理论层面分析了现有文本评测方法在评测鲁棒性方面的不足来自于评测打分分布不均匀、在得分集成方面的次优表现源自于评测视角多样性的缺失。在此基础上,受人类评测过程中通过样本间比较来建立更加立体全面、视角多样的评测基准启发,类比提出了 BatchEval。与当前最先进的若干方法相比,BatchEval在评测开销与评测效果两方面都取得了显著更优的表现。
论文地址:https://arxiv.org/abs/2401.00437
小红书在 ACL 2024 中提出了 PEEM 方法,其能够通过模型间的互一致性实现对于超越人类水平的大语言模型的准确评测。团队首先分析了当前大语言模型迅猛发展的趋势会加速其在多个方面逐渐达到甚至超越人类水平,在此情况下,人类将难以再提供准确的评测信号。为实现该场景下的能力评测,团队提出了以模型间的互一致性为评测信号的设想,并推导出了在评测样本无穷时,如果存在参考模型与待评测模型间预测分布独立,则与该参考模型间的一致性可以作为模型能力的准确度量。在此基础上,团队提出了基于 EM 算法的 PEEM 方法,实验证实其能够有效缓解现实中上述条件的不充足,从而实现对超越人类水平的大语言模型的准确评测。
论文地址:https://github.com/ypw0102/PEEM
大语言模型(LLMs)在各种推理任务上表现优异,但其黑盒属性和庞大参数量阻碍了它在实践中的广泛应用。特别是在处理复杂的数学问题时,LLMs 有时会产生错误的推理链。传统研究方法仅从正样本中迁移知识,而忽略了那些带有错误答案的合成数据。在 AAAI 2024 上,小红书搜索算法团队提出了一个创新框架,首次提出并验证了负样本在模型蒸馏过程中的价值,构建一个模型专业化框架,除了使用正样本外,还充分利用负样本来提炼 LLM 的知识。该框架包括三个序列化步骤,包括负向协助训练(NAT)、负向校准增强(NCE)和动态自洽性(ASC),涵盖从训练到推理的全阶段过程。一系列广泛的实验,展示了负向数据在 LLM 知识蒸馏中的关键作用。
论文地址:https://arxiv.org/abs/2312.12832
小红书 APP 每天都有大量新笔记产生,如何有效地将这些新内容推荐给感兴趣的用户呢?基于笔记内容的推荐表征是缓解笔记冷启动问题的一种方法,也是众多下游应用的基础。近年来,大语言模型因其强大的泛化性和文本理解能力而备受关注。因此,我们希望利用大语言模型构建笔记内容表征推荐系统,以增强笔记内容的理解。我们从生成增强表征以及多模态内容表征两个角度介绍我们近期的工作。目前该系统已应用于小红书多个业务场景并取得显著收益。
论文地址:https://arxiv.org/abs/2403.01744
直播时间:2024 年 6 月 27 日 19:00-21:30
直播平台:微信视频号【小红书技术REDtech】,B站、抖音、小红书同名账号实时直播。
同时,直播也将在合作伙伴【极市平台】、【机器之心】、【Datawhale】微信视频号同步播出。
欢迎你填写问卷告诉我们,关于大模型你关心的问题,在直播期间与嘉宾深入互动。
扫描👇下方二维码进入直播交流群,将第一时间获取直播链接及开播提醒;可一键打包获取精心整理的【论文 PDF 合集】,还有机会与论文作者直接交流!
小红书社区搜索团队多岗位热招中,团队负责小红书搜索效果的优化和前沿技术的探索,致力于打造中国最大的生活搜索引擎。期待你的加入!
上下滑动查看部分岗位JD,详情可戳“阅读原文”了解更多
微信扫码关注该文公众号作者