Skip to content

Latest commit

 

History

History
329 lines (235 loc) · 12.3 KB

File metadata and controls

329 lines (235 loc) · 12.3 KB

HybridSparse 审稿意见

总体评价

推荐结果:弱拒稿 (Weak Reject)
综合评分:4.5/10

这篇论文提出了HybridSparse,一个结合稀疏检索和密集检索的统一框架。虽然问题有意义,但论文在创新性、实验验证和技术细节方面存在明显不足。


主要优点

  1. 问题定义清晰:准确识别了现有混合检索方法的两大问题——多索引搜索效率低、词汇和语义信号交互不足

  2. 架构设计合理:共享主干+任务特定编码器的设计直观,Figure 1展示清楚

  3. 训练目标完整:联合训练、混合分数正则化、一致性蒸馏提供了多层次的对齐机制

  4. 引用真实可靠:我验证了关键引用,全部真实:

    • SimANS (EMNLP 2022) ✓
    • coCondenser (ACL 2022) ✓
    • SPLADE (SIGIR 2021) ✓
    • MS MARCO Web Search (WWW 2024) ✓
    • OneSparse (WWW 2024) ✓
    • SPANN (NeurIPS 2021) ✓

主要问题

1. 创新性不足,与OneSparse区分不明显(严重)

核心问题:论文严重依赖OneSparse,但没有清楚说明自己的创新点在哪里。

  • 共享主干:这是多任务学习的标准做法,不是新贡献
  • 联合训练(Co-training):就是简单地同时训练两个分支(公式18),这只是标准的多任务学习
  • 混合分数正则化(公式21):直接优化加权和分数,思路直接但不新颖
  • 一致性蒸馏(公式22):用KL散度对齐分布是知识蒸馏的常见做法

关键质疑:OneSparse的用户完全可以用这些损失函数训练他们的模型,为什么需要共享主干?论文必须证明架构整合是必要的,而不仅仅是损失函数的改进。

2. 实验验证薄弱(严重)

缺失的基线模型

  • 没有对比论文引用的UniRetriever [28]、LED [34]等最新混合检索方法
  • 只对比了SPLADE v1,没有对比引用中的SPLADE v2 [6]
  • 没有对比现代密集检索器如Contriever、GTR、E5
  • ANCE (2020) 已经过时

数据集不足

  • 只有2个数据集,都是MS MARCO系列(同源)
  • 没有BEIR基准测试,这是领域外检索评估的标准
  • 没有跨域迁移实验

消融实验局限

  • Table 2只在MSMARCO上测试
  • 各组件的提升很小(如+Reg比+Co-train只提升0.1% MRR)
  • 没有分析模型学到了什么
  • 没有按查询类型或难度分析

统计显著性缺失

  • 没有误差棒、置信区间或显著性检验
  • 提升幅度很小(MSMARCO上0.77% MRR),必须验证统计显著性
  • 应该报告多次运行结果

3. 技术细节不完整(中等)

模型架构缺失

  • 12层BERT如何分割成8+4?是学习的还是人工设计的?
  • MLM head预热后怎么处理?丢弃还是保留?
  • 隐藏维度h是多少?词表大小是多少?

训练细节缺失

  • batch size、学习率、训练轮数?
  • D_q^- 中有多少负样本?hard negatives还是随机采样?
  • 超参数λ_sem、λ_lex、λ_q、λ_d、λ_reg、λ_dis的值?
  • 训练时间和计算成本?

检索细节缺失

  • 公式19中w_sem和w_lex的具体值是多少?
  • 论文401-405行声明"不需要权重调优,直接求和"——这需要验证
  • SPANN使用多少个虚拟词(聚类中心)?

4. 存疑的声明(中等)

声明(401-405行):"HybridSparse不需要调整词汇和语义分数的权重...直接求和即可获得强性能"

问题:这是强声明但没有证据。如果w_sem = w_lex = 1,应该明确说明。应该对比不同权重方案(如w_sem=0.3, w_lex=0.7)。

声明(354-369行):联合训练和混合正则化提升了稀疏和密集检索的"对齐"

问题:没有量化对齐度的测量。应该测量:

  • 稀疏和密集分支检索的top-K候选重叠度
  • s_sem和s_lex分数的相关性
  • 两个分支的排序相关性(如Kendall's τ)

5. 分析和洞察不足(中等)

缺失的分析

  • 定性案例:展示HybridSparse成功/失败的查询案例及原因
  • 词扩展模式:词汇编码器学到了扩展哪些词?与SPLADE有何不同?
  • 语义嵌入质量:密集嵌入与独立模型有何不同?
  • 失败案例:什么时候混合方法反而有害?

有限的解释

  • 为什么一致性蒸馏(+Dis)的recall提升(+1.2%)低于混合正则化(+Reg),但MRR提升(+1.8%)更高?这值得解释
  • Table 2中延迟增加归因于"更长的posting lists",但有多少来自模型,多少来自索引?

6. 写作和呈现问题(轻微)

不清晰之处

  • 210-211行说"查询和文档编码器共享相同结构",但202-203行说"双编码器架构,查询和文档分别处理"——共享权重还是只共享架构?
  • "Co-training"通常指半监督学习,这里只是多任务学习

图表质量

  • Figure 1过于拥挤,优化流程与模型架构重叠
  • Figure 2(页面6)太详细,应移到附录

给作者的问题

  1. 能否提供对照实验:OneSparse使用你的训练损失(L_co, L_reg, L_dis)但不共享主干?这能隔离架构整合vs训练目标的贡献

  2. 不同层分割(6+6, 10+2)的性能如何?8+4是最优的吗?

  3. 能否在BEIR基准上测试以证明域外泛化能力?

  4. w_sem和w_lex的实际值是多少?模型对这些权重有多敏感?

  5. 能否量化测量训练前后稀疏和密集分支的"对齐度"(如候选重叠、分数相关性)?


改进建议

  1. 强化创新性:清楚说明架构整合带来了什么独立模型无法实现的优势

  2. 扩展实验

    • 加入BEIR基准
    • 对比更新的基线(SPLADE v2, Contriever, E5)
    • 报告统计显著性检验
    • 增加MS MARCO以外的数据集
  3. 增加分析

    • 定性案例展示
    • 分支对齐度的量化指标
    • 词扩展分析
    • 按查询类型分解性能
  4. 补全技术细节

    • 完整的超参数设置
    • 训练/推理时间和成本
    • 明确的权重方案

分项评分

维度 评分 说明
创新性 4/10 共享主干和多损失训练是标准技术,相比OneSparse创新有限
质量/严谨性 5/10 实现可靠但评估不完整,缺少统计验证和关键基线
清晰度 6/10 整体写作尚可但有歧义,缺少重要细节
影响力 5/10 问题重要但提升边际,仅限MS MARCO变体
综合评分 4.5/10 弱拒稿

审稿结论

推荐:拒稿(鼓励修改后重投)

论文需要重大修改:

  1. 更清晰的创新性声明和对照消融实验
  2. 全面的实验(BEIR、现代基线、显著性检验)
  3. 更深入的分析
  4. 完整的技术细节
  5. 统计验证

经过这些改进后,这可能成为混合检索文献的可靠贡献。

审稿人信心:高 (4/5)


OpenReview 回复模板

Summary:
This paper proposes HybridSparse, unifying sparse and dense retrieval through shared encoding 
and hybrid optimization. While the problem is relevant, I have significant concerns about 
novelty, experimental rigor, and technical completeness.

Strengths:
- Well-motivated problem addressing hybrid retrieval efficiency and interaction
- Clean architectural design with shared backbone + task-specific encoders
- Multiple alignment mechanisms (co-training, hybrid regularization, consistency distillation)
- Builds on practical OneSparse index for deployment

Major Weaknesses:

1. Limited novelty over OneSparse [3]: Shared backbone + multi-loss training are standard 
   multi-task learning techniques. What prevents OneSparse users from applying your losses 
   without architectural changes? The paper needs controlled ablations isolating architectural 
   integration vs. training objectives.

2. Insufficient experiments: 
   - Missing BEIR benchmark (standard for out-of-domain evaluation)
   - Missing modern baselines: SPLADE v2 (cited but not compared), Contriever, E5
   - Only MS MARCO variants (same source), no diversity
   - No statistical significance tests despite small improvements (0.77-2.2% MRR)
   - Ablations only on MSMARCO, component gains are marginal

3. Incomplete technical details: 
   - Missing hyperparameters (λ values, batch size, learning rate)
   - Lines 401-405 claim no weight tuning needed (w_sem=w_lex=1?), but no validation
   - How is 8+4 layer split determined? Is it optimal?
   - Training time and cost?

4. Weak analysis: 
   - No quantitative alignment metrics (candidate overlap, score correlation)
   - No qualitative examples showing when/why HybridSparse helps
   - No term expansion analysis vs SPLADE
   - Why does +Dis give lower recall but higher MRR than +Reg? (Table 2)

Questions:
- Can you ablate OneSparse + your losses WITHOUT shared backbone?
- What are actual w_sem, w_lex values used in experiments?
- Can you report BEIR results and statistical significance?
- How sensitive is the model to layer split and weight choices?

Recommendation: Reject (revise and resubmit)
The paper needs major revisions: clearer novelty claims with controlled ablations, 
comprehensive experiments (BEIR, modern baselines, significance tests), deeper analysis, 
and complete technical details.

Score: 4.5/10 (Weak Reject)
Confidence: 4/5 (High)

详细评分依据

创新性 (4/10)

  • 不足:共享编码器、多任务学习、KL散度对齐都是已有技术
  • 问题:未能清楚区分与OneSparse的本质差异
  • 需要:证明架构整合是必要的,不仅仅是损失函数的组合

实验质量 (5/10)

  • 不足:缺少BEIR、现代基线、统计检验
  • 问题:只有MS MARCO变体,提升幅度小且未验证显著性
  • 需要:多样化数据集、显著性检验、更强的基线对比

技术完整性 (5/10)

  • 不足:超参数、权重值、训练成本等关键细节缺失
  • 问题:401-405行的强声明(不需要权重调优)缺乏验证
  • 需要:完整的实现细节,可复现的配置

分析深度 (4/10)

  • 不足:没有定性案例、对齐度量化、词扩展分析
  • 问题:消融实验结果的反直觉现象未解释
  • 需要:深入分析模型学到了什么、为什么有效

影响力潜力 (5/10)

  • 优点:混合检索是重要问题
  • 问题:提升边际(0.77-2.2%),且仅在同源数据集上验证
  • 需要:证明在更广泛场景下的有效性

引用验证结果

所有关键引用均已验证为真实文献:

  1. SimANS [37]: Simple Ambiguous Negatives Sampling for Dense Text Retrieval

  2. coCondenser [9]: Unsupervised Corpus Aware Language Model Pre-training

  3. SPLADE [6,7]: Sparse Lexical and Expansion Model

  4. MS MARCO Web Search [2]: Large-scale Information-rich Web Dataset

  5. OneSparse [3]: Unified System for Multi-index Vector Search

  6. SPANN [1]: Highly-efficient Billion-scale Approximate Nearest Neighbor Search

结论:引用可靠,没有虚假引用问题。


最终建议

这篇论文解决了一个有意义的问题,但需要大幅改进才能达到发表标准:

必须改进(拒稿理由):

  1. 与OneSparse的创新性区分不清
  2. 实验不够全面(缺BEIR、现代基线、统计检验)
  3. 技术细节不完整

建议改进(提升质量): 4. 增加深入分析和定性案例 5. 量化测量"对齐度"的提升 6. 完善写作和图表质量

时间估计:需要3-6个月的额外工作来补充实验和分析。

重投建议:建议作者充分修改后投稿到信息检索相关会议(SIGIR, WSDM, CIKM)或期刊(TOIS, IR Journal)。