袁康 · 视频密集描述(Dense Captioning) · ky.toimc.cn

研究生 · 数据周期 2025-11 ~ 2026-09 · 更新至 2026-09-19
10 个月从零跑通论文全链路:第一篇 Pattern Recognition(一区)返修等二审,第二篇创新点已成形——进入连续产出节奏。

当前状态

截至 2026-09-19
  • PR 返修二审中(一般较快)
  • 第二篇创新点实验启动(一对多辅助分支 + FFN 轻量模块)
  • 注意力分布统计进行中

问题与卡点

现在卡在哪
  • DN 方向去留未决——底层设计修正后整体反而不如 baseline
  • 第二篇创新点属 DETR 系已知技术路线,须做出差异化 + 扎实对比,否则审稿风险高
  • PR 二审结果未定,需要备好快速调整的 Plan B

下一步

行动项
  • 按类别切分统计高低分分布,验证长尾假设
  • 第二篇(一对多辅助分支)实验落地
  • 细粒度评价指标方案(三人共同任务,暂无回执)

朱老师评价与指导要点

按时间序 · 远程组会指导记录

关键节点

绿 = 有效 · 蓝 = 论文 · 红 = 证伪 · 紫 = 指导
2026-03 ~ 04
探索起步,收敛主线
毫米波雷达距离修正有效(ATE 显著降)、速度优化多线试错后,收敛回视频描述主线。
2026-04
query 拆分确立主线有效
GT 直接放入初始化提升大;定位/描述 query 拆分后 recall 提升——此后 6 个月围绕 query 机制持续深挖。
2026-05
CG 概念引导器有效有效
PDVC 上 +1 点、两个数据集均有效(同期 CTC 对齐证伪无效)。
2026-06
DN 实验与保底策略
DN 训练+验证都操作时明显提升,但准确率↑召回率显著↓(证伪线);确定论文保底三主干:分类损失 + 解耦架构 + 辅助损失。
2026-07
三工作整合成文投出论文
分类损失 + 结构损失合用优于单独使用;定位质量分类损失 Recall 24.2→27.8、Precision +1~2。
2026-09
PR 返修提交、等二审论文
一审两小修一大修(补参数量对比/空域调制实验/换数据集),修订已提交。
2026-09
低分归因 + 第二篇成形
逐个分析最好/最差各 20 视频:低分集中在训练集低频「模板话术」类别(与句长/时长无关);第二篇创新点针对 DETR 一对一匹配正样本过少。

结果盘点

绿 = 确认有效 · 红 = 证伪排除(同样有价值)

✓ 确认有效

  • location/caption query 拆分:recall 提升
  • CG 概念引导器:+1 点(双数据集)
  • 定位质量分类损失:Recall +3.6 / Precision +1~2
  • 分类损失 + 结构损失合用优于单独使用

✕ 证伪排除

  • CTC 对齐无提升
  • DDVC 核心机制判无效
  • DN 机制精度-召回失衡
  • 概念区分性权重无提升
袁康研究生
视频密集描述(Dense Captioning)
PR 一区·等二审CG 引导器 +1 点Recall +3.6
本站内容整理自组会记录(2025-11 ~ 2026-09),发布前已脱敏:个人去向与单位信息、个人事务、联系方式均已去除,仅保留学习与科研进展。