本科即进组科研:视频描述起步、入学前投出 IAAI;2026-06 转线 3D 感知打出「虚拟相机」主线两连有效,09 月按导师建议再并行 VLM 大模型方向——当前两线并行,最大卡点 = 算力(LoRA 微调显存不够)。
- IAAI 等结果(10 月底 notification)
- 高斯合成 + 新视角特征注入收尾
- VLM 复现 + 显式依赖改进推进
- plugin 多模型迁移验证(算力受限)
- 算力瓶颈:VLM 微调显存不够(原论文 4×H100 量级)、多模型验证跑得慢——卡数待报给您
- 两线并行(虚拟相机主线 × VLM 新线)收敛待观察,精力分配是现实问题
- 可视化效果不佳——您 0919 定位「讲清为什么有效」,方案还在找
- 研一课业重(16 节/周)与科研时间冲突
- 报具体卡数(微调显存不够)
- 特征注入实验做完 + plugin 多模型验证
- 沿大模型方向推进
- caption 指标梳理 + 消融补齐(遗留项)
朱老师评价与指导要点
按时间序 · 远程组会指导记录
- 06:经典架构细节要把握住——『现在很多工作都是在这上面缝缝补补』
- 06~07:连续追问视野 cover → 逼出『删重叠视角』关键发现;要求先验证基本思路、再包装成架构创新
- 07:主线点破——虚拟相机增益来源 = 原采样遗漏信息,从 trick 升维为方法论创新
- 09:显式依赖改进与 anchor/DETR 共享 reference 同构——可试但优先级别放高、效果大概率有限;定位污染描述需消融
- 09:建议『往大模型上走』+ 尽快向何老师报算力需求
关键节点
绿 = 有效 · 蓝 = 论文 · 红 = 证伪 · 紫 = 指导
2026-03 ~ 05视频描述起步
动态阈值/动态窗口方向合理但实现太简单 → 扩展到时序;GT 辅助 query(位置 + 文本特征编码)P/R +0.05;并行生成定位与描述调研。
2026-06视频描述论文定稿投 IAAI论文
10 页双栏定稿(本科期间完成);经典架构精读 3 篇拆到 query 初始化/decoder 输出/权重共享级别。
2026-06 下★ 转线 3D 感知
接手组内流转的高斯/9V 数据集线;9 相机配置分析发现前置 5 台重叠较多。
2026-07删重叠视角 + 虚拟相机两连有效有效
删 2 个重叠深度相机后 MVP 不降反升(省计算量);前 3 视角拼接投影 > 单视角投影;高斯特征注入 > 直接合成、略好于 baseline(NDS +1 点多)。
2026-07主线升维指导
导师点破:增益来源 = 原采样过程遗漏信息——从 trick 升维为可发表的问题定义,把前处理移到特征层、嵌进架构内部。
2026-09★ 再并行 VLM 大模型线
按导师「往大模型上走」建议:复现 VLM 视频定位问答(两次定位互相监督 + 偏好优化,3.8B LoRA 微调,原论文 4×H100);自有改进——定位→描述显式依赖(统一 reference + 门控注入),初步描述指标升。
2026-09plugin 方案多模型验证
「只增训练不增推理」的 plugin/adapter 方案在多模型上做迁移验证(算力受限、跑得慢)。
结果盘点
绿 = 确认有效 · 红 = 证伪排除(同样有价值)
✓ 确认有效
- 高斯分支特征:NDS +1 点多
- 拼接投影 > 单视角;特征注入 > 直接合成
- 删重叠深度相机:不降反升
- 显式依赖改进:描述指标升(初步,待消融)
白彤研究生 · 研一视频描述起步 → 3D 感知(虚拟相机主线)→ 再并行 VLM 大模型线
IAAI 在投NDS +1 点多删 2 视角不掉点微调显存不够
本站内容整理自组会记录(2025-11 ~ 2026-09),发布前已脱敏:个人去向与单位信息、个人事务、联系方式均已去除,仅保留学习与科研进展。