文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载本文基于 awesome-generative-ai-guide 仓库research_updates/2024_papers/december_list.md的 2024 年 12 月论文清单整理而成。该清单是仓库Understand 301「前沿情报源」见 journeys/understand.md月度论文 feed 的 2024 年存档部分记录了当月 36 篇最具代表性的应用型 AI 论文。阅读本文后你将系统掌握 2024 年末生成式 AI 的核心战场多模态大模型MLLM/VLM的推理与对齐、LLM Agent 的安全评估、RAG 与检索增强、KV 缓存压缩、合成数据与微调鲁棒性、视频生成与长期交互系统以及这些工作之间的技术关联。归档说明与阅读入口原文档顶部带有明确标注该清单为 2024 年版存档内容反映写作当时的领域状态仅作参考保留如需当前资料请查看仓库索引。当前仓库的月度论文 feed 仍在持续更新2026 年月度清单现行research_updates/2026_papers/1 月至 6 月2025 年全年清单research_updates/2025_papers/1 月至 12 月2024 年存档research_updates/2024_papers/11 个月度清单本文为其中 12 月部分另有持续维护的活页研究表格RAG 研究表格、AI 评估 2025 表格、Agentic 搜索与检索表格以及年度报告 State of AI 2025 Report在仓库的 survey_papers.md 中还可找到各主题的综述论文导航适合先建立知识地图再深入单篇。2024 年 12 月的清单横跨 11 月末至 12 月末按主题可归纳为以下几大技术方向下文逐一展开。一、多模态大模型MLLM/VLM推理、效率与长期交互12 月清单中多模态方向论文数量最多覆盖从视觉任务对齐、视频理解、效率压缩到长期流式交互的完整链条。1.1 任务偏好优化TPO让 MLLM 学会细粒度视觉任务论文Task Preference OptimizationTPO12 月 26 日直面一个核心矛盾当前多模态大模型MLLM在广谱视觉应用中有全面的感知与推理能力但在细粒度、精确的视觉理解上表现挣扎。已有的研究路线要么让模型使用外部工具要么把特定视觉任务统一进自回归框架却常常以牺牲整体多模态性能为代价。TPO 的解法是引入可微分的任务偏好differentiable task preferences从典型细粒度视觉任务中导出同时引入可学习任务 token在多任务专用头与 MLLM 之间建立连接。训练时利用丰富的视觉标注通过**多任务协同训练multi-task co-training**获得协同增益——单个任务的表现甚至能超越单任务训练的版本。作者用 VideoChat 与 LLaVA 实例化该方法整体多模态性能相对基线提升14.6%且在零样本场景下可与有监督 SOTA 模型相当。1.2 Video-Panda无编码器的视频语言模型论文Video-Panda12 月 24 日针对视频语言模型的效率瓶颈传统方案依赖 3 亿到 11 亿参数的重型图像编码器或 10 亿到 14 亿参数的视频编码器处理多帧视频时计算负担巨大。Video-Panda 提出Spatio-Temporal Alignment BlockSTAB无需预训练编码器即可直接处理视频输入视觉处理仅用4500 万参数相较传统方案至少缩减6.5 倍。STAB 组合了局部时空编码细粒度特征提取、基于学习的注意力空间下采样以及分别建模帧级与视频级关系的机制。在开放式视频问答基准上与基于编码器的方法持平或更优并在细粒度视频问答评估中于正确性、时间理解等关键维度超过 Video-ChatGPT 与 Video-LLaVA消融实验验证了架构选择处理速度比此前方法快3-4 倍。1.3 Mulberry用集体蒙特卡洛树搜索赋予 MLLM o1 式推理与反思论文Mulberry12 月 24 日提出Collective Monte Carlo Tree SearchCoMCTS把「集体学习」引入树搜索让 MLLM 学会逐步构造推理直至最终答案。CoMCTS 的核心是借助多个模型的集体知识通过四步迭代操作协同推测、搜索并识别通向正确答案的有效推理路径Expansion扩展Simulation and Error Positioning模拟与错误定位Backpropagation反向传播Selection选择基于 CoMCTS 构造出Mulberry-260k多模态数据集——每个问题对应一棵包含丰富、显式、良定义推理节点的推理树随后进行集体 SFT 训练出 Mulberry 系列模型使其具备 o1 式的逐步推理与反思能力。1.4 Apollo视频理解机制的深度剖析与规模化结论论文Apollo12 月 13 日是一份少见的「机制研究」型工作视频感知能力已被快速集成进大规模多模态模型LMM但其底层驱动机制却很少被理解导致大量设计决策缺乏依据。作者系统审查了视频 LMM 高计算开销的主要来源发现Scaling Consistency在小模型和小数据集到临界规模为止上做出的设计与训练决策可以有效迁移到更大模型。借助这一洞察他们系统探索了视频采样、架构、数据构成、训练计划等维度例如证明训练时 fps 采样显著优于均匀帧采样并明确了哪些视觉编码器最适合视频表示。据此推出的 Apollo 系列在长视频感知上表现突出Apollo-3B 以55.1 分LongVideoBench超越大多数 7B 模型Apollo-7B 在 MLVU 上达70.9、Video-MME 上达63.3为同尺寸 7B LMM 中的 SOTA。1.5 InternVL 2.5开源 MLLM 突破 MMMU 70%论文InternVL 2.512 月 6 日在 InternVL 2.0 基础上保留核心架构重点升级训练/测试策略与数据质量系统探究了视觉编码器、语言模型、数据集规模与测试时配置的性能趋势。其关键里程碑是首个在 MMMU 基准上突破 70% 的开源 MLLM——通过 Chain-of-ThoughtCoT推理获得 3.7 个百分点的提升展现了测试时扩展test-time scaling的潜力并在多学科推理、文档理解、多图/视频理解、多语言等广泛基准上比肩 GPT-4o 与 Claude-3.5-Sonnet 等商业模型。1.6 InternLM-XComposer2.5-OmniLive解耦流式感知、记忆与推理论文InternLM-XComposer2.5-OmniLiveIXC2.5-OL12 月 12 日指出当前 MLLM 受序列到序列架构限制无法「边感知边思考」且依赖长上下文存储历史在长期交互中成本过高。该工作借鉴Specialized Generalist AI思想将系统解耦为三个模块流式感知模块实时处理多模态信息将关键细节存入记忆并在收到用户查询时触发推理多模态长期记忆模块整合短期与长期记忆把短期记忆压缩为长期记忆以支持高效检索与更高准确率推理模块响应查询并执行推理与感知、记忆模块协同。整体模拟人类认知使 MLLM 能随时间提供持续、自适应的服务。1.7 PaliGemma 2面向迁移的通用 VLM 家族论文PaliGemma 212 月 4 日是 PaliGemma 的升级版将 SigLIP-So400m 视觉编码器与 Gemma 2 全系语言模型2B 到 27B组合在224px / 448px / 896px三种分辨率下分多阶段训练为下游微调迁移储备广泛知识。该家族覆盖不同模型尺寸与分辨率使研究者得以考察影响迁移性能的因素如学习率并分析任务类型、模型大小与分辨率之间的相互作用。迁移任务范围显著扩大新增了表格结构识别、分子结构识别、乐谱识别、长细粒度描述与放射学报告生成等 OCR 相关任务并在这些任务上取得 SOTA。1.8 NVILA高效前沿视觉语言模型论文NVILA12 月 5 日指出 VLM 的精度进步远大于效率进步。其核心思路是scale-then-compress先扩展后压缩先提升空间与时间分辨率再压缩视觉 token从而高效处理高分辨率图像与长视频。全生命周期训练、微调、部署的效率提升显著训练成本降低4.5 倍、微调显存占用降低3.4 倍、预填充延迟降低1.6-2.2 倍、解码延迟降低1.2-2.8 倍同时精度不输众多领先的开源与闭源 VLM。1.9 VisionZip视觉 token 冗余压缩论文VisionZip12 月 5 日观察到 CLIP、SigLIP 等流行视觉编码器产生的视觉 token 存在显著冗余而增加视觉 token 长度会大幅抬高计算成本。VisionZip 通过选择一组信息量高的 token 输入语言模型在保持性能的同时降低冗余、提升效率且适用于图像/视频理解任务与真实多轮对话场景。实验显示其相对此前 SOTA 方法在几乎所有设置上取得至少5%的性能提升并将预填充时间改善8 倍——使 LLaVA-Next 13B 模型比 7B 模型推理更快且结果更好。作者还分析了冗余成因呼吁社区聚焦提取更好的视觉特征而非单纯拉长 token。1.10 Maya多语言多模态模型的低资源语言与文化适配论文Maya12 月 10 日针对 VLM 在低资源语言与文化语境上的明显短板。当前 VLM 主要服务高资源语言缺乏高质量、多样化且经过安全审查的多语数据导致在低资源语言上理解欠佳且难以规避毒性内容。Maya 的贡献有三基于 LLaVA 预训练数据构建八种语言的多语图文预训练数据集对 LLaVA 数据集进行毒性分析并产出八语言的无毒版本训练支持这八种语言的多语图文模型增强视觉语言任务中的文化与语言理解。1.11 面向多模态智能的 Next Token Prediction 综述综述Next Token Prediction Towards Multimodal Intelligence12 月 16 日指出NTP下一 token 预测已从 NLP 演化为跨模态的通用训练目标。该综述提出统一理解与生成的分类体系覆盖五大方面多模态 tokenization、MMNTP 模型架构、统一任务表示、数据集与评估、开放挑战并维护了持续更新的论文与仓库合集。1.12 个性化多模态大模型综述综述Personalized Multimodal Large Language Models: A Survey12 月 3 日提出按架构、训练方法与应用对个性化 MLLM 技术进行分类的直觉化分类体系讨论各技术的组合/适配方式、现有研究中已探索的个性化任务与常用评估指标并汇总了可用于基准测试的数据集最后列出关键开放挑战。1.13 BigDocs开放许可的多模态文档与代码训练集论文BigDocs12 月 5 日指出多模态 AI 在文档理解与长结构化代码生成上潜力巨大但受限于训练数据访问与限制性许可。该工作发布BigDocs-7.5M——包含 30 个任务、750 万条多模态文档的高质量开放数据集并配套BigDocs-Bench基准10 个新任务涉及 GUI 推理与从图像生成代码。实验表明在 BigDocs 上训练可将文档推理与结构化输出任务如 Screenshot2HTML、Image2Latex的平均性能较闭源 GPT-4o 提升最高25.8%人类评估也倾向选择基于 BigDocs 训练的模型输出。二、大语言模型预训练与后训练数据、规模与配方的技术报告12 月集中出现了多份重量级技术报告共同主题是数据质量与训练配方对能力上限的决定性作用。2.1 YuLan-Mini1.08T token 训练的高效基座模型论文YuLan-Mini12 月 23 日是 2.42B 参数基座模型的技术报告在同等参数规模中达到一流水平。预训练策略聚焦三个技术贡献数据管道数据清洗与数据调度策略结合、鲁棒优化方法缓解训练不稳定、有效退火annealing方法定向数据选择与长上下文训练。仅用 1.08T token 即取得与需要显著更多数据的行业领先模型相当的性能并完整公开各训练阶段的数据构成以支持复现。2.2 Qwen2.5 技术报告18T token 与多阶段后训练论文Qwen2.5 Technical Report12 月 19 日介绍 Qwen2.5 系列预训练数据从上一代 7T token 扩展到18T token为常识、专家知识与推理能力打下基础后训练采用超过 100 万样本的监督微调与多阶段强化学习改善人类偏好显著提升长文本生成、结构化数据分析与指令跟随。开放权重覆盖基座与指令微调版本含量化版闭源 MoE 变体 Qwen2.5-Turbo 与 Qwen2.5-Plus 对标 GPT-4o-mini 与 GPT-4o 的成本效益。旗舰开放权重 Qwen2.5-72B-Instruct 在多种基准上优于多个开源与闭源模型并与其大约 5 倍大小的 Llama-3-405B-Instruct 竞争。Qwen2.5 还作为底座支撑了 Qwen2.5-Math、Qwen2.5-Coder、QwQ 与多模态模型等专用模型。2.3 Phi-4以数据质量为中心的 14B 模型论文Phi-4 Technical Report12 月 12 日描述 14B 参数模型训练配方核心是数据质量。与多数基于网络内容等有机数据的预训练不同Phi-4 在整个训练过程中策略性地融入合成数据。此前 Phi 家族模型大多蒸馏教师模型GPT-4能力而 Phi-4 在 STEM 聚焦的 QA 能力上显著超越其教师模型证明其数据生成与后训练技术已超越蒸馏在架构几乎未变的情况下凭借数据、训练课程与后训练创新在推理型基准上取得相对其规模而言很强的性能。2.4 Yi-Lightning 技术报告MoE、安全引擎与基准反思论文Yi-Lightning Technical Report12 月 2 日介绍旗舰 LLM在 Chatbot Arena 综合排名第 6中文、数学、编码、硬提示等细分类别位列第 2-4。技术要点包括增强的MoE 架构先进专家分割与路由机制、优化 KV 缓存、覆盖预训练/SFT/RLHF 的多阶段训练策略、合成数据构造与奖励建模以及RAISEResponsible AI Safety Engine四组件安全框架覆盖预训练、后训练与推理阶段。该报告还观察到一个重要现象传统静态基准与真实世界动态人类偏好之间存在显著差距促使业界反思常规基准在指导模型开发上的效用。三、推理、对齐与多智能体训练3.1 AR-MCTS主动检索驱动的渐进式多模态推理论文AR-MCTS12 月 19 日面向多步多模态推理难题提出通用框架先构建统一检索模块从混合模态检索语料库中检索支撑复杂推理问题的关键洞察再用MCTS 主动检索Active Retrieval自动生成逐步标注为每个推理步骤动态检索关键洞察突破传统 beam search 采样的局限以提升推理空间的多样性与可靠性并引入渐进对齐的**过程奖励模型process reward model**支持多模态推理的自动验证。在三个复杂多模态推理基准上验证了框架的有效性。3.2 G-Passk 与 LiveMathBench稳定推理能力的度量论文Are Your LLMs Capable of Stable Reasoning?12 月 17 日指出基准成绩与现实应用之间存在显著差距根源在于现有评估协议与指标未能捕捉复杂推理中「既准确又一致」的双重要求。该工作贡献两点G-Passk新评估指标跨多次采样对模型性能进行连续评估同时量化峰值能力与稳定性LiveMathBench动态基准包含具有挑战性的当代数学问题以最小化评估时的数据泄漏风险。实验揭示 LLM「真实场景」推理能力仍有很大提升空间。3.3 cDPO关键 token 的 token 级对比估计论文Critical Tokens Matter11 月 29 日识别出导致 LLM 推理轨迹出错的critical tokens关键 token当强制模型解码其他 token 而非这些关键 token 时往往能得到正面结果。作者提出cDPO通过对比估计自动识别关键 token比较正/负模型在推理轨迹上的生成似然并将传统 DPO 扩展为 token 级 DPO用正负模型差分似然作为 token 级 DPO 学习的权重。在 GSM8K 与 MATH500 上以 Llama-38B/70B与 deepseek-math7B验证了有效性。3.4 o1-Coder面向编码任务的 o1 复现论文o1-Coder11 月 29 日尝试以编码任务为焦点复现 OpenAI o1整合**强化学习RL**与MCTS增强 System-2 思考训练测试用例生成器TCG做标准化代码测试用 MCTS 生成带推理过程的代码数据迭代微调策略模型先产出伪代码再生成完整代码。报告还讨论了 o1 类模型在真实应用部署中的机遇与挑战提出向 System-2 范式过渡并强调世界模型构建的必要性。3.5 MALT多智能体 LLM 联合训练论文MALT12 月 2 日迈出「多智能体 LLM 训练」的第一步采用顺序多智能体设置异构 LLM 扮演专业化角色——生成器、验证器、精炼模型迭代求解问题。方法包含基于轨迹扩展的合成数据生成流程以及由联合结果奖励驱动的信用分配策略使后训练能同时利用正负轨迹自主提升各模型的专长。在 MATH、GSM8k、CQA 上Llama 3.1 8B 基座分别取得14.14%、7.12%、9.40%的相对提升。四、LLM Agent安全评估与真实世界任务基准Agent 是 12 月的另一大焦点出现了两个重量级评估基准。4.1 Agent-SafetyBench349 个交互环境、2000 个测试用例的 Agent 安全基准论文Agent-SafetyBench12 月 19 日指出LLM 部署为 Agent 后与交互环境及工具的结合引入了超出模型本身的新型安全挑战但此前缺乏全面基准。该基准包含349 个交互环境、2000 个测试用例评估8 类安全风险、覆盖不安全交互中常见的10 种失败模式。对 16 个流行 LLM Agent 的评估结果令人警醒没有任何一个 Agent 的安全得分超过 60%。定量分析归纳出当前 LLM Agent 的两类根本缺陷缺乏鲁棒性与缺乏风险意识同时发现仅靠防御提示defense prompts不足以解决这些安全问题需要更先进、更鲁棒的策略。4.2 TheAgentCompany模拟软件公司环境的数字员工基准论文TheAgentCompany12 月 18 日测量 LLM Agent 在真实专业任务上的表现构建了一个自包含环境内含模拟小型软件公司场景的内部网站与数据创建多种公司员工可能执行的任务Agent 以数字员工的方式与之交互——浏览网页、编写代码、运行程序、与同事沟通。基准测试闭源 API 与开放权重模型驱动的基线 Agent 后发现最强的 Agent 也只能自主完成 24% 的任务。这为任务自动化描绘了一幅细致图景在模拟真实工作场所中较简单的任务可被自主解决而更困难的长程任务仍超出当前系统能力。4.3 Large Action Models从 LAM 设想到实现的系统化框架论文Large Action Models12 月 13 日提出从 LLM擅长生成文本响应向LAM大行动模型面向动态环境中的行动生成与执行过渡的系统化框架。文章以Windows OS 上的 Agent为案例逐步讲解 LAM 开发的关键阶段数据收集、模型训练、环境集成、grounding、评估这套可泛化工作流可视为各应用领域构建可用 LAM 的蓝图并讨论了当前局限与未来研究/工业部署方向。4.4 Evaluation Agent视觉生成模型的提示式高效评估论文Evaluation Agent12 月 10 日瞄准视觉生成模型评估的计算痛点传统方法常需采样成百上千张图像/视频对扩散模型尤其昂贵且刚性流水线忽视具体用户需求、只给数值结果不给解释。该框架模仿人类观察少量样本即可形成印象的策略采用高效、动态、多轮评估每轮仅少量样本提供用户定制的详细分析具备四大优势效率、可提示定制、超越单一数值的可解释性、跨模型与工具的可扩展性。实验显示其评估耗时仅为传统方法的10%而结果相当。五、RAG、检索增强与长上下文效率5.1 OmniEval金融领域的全方位自动 RAG 评估基准论文OmniEval12 月 17 日构建金融领域全方位、自动化的 RAG 基准核心特色矩阵式 RAG 场景评估体系将查询划分为 5 类任务 × 16 个金融主题形成结构化评估矩阵多维度评估数据生成GPT-4 自动生成 人工标注结合生成实例的人类评估接受率达87.47%多阶段评估体系同时评估检索与生成性能覆盖 RAG 流水线整体鲁棒评估指标规则型与 LLM 型指标结合通过人工标注与 LLM 评估器的监督微调提升可靠性。实验揭示了 RAG 系统在不同主题与任务间的性能差异表明垂直领域 RAG 模型仍有显著提升空间。5.2 RetroLLM生成过程中检索细粒度证据论文RetroLLM12 月 16 日针对现有 RAG 的三大局限单独检索器的额外部署成本、检索文本块带来的冗余输入 token、检索与生成缺乏联合优化。RetroLLM 将检索与生成整合进单一连贯流程让 LLM 通过受约束解码直接从语料库生成细粒度证据。为缓解证据生成中的错误剪枝引入两项机制层级 FM-Index 约束先生成语料约束线索以定位相关文档子集缩小无关解码空间与前向受约束解码策略考虑未来序列相关性以提升证据准确率。在五个开放域 QA 数据集上于域内与域外任务均表现优异。5.3 SCOPE预填充与解码阶段分离的 KV 缓存压缩论文SCOPE12 月 18 日指出 KV 缓存已成为长上下文生成的瓶颈而解码阶段的优化长期被忽视。作者基于两个观察论证其关键性预填充阶段的过度压缩需特定完整上下文会损害推理任务理解长输出推理任务中会出现 heavy hitters 偏移。SCOPE 采用简单高效的分阶段优化预填充阶段保留KV 缓存以维持必要信息解码阶段用基于滑动的策略选择关键 heavy hitters并通过自适应与不连续策略进一步优化内存使用与内存传输。在 LongGenBench 上验证了有效性、泛化性以及作为插件兼容其他仅预填充的 KV 压缩方法。5.4 ModernBERT现代双向编码器论文ModernBERT12 月 18 日为编码器模型如 BERT引入现代优化代表对旧编码器的一次重大 Pareto 改进在2 万亿 token上训练原生8192 序列长度在涵盖分类任务与单/多向量检索含代码域的大量评估上取得 SOTA同时是速度与内存效率最高的编码器专为常见 GPU 推理设计。对仓库读者而言这是 RAG 检索侧与文本分类管线的重要候选模型。六、监督微调的鲁棒性与合成数据6.1 RobustFT噪声响应下的鲁棒监督微调论文RobustFT12 月 19 日指出实际收集的微调数据不可避免地含噪声对下游任务性能构成显著挑战。RobustFT 框架对下游任务数据执行噪声检测与重标注噪声识别阶段采用多专家协作系统配合推理增强模型去噪阶段使用上下文增强策略融入最相关且最可信的知识并谨慎评估后生成可靠标注另引入基于响应熵的数据选择机制只保留高质量样本用于微调。在多个 LLM × 五个数据集上验证了噪声场景下的卓越表现。6.2 AgoraBench统一评估 LLM 作为合成数据生成器论文Evaluating Language Models as Synthetic Data Generators12 月 4 日指出后训练中合成数据的使用日益普遍LM 生成高质量数据的能力已几乎与其直接解题能力同等重要。AgoraBench 提供标准化设置与指标用 6 个 LM 合成126 万条训练实例并训练 99 个学生模型揭示关键洞察不同 LM 有各自优势如 GPT-4o 擅长生成新问题Claude-3.5-Sonnet 更擅长增强现有问题数据生成能力与解题能力并不必然相关而响应质量、困惑度、指令难度等多重数据内在特征共同构成更优指标输出格式的策略选择与成本意识模型选择显著影响生成效果。6.3 合成数据的质量、多样性与复杂度QDC效应论文Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data12 月 4 日提出按**数据质量Quality、多样性Diversity、复杂度Complexity**评估合成数据算法质量对域内泛化至关重要多样性对域外泛化至关重要复杂度对两者都有益。研究强调训练数据中存在Quality-Diversity 权衡及其对下游模型的影响并将合成数据流水线的组件与 QDC 构成联系起来讨论在合成数据中平衡 QDC 对高效强化学习与自改进算法的重要性——许多模型目前只按输出质量评估与优化从而限制了输出多样性及自改进潜力。6.4 CodeArena 与 SynCode-Instruct代码 LLM 的人类偏好对齐论文Evaluating and Aligning CodeLLMs on Human Preference12 月 6 日指出当前代码基准只关注合成正确代码片段忽略了人类偏好对齐查询应来自真实应用场景响应应满足人类偏好。该工作发布人工精选基准CodeArena397 个高质量样本覆盖 40 类、44 种编程语言源自真实用户查询以及近200 亿 token的合成指令语料SynCode-Instruct。Qwen2.5-SynCoder 完全基于合成指令数据训练即达开源代码 LLM 顶尖水平对 40 LLM 的系统实验揭示开源 SOTA 代码 LLM如 Qwen2.5-Coder与专有模型如 OpenAI o1之间的显著差距凸显人类偏好对齐的重要性。七、视频生成多镜头叙事与开源大视频模型7.1 VideoGen-of-Thought多镜头视频生成的协作框架论文VideoGen-of-ThoughtVGoT12 月 3 日针对现有视频生成模型难以维持跨镜头的逻辑剧情与视觉一致性的问题提出无需训练的协作架构将视频生成拆分为模块化序列脚本生成把简短故事转为每个镜头的详细提示关键帧生成创建忠于角色刻画且视觉一致的关键帧镜头级视频生成将脚本与关键帧信息转化为镜头平滑机制确保多镜头输出的一致性。叙事设计受电影编剧启发提示生成覆盖五个关键域保证跨视频的逻辑一致性、角色发展与会话流利用从叙事中自动生成的身份保持IP嵌入确保跨镜头的时间与身份一致性并引入跨镜头平滑机制reset boundary 整合相邻镜头潜在特征实现平滑过渡。7.2 Open-Sora Plan开源大视频生成模型论文Open-Sora Plan11 月 28 日旨在构建基于多种用户输入生成高分辨率、长时长视频的开源大生成模型组件包括Wavelet-Flow 变分自编码器、联合图像-视频稀疏去噪器及多种条件控制器并设计了面向高效训练/推理的辅助策略与多维数据策展流水线在定性与定量评估中都取得亮眼结果全部代码与模型权重公开。八、主题脉络小结12 月清单反映的领域趋势把 36 篇论文放在一起可以清晰看到 2024 年末生成式 AI 的几个结构性问题与解法取向主题脉络代表论文核心信号MLLM 能力提升TPO、Mulberry、InternVL 2.5视觉任务对齐、树搜索推理、测试时扩展是三大杠杆MLLM 效率Video-Panda、NVILA、VisionZip「去掉冗余」成为共识去编码器、压缩视觉 token、scale-then-compress长期交互与记忆IXC2.5-OL、Apollo从单轮理解走向流式感知 长记忆 解耦推理Agent 安全与真实任务Agent-SafetyBench、TheAgentCompany安全得分普遍低于 60%、最强 Agent 仅自主完成 24% 任务——安全与长程执行仍是硬瓶颈RAG 与长上下文OmniEval、RetroLLM、SCOPE评估自动化、检索生成一体化、KV 缓存分阶段优化数据与对齐RobustFT、AgoraBench、QDC、CodeArena数据质量/多样性/复杂度是能力上限的隐藏变量对仓库读者而言这份存档的价值在于三点一是作为 Understand 301 前沿情报源 的历史对照便于追踪同一主题如 MCTS 推理、Agent 安全、视觉 token 压缩在 2025-2026 年清单中的后续演化二是与仓库的 AI 评估 2025 表格、Agentic 搜索与检索表格 等活页表格互为补充三是为面试与系统设计见 interview_prep提供一手论文证据例如评估方法论对应 AI Evals for Everyone 课程中的 benchmark 与产品评估区分Agent 安全与长程任务则与 Agentic AI Crash Course 中的多智能体、记忆与规划概念相互印证。注本文所有论文信息均摘自仓库存档文档 december_list.md 中的日期、标题与摘要未作任何性能数据或结论的增补推断各工作涉及的开放代码、模型与数据集详情以论文原文为准。赞分享文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载相关推荐Argilla 向量rg.Vector完全指南为记录添加向量、实现相似性检索Argilla 向量 rg.Vector 完全指南为记录添加向量、实现相似性检索 导读 本文围绕 Argilla Python SDK 中 rg.Vec文档教程人工智能大模型NemoClaw 贡献工作流指南根因兄弟路径检查与敏感工作流状态矩阵NemoClaw 贡献工作流指南根因兄弟路径检查与敏感工作流状态矩阵 本篇指南系统讲解 NemoClaw 仓库 Agent 技能体系中的共享方法论文档 .ag文档教程人工智能大模型生成式AI批量推理awesome-generative-ai-guide高效处理大规模请求生成式AI批量推理awesome generative ai guide高效处理大规模请求 引言大规模AI推理的挑战与机遇 在当今生成式AIGenerat文档教程人工智能大模型上一篇Parler-TTS技术伦理委员会选举2025年成员参与流程下一篇markitdown多格式文档转 Markdown 的 3 个实战场景创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考