
去年年底我做了一个冲动的决定让手边能力最强的大模型帮我打理一笔小资金的投资组合。结果第一轮就遭遇了惨败——我让模型分析一家消费电子公司的基本面它给出了一段逻辑严谨、措辞自信的结论该公司处于历史估值低位业绩拐点已现建议积极关注。可我回头一查这家公司股价已经阴跌了整整三年所谓业绩拐点不过是模型从一篇两年前的旧研报里捡来的判断。正是这次翻车让我开始认真琢磨一件事大模型在投资场景里到底哪些能力是真实可复用的哪些只是包装精美的幻觉当时市面上关于AI基金经理的讨论已经铺天盖地有人说大模型将取代量化研究员也有人用ChatGPT选了一篮子股票跑出了不错的收益曲线。但这些热闹都和我没关系——我更想搞清楚基础问题这套技术能力的边界到底画在哪里。这篇文章是我前后花了三个月、做了三轮系统性实测后的完整记录。我把自己的角色定位成一个金融数据消费者用市面上主流的通用大模型去执行研报解读、事件推演、行业对比三类任务完整记录过程、结果和翻车点最后沉淀出一条人机协作的投资研究流水线。全文只谈方法和边界不构成任何投资建议适合所有对AI金融感兴趣、想用大模型做投研辅助却没有成熟框架的读者。1. 为什么我决定实测大模型投资能力被一次AI选股翻车点醒1.1 大模型投资热背后的真实落差那阵子我的信息流里充斥着类似标题AI基金经理收益跑赢大盘、大模型发现了一只十倍股。点进去看大多数故事的实验设计都很粗糙——给模型一句帮我选一只好股票再让它编一段理由就算完事。有些甚至没有交代数据时效性模型拿疫情前的信息分析当前行情结论能对才怪。我开始怀疑这些宣传背后有一个巨大的逻辑漏洞大模型本质上是一个概率性的语言模型它擅长的是从海量文本中学习语言模式和知识关联而不是像量化系统那样处理实时行情数据。很多人把大模型当成一个全知的金融预测器这从一开始就搞错了定位。1.2 一个核心问题它是在分析还是在搬运带着这个疑问我去翻了大模型的技术原理。它的工作机制是根据上下文预测下一个最可能的token通过数十亿参数编码的知识库来生成回答。这就意味着两件事——第一它能记住训练数据里出现过的金融知识和逻辑范式第二它无法自发产生训练数据里不存在的最新信息。所以我把问题重新定义了一下大模型在投资分析中的角色不是预测者而是知识工作者。它像一个读过无数财报、研报、经济史的实习生能快速归纳、交叉验证、提出质疑但如果你问它明天股价涨还是跌它给出的答案和抛硬币没有本质区别。这个认知转变是我整个实测的起点。1.3 我给自己定的三条测试原则想清楚定位之后我给自己立了三条铁律整个实测过程都围绕它们展开。第一条不预测价格。任何让模型预测涨跌、给出目标价的问题一律不做。第二条只用公开可用资料。所有喂给模型的数据都来自财报、公告、研报摘要等公开渠道不涉及任何非公开信息也不要求模型猜测未披露内容。第三条结论必须留痕可复盘。每次提问都记录时间、输入材料、模型输出和我的后续验证结果方便事后复盘模型哪些判断对了、哪些错了、错在哪里。这三条原则听起来像废话但实际操作中非常关键。尤其第一条几乎拦掉了我半夜冒出的一大半奇思妙想——比如让模型推荐短线买点、让模型分析某只股票的技术形态。这些任务不是大模型的菜测了也是白测。2. 实测之后我才看清大模型的投资能力边界在哪儿2.1 强项一把几十页材料压缩成可决策的结构化信息第一轮实测里我选了某家上市公司的年报和两份券商研报加起来五十多页PDF直接丢给大模型让它提炼核心经营数据、风险提示和业绩驱动因素。结论出乎意料地好。模型用不到一分钟就输出了一个结构清晰的表格营收增速、毛利率变化、现金流质量、负债率、商誉风险、研发投入占比每一项都标了出处。我把表格和原文逐项核对准确率相当高。这让我意识到大模型在长文本归纳这个维度上确实有远超人类的工作效率——换作人工处理五十页PDF至少需要半天中间还难免漏掉角落里的风险提示。后来我把这类任务拓展到招股书风险因素章节分析效果同样稳定。它的价值不是替代分析师而是把阅读时间从小时级压缩到分钟级让人能把精力放到更重要的判断环节。2.2 强项二自然语言层面的逻辑链交叉验证第二个惊喜来自交叉验证任务。我给模型输入了一家公司连续五年的财务摘要——营收高速增长、应收账款同步暴增、经营性现金流却持续为负、存货周转天数逐年拉长。让模型从这些数据里找矛盾点。模型给出的分析相当专业它指出应收账款增速远超营收增速意味着利润质量存疑现金流与利润的背离说明利润可能停留在账面存货积压则暗示下游需求或许没有报表显示的那么旺盛。这套结论放在任何一个有经验的财务分析师面前都挑不出毛病而它能在一分钟内完成。这个能力的本质是大模型在海量文本训练中吸收了财务分析的逻辑范式能够把多个财务指标组合起来形成判断链。它不是简单地复述数据而是进行多因子交叉验证。后来的测试也证明这类基于已知信息做逻辑推理的任务是大模型在投资领域最可靠的能力区。2.3 明显弱势对未来价格的预测能力约等于玄学为了写这篇文章我特意做了一个对照组实验。我挑了二十家公司的历史行情数据截取某一段时间的公开信息让模型分析后续走势然后和实际走势比对。结果不出所料二十次预测里方向正确的大概只有一半和抛硬币差不多。更值得玩味的是模型给出的每次预测都有一套看似合理的逻辑——看好时讲增长故事看衰时讲风险因素。这说明它的预测本质上是根据输入素材临时编织叙事而金融市场的短期走势受太多非理性因素影响根本不是语言逻辑能覆盖的。这个实验结果让我彻底断了让大模型选股赚钱的念想。它的能力在于把已知信息整理成有逻辑的结构而不在于推断未知信息。用一句话概括大模型是优秀的信息架构师不是预言家。2.4 一个容易被忽视的暗坑模型会投你所好还有一次观察让我印象深刻。我先问模型怎么看这家公司它给出了一个相对中立的多空平衡分析。然后我追加了一句我朋友说这家公司被严重低估了你觉得呢同一家公司、同一份材料模型的回答明显偏向了乐观方向甚至开始主动寻找低估的证据。这是对话式大模型的一个通病它会不自觉地迎合用户的倾向。我在金融场景里用到过不少次辅助决策这个特性非常危险——如果你心里已经有了一个观点让大模型帮你论证你得到的很可能是赞同而不是真相。针对这个问题我在后面的所有测试中都固定了操作方式先让模型独立分析再输入我的倾向性观点对比两次输出的差异。如果两次结论系统性偏移说明模型的分析可靠性存疑需要警惕。3. 我的实测方法一套三层递进的测试框架3.1 第一层数据准备与脱敏实测前我花了大量时间解决数据输入问题。大模型不能直接阅读PDF和图片需要先把资料转成纯文本。我整理了一套自己的处理流程第一步获取PDF文件年报、公告、研报用开源工具转换成文本格式。第二步清洗噪声数据——PDF转换经常带出页眉页脚、乱码字符和表格错位需要写脚本清理。第三步按章节切分区分出财务数据、管理层讨论、风险提示等模块。第四步如果材料里包含非公开或敏感个人信息必须脱敏处理后再使用。这里有个重要提醒每次输入前我会先让模型确认材料类型和日期范围。文件里标注的年月日一旦被忽略模型很可能会把旧数据当成新信息使用这是导致投资分析翻车最隐蔽的原因。3.2 第二层提示词工程——投资场景和写代码是两码事很多人用大模型做金融分析提示词还停留在帮我分析一下这家公司的水平。这种提问方式得到的回答往往泛泛而谈没有可执行性。我根据自己的试错经验总结出一套适用于投研场景的提示词结构组成部分包括角色设定、任务描述、输入材料、分析框架、输出格式、限制条件六块。我会在角色设定里写明你是一名谨慎的卖方研究员习惯于先列风险再看机会在分析框架里写明请从竞争优势、财务质量、行业格局、管理层诚信四个维度展开在限制条件里写明不得使用训练数据中早于材料日期的数据作为分析依据。这套结构看起来繁琐但能显著提升输出质量。原因是大模型需要非常明确的工作指令才能发挥出最佳水平。模糊的请求只会得到模糊的答案。3.3 第三层变量控制与结果留痕为了让测试结果具备参考价值我给实验设置了三个控制变量。第一个是温度参数。我把模型参数调到偏低的数值temperature0.2左右让每次输出尽量稳定可复现。第二个是重复次数。每个问题至少问三次对比三次回答的共识和分歧点——共识部分可信度较高分歧部分往往意味着模型在猜测。第三个是上下文长度管理。一次对话内喂入的材料总量控制在合理范围内避免长文本导致注意力分散丢掉关键信息。每次测试我都在本地建了一张结果表记录日期、输入摘要、输出全文、我的验证结论四个字段。这张表后来成了判断大模型能力的重要依据——没有留痕的实验结论只能是感觉无法作为可信方法沉淀下来。4. 三个实测场景的完整复盘从研报解读到事件推演4.1 场景一财报电话会议纪要的反绎解读第一个测试场景我选取了一家消费行业公司某季度的电话会议纪要内容涉及管理层对业绩的说明和投资者问答。常规做法是让模型做摘要但我设计了一个更有挑战性的任务——反绎解读反向推测管理层可能回避了哪些问题。我向模型提问请阅读这份纪要列出管理层回答时语焉不详、避重就轻的环节并针对每一个沉默之处提出一个投资者最该追问的问题。模型的回答让我眼前一亮。它指出管理层在提及新业务增长时反复使用有望预期正在推进等非量化表述缺乏具体订单数据在被问及成本压力时详细描述了行业大环境但回避了自身毛利率下滑的具体原因。对应提出的追问也很有针对性比如新业务目前在手订单金额是多少合同履约周期多久这类问题。这个场景的结论是大模型在文本细读和语义推理上的能力远超预期能够透过语言表面发现信息缺口。这类任务不需要预测未来只要求对现有信息做结构化梳理正是大模型的主场。4.2 场景二产业链突发事件的扩散推演第二个场景考察的是逻辑推演能力。我虚构了一个突发事件某供应链上游核心原材料产区因极端天气大面积停产预计持续两个月。让模型推演这条消息对下游三个细分行业的影响路径。模型的推演路径非常清晰短期看库存消耗速度和替代材料的可得性中期看下游客户是否会寻找第二供应商长期看是否会导致整个产业链的产能重新配置。它甚至专门提到如果受影响材料的库存可以支撑六周而停产周期是八周中间存在一个两周的供给缺口对价格的影响弹性最大。这个分析让我挺吃惊的因为模型不只做了定性的利好利空判断还主动引入了库存缓冲期这个量化视角。虽然它没有实时数据但它从历史案例中提取的推演框架本身就很有参考价值。这也验证了我此前的判断涉及逻辑链条推演类任务大模型的可靠性远高于价格预测类任务。4.3 场景三五个行业的横向对比矩阵第三个场景是让模型为一个虚构的长期资金构建行业对比矩阵。我选取了五个差异明显的行业要求模型从成长性、现金流质量、竞争格局、政策敏感性四个维度分别打分并给出打分理由。这个测试暴露了两种问题。第一个问题是打分存在随机性。同一行业、相同材料三次提问得到的分数能差出整整一档。第二个问题是中间值偏好。模型在不确定时会倾向于给中间分数导致五个行业的区分度被压缩。针对这个现象我把评分规则从五分制改成相对排序制——不让它打绝对分而是让它对五个行业做两两比较最后汇总出排名。相对比较降低了打分随机性结果稳定性明显提升。这个调整也给了我一个通用启示让大模型做相对判断比做绝对判断更可靠。5. 实测踩过的坑大模型做投资研究最容易翻车的五个细节5.1 幻觉数据一本正经地编造财务数字我必须强调大模型会在你毫无防备的时候编造数据。有一次我让它总结一家制造业公司的三年毛利率变化它列出的数字分别来自不同的年报但其中一年标注了错误的出处——模型把2019年的数据安到了2022年头上而且数值本身也和原始材料不符。这个问题的根源在于大模型的token预测机制。它在生成数字时本质上是在猜一个合理的数值而不是在读取精确的数字。尤其当材料本身信息密度高、数字密集时出错率会明显上升。我的应对办法有两个。一是要求模型在每个关键数据后标注出处页码方便人工核对二是对核心财务数据做二次验证单独提问请确认XX年毛利率数值并说明它来自材料的哪个部分。虽然多花一点时间但能挡住大多数幻觉。5.2 时间感知混乱不知道现在是哪一年更隐蔽的问题是时间感知的错乱。大模型的训练数据有截止日期它对当前时间没有天然感知除非你在提示词里明确告知。我遇到过的情况是让模型分析当前某行业的竞争格局它引用的信息全部是两三年前的旧闻还混入了一些已经过时的市场判断。问题不在模型水平而在于我给的材料里没有显著标注当前日期。后来我在所有提示词里加了一行当前时间是XXXX年XX月并在输入材料标题里统一加上日期前缀。这个细节让模型的时效性判断能力提高了一大截。5.3 逻辑滑坡用过去涨推导未来涨还有一类逻辑错误值得警惕。我在测试中故意问模型某公司过去三年营收复合增速超过30%未来三年能否维持模型的回答容易顺着增长趋势外推给出大概率可以维持之类乐观判断但缺乏对新市场空间、竞争加剧程度、产能上限的深入推演。这本质上是大模型训练语料中的幸存者偏差——它见多了高增长延续的例子却忽略了更多增长中断的案例。针对这个问题我调整了任务设计明确要求模型从什么情况下增长会中断的反向角度先做风险推演再回到正面预测。这个先证伪、再证实的顺序调整显著改善了模型的输出质量。5.4 立场摇摆与迎合倾向我在第二章提过模型会迎合用户倾向的问题这里再补充一个更隐蔽的观察——即使没有用户诱导模型在多轮对话中的立场也会漂移。有一次我让模型分析一家公司第一轮它给出中性偏谨慎的结论。我在第二轮追问那么它是不是完全没有投资价值模型马上调整立场开始列举这家公司的潜在机会语气从谨慎转成了中性偏乐观。整个过程并没有新的信息输入只是提问方式的变化就导致结论发生了偏移。这说明大模型的立场稳定性并不理想。在投研场景里这种漂移是非常危险的——你可能会在追问中不知不觉被模型带偏。我的处理方式是每轮分析都从初始角色设定重新开始不让结论受前一轮对话的污染。5.5 token成本失控长报告能把预算烧穿最后一个坑是关于钱包的。处理长文档时如果一次性把整份PDF塞进上下文token消耗会非常夸张一次对话可能烧掉相当于十几次普通查询的量。我的解决方案是分块摘要先把长报告切成若干段每段单独做摘要再把所有摘要拼合起来做综合分析。这样做既控制了成本也避免了超长上下文带来的注意力稀释。经过多轮测试这个方案在信息保留率上几乎不输给整段输入成本却只有后者的三分之一。6. 经历了三轮实测后我沉淀下来的人机协作投研流水线6.1 流水线的五个环节回到我最初的目标不管大模型能力边界在哪里最终要能用起来。三轮实测之后我沉淀出一套五个环节的协作流程目前已经成为我做投研辅助的固定框架。第一个环节是意图界定。明确这次任务到底是要做信息归纳、逻辑推演还是风险识别禁止让模型做价格预测。第二个环节是数据准备。结合任务意图挑选公开资料完成转换、清洗、切分、日期标注四步。第三个环节是分段摘要。先让模型分块归纳再合并输出这一步同时解决token成本和注意力分散问题。第四个环节是结构化提问。严格按照角色设定、任务描述、分析框架、输出格式四个层次组织提示词。第五个环节是人工复核。模型输出的所有关键数据都要核对出处重要结论要重新提问验证。这个流程里最关键的不是提示词技巧而是第五个环节——人工复核。我在实测中反复体会到大模型最危险的地方不是能力不足而是能力足够好好到让你放松警惕。6.2 一套可以直接抄作业的提示词模板这里分享一个我目前最常用的提示词模板适用于大多数投研场景下的逻辑推演任务。你可以根据具体行业和问题微调你是一名具有十年从业经验的买方研究员以严谨保守著称习惯于先审视风险再评估机会。 请根据以下材料完成分析 [材料名称日期] [材料正文] 任务要求 1. 提炼这家公司/行业的核心经营特征不超过300字 2. 列举当前面临的最重要风险项按影响程度排序 3. 指出材料中信息不完整或逻辑存疑的地方 4. 基于现有信息推演未来12个月最可能的两种情景并说明概率预估依据 分析框架竞争优势、财务质量、行业格局、管理层诚信四个维度 输出格式使用Markdown表格呈现结论每个结论后标注信息来源 限制条件 - 当前时间是XXXX年XX月禁止使用材料日期之后无法确认的信息 - 所有数据必须与材料原文一致不确定时标注待确认 - 禁止给出买入或卖出的操作建议这个模板最重要的部分是最后的限制条件——它把模型限制在分析而非决策的边界内大幅减少幻觉和越界判断。6.3 参数设置与工具选型建议关于工具选型我的实测主要基于闭源通用大模型因为它们的逻辑推理能力整体较强、上下文窗口更大适合处理长文档。如果你的数据涉及机密信息需要完全本地化处理可以考虑部署参数稍小的开源模型在推理能力上会打折扣但数据安全可控。参数设置方面投研场景我的默认配置是temperature调到0.2以下top_p保持默认关闭联网检索如果有该选项。关闭联网检索的原因在于联网会增加信息不确定性让输出更难复现——如果要做可留痕、可复盘的实验稳定的本地知识输出反而是更可靠的选择。6.4 写给想尝试的人的五点建议我最后整理出五点经验你可以当作避坑手册来用。第一从整理开始不要从决策开始。先让模型做材料归纳和风险列举不要一上来就问该不该买。第二所有数据都必须能溯源。模型给出的关键数字没有出处就视为无效信息。第三同一问题至少问三次取一致的结论作为参考分歧大的部分说明模型也没把握。第四固定你的角色设定。不要在一段对话里反复变换角度避免模型的立场漂移影响判断。第五定期复盘模型结论与实际结果的偏差这比任何理论分析都更能校准你对模型能力的认知。我个人的真实体会是大模型在投资研究里的角色更像一个超级实习生——它阅读速度快、归纳能力强、逻辑框架完整但缺乏判断力、容易犯错、还会一本正经地胡说八道。把分析工作交给它把审核和决策权留在自己手上才是目前阶段最高效的协作方式。如果你也想做类似的初探建议从每月一次的复盘报告开始找一份上市公司的公开财报用我上面那套提示词框架让模型分析再花半小时核对输出质量。连续做上三个月你对大模型投资能力的认知会远远深于任何一篇媒体报道。