投研看板LLM 跟踪评价KOL 加权口碑分
方法论 · 加权情绪

📊 KOL 加权口碑分

基于 33 人 KOL 样本(A 类 AI 产业 24 人 ×1.5、B 类 投资人 9 人 ×1.0)对各模型的公开表态,计算加权情绪分。

算法:情绪 正面 +1 / 中性·混合 0 / 负面 −1;加权分 = Σ(权重×情绪) / Σ(发声者权重),范围 −1~+1。
剔除规则:自家公司模型(Altman 谈 GPT-5.5、Amodei 谈 Fable 5、Noam Brown 谈 GPT 家族)不计入第三方分;② 纯地缘/技术路线之争(黄仁勋、LeCun 对 DeepSeek 的批评属此)不计入质量分,仅在明细里标注。
⚠️ 读数前必看:这 33 人以海外产业/投资领袖为主,极少评国产中腰部模型。结果只有 4 个模型有覆盖,且每个仅 2–5 人,样本极小、仅供参考;7 个模型样本内无人表态。国产模型的真实口碑请看各详情页的中文媒体/B站/linux.do 实测。

① 33 人样本加权口碑分

仅列样本内有表态的模型;已剔除自家 COI 与地缘/路线表态。覆盖 = 计入分数的发声人数 / 33。
模型加权分覆盖计入分数的发声者(情绪)
GPT-5.5 +0.6 5 / 33 Ethan Mollick +1Garry Tan +1Satya Nadella +1 ·合作方Simon Willison 0Chamath 0
DeepSeek V4 +0.5 5 / 33 Simon Willison +1Chamath +1Garry Tan +1Nathan Lambert 0 ·Flash+1/Pro−1Hassabis 0
Claude Fable 5 +0.5 2 / 33 Simon Willison +1Karpathy 0 ·二手转引
Claude Opus 4.8 0.0 2 / 33 Simon Willison 0Chamath 0
Qwen3.7-Max · MiniMax M3 · 混元 Hy3 · MiMo-V2.5 · Step 3.7 · Kimi K2.7-Code · GLM-5.2 无数据 0 / 33 33 人样本内无人公开表态(符合"战略型样本不评国产中腰部"的预判)
提示:分数仅基于 2–5 人,统计意义弱,趋势参考、勿当精确排名。DeepSeek V4 内部有分歧——Nathan Lambert 认为 Flash 是真亮点(+1)、Pro 相对体量令人失望(−1),故计 0。

② 个人表态明细(含被剔除项)

完整记录找到的样本内 KOL 表态,含因 COI / 非质量原因被剔除出分数的条目。
KOL(类/权重)模型情绪要点计入?
Simon Willison (A·1.5)DeepSeek V4+1"几乎到前沿、价格只是零头";Flash 是最便宜小模型
Simon Willison (A·1.5)Fable 5+1"something of a beast... very strong start",慢且贵但啥都扛得住
Simon Willison (A·1.5)Opus 4.8 / GPT-5.50 / 0Opus "温和但实在的进步";GPT-5.5 主要做 pelican SVG 测试
Ethan Mollick (A·1.5)GPT-5.5+1"a big deal... 快速进步还没结束",但 jagged frontier 仍在
Nathan Lambert (A·1.5)DeepSeek V4Pro −1 / Flash +1"Flash 才是真正主角",Pro 相对体量令人失望✅(计0)
Andrej Karpathy (A·1.5)Fable 50"够得上大版本跃迁",但护栏发布时"过于敏感"(二手转引,建议核原推)
Garry Tan (B·1.0)GPT-5.5 / DeepSeek V4-Pro+1 / +1工作流分工:GPT-5.5 做召回抽取、V4-Pro 做创意;另用 Opus 4.7(非4.8)做精确任务
Chamath (B·1.0)DeepSeek V4 / GPT-5.5 / Opus 4.8+1 / 0 / 0V4-Pro 极致性价比;批评企业默认用最贵模型(贬使用非贬模型)
Satya Nadella (A·1.5)GPT-5.5+1宣布上线 Copilot 全家桶,称推理/长任务显著提升(合作方背书)✅(标注)
Sam Altman (A·1.5)GPT-5.5+1"奇才",盛赞 Codex 自主能力✗ 自家
Dario Amodei (A·1.5)Fable 5+1"没早发损失巨大,极大加速内部研究"✗ 自家
Noam Brown (A·1.5)GPT-5.5+1"GPT-5.5 家族主导 AA 性价比前沿"✗ 自家
黄仁勋 Jensen (A·1.5)DeepSeek V4−1担忧其优先跑华为芯片"对美国是可怕结局"(地缘,非质量)✗ 地缘
Yann LeCun (A·1.5)DeepSeek V4 / LLM−1重申自回归 LLM 是"死胡同"(路线之争,非针对 V4)✗ 路线
Jack Clark (B·1.0)Fable 5(间接)谨慎发布前称"有油门没刹车"(安全警示,Anthropic 联创)✗ 自家
未找到任何目标模型表态(样本内 18+ 人):Hinton、Bengio、Hassabis(仅宏观)、Hyung Won Chung、Jim Fan、Riley Goodside、Logan Kilpatrick、Guillermo Rauch、Amjad Masad、Aravind Srinivas、Thomas Wolf、Peter Steinberger、Akshay Kothari、Emad Mostaque、Marc Andreessen(仅泛指 DeepSeek)、Ben Horowitz(仅泛指)、Elad Gil、Sarah Guo、Vinod Khosla、Azeem Azhar。

③ 名册外但有信号的来源

这些不在 33 人样本里,但覆盖了国产模型——是国产模型口碑的真正来源(中文媒体偏实测、中国创始人多为对标/COI)。
来源模型情绪要点
量子位MiniMax M3 / MiMo-V2.5 / GPT-5.5 / DeepSeek V4+1 多M3 与顶尖闭源同台、MiMo 4h 肝出 macOS、DeepSeek V4 降价实测
智东西(陈骏达)Qwen3.7-Max / MiniMax M3+1 / 0Qwen 杀至国产第一、响应更果断;M3 底子扎实但"交付完成度还不够"
数字生命卡兹克Opus 4.8+1"可能第一个不会偷懒的模型"(公众号墙后,摘要转述)
唐杰(智谱) 自家GLM-5.2+1官方口径:主打 Agentic Coding、1M、MIT 全开源,对标 Opus
李彦宏(百度) 对标DeepSeek V4-Pro / GPT-5.50文心5.1 对标口径超 V4-Pro / GPT-5.5;本人观点"应用才是王道"
王小川(百川) 对标DeepSeek V4-Pro / GPT-5.5 / Opus 4.7−1(限医疗)医疗模型 M4 在健康榜超它们,论点"通用模型不及垂类增强"