陈大年复出,入局大模型
首秀逼近 DeepSeek 万亿旗舰
鹭羽 发自凹非寺
不得了!国产大模型第一梯队,最近爆了个冷门。
一家新公司,首款模型只有 27B,却在信通院 MCP 专项测试中拿下综合第二。
排在它前面的,是梁文锋藏了近一年的大杀器——参数量高达 1.6 万亿的 DeepSeek-V4-Pro。
两者差距仅 1.3 个百分点。

这匹黑马就是 StartLux-V1.0-27B-Preview,来自 StartLux(原点星辉)。
有点面生,是吧?别急,它的创始人兼 CEO 可是老熟人:陈大年。
作为互联网时期的初代程序员“教父”,他的战绩有迹可查:
盛大网络联合创始人、连尚网络掌门人、中国最早引入“共享软件”概念的编程者……

退隐十年后再度归来,这一次,他把赌注押在了本地模型上。
这就不得不提陈大年最近一次的罕见露面。
他在盛大创新院 18 周年老友聚会上公开喊话,提出 “AI 时代有八条非共识”,其中四条都在强调本地模型。
本地模型会完全摧毁云端市场,3 年时间打平 Claude,占据 80% 的市场。模型拼参数的玩法要 OUT 了……
StartLux 正是这一理念的最好体现。
公司没有随行业大流,而是专注于小而美的本地模型商业化。它也是全球第一家真正意义上的本地模型公司。

作为面向市场的首份成绩单,StartLux-V1.0-27B-Preview 不依赖云端,可直接运行在消费级 PC 上。
也就是说,这个规模小了近 60 倍的本地模型,Agent 能力却能够追平万亿级云端旗舰。
凭什么?
27B 对上 1.6T,小模型打出大结果
在谜底揭晓之前,我们不妨先来看看这次对标的是谁。
常言道,没人会记得第二名,除非第一名是 DeepSeek。
更何况,两者差距只有毫厘之间,非常值得说道说道。
成绩出自权威机构中国信通院的可信 AI 大模型基准测试 MCP 专项。该专项围绕真实应用场景设置了六类任务:
位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D 设计。
此外,还有一项综合评估,重点考察 Agent 多工具协同、复杂任务执行和真实环境交互能力。
简单来说,MCP-Universe 不看模型回答得好不好,而看的是事情究竟能不能做出来。这也是判断 Agent 能力好坏最本质的标准。

结果显示,StartLux-V1.0-27B-Preview 综合得分为 39.25%,排名第二。
它超过了参数量为 284B 的 DeepSeek-V4-Flash-0731 和参数量为 198B 的 Step-3.7-Flash,仅落后 DeepSeek-V4-Pro 1.3 个百分点。
在同为 27B 参数规模的模型中,StartLux 也比 Qwen 3.6 高出 5.34 个百分点。

单项成绩也很能打:位置导航、金融分析和浏览器自动化均位列第一,其余细分项也同样名列前茅。

除了数据,我们再来看两场实战。
第一道题,是一笔跨越两年的微软股票投资,对比模型为 Claude Sonnet 4.6。
Prompt:如果在 2023 年 1 月 9 日向微软投入 25,000 美元,一直持有到 2025 年 1 月 8 日收盘,最终价值和总收益率分别是多少?
Claude 的答案是:47,254 美元、89.02%。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
而 StartLux 给出的答案是:47,499.09 美元、90.00%。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
看起来似乎差不多?但在金融行业,差之毫厘,失之千里。
仔细观察两个模型的思考过程可以发现,由于原始数据缺失,Claude Sonnet 4.6 直接将 2025 年 1 月 8 日误判为非交易日,计算的是前一天的收盘价。
在同样的情况下,StartLux 分别回查历史数据,再验证目标日期附近的行情,确认准确收盘价后,才完成计算并生成可视化结果。
最终,StartLux 得出的结论才是正确、可复核且可追溯的。
第二道题则更直观:让两个模型同时帮忙在浏览器上查询机票。
Prompt:浏览器打开 Google Flights,找一班从新加坡飞北京的单程航班,5 天后出发。我要最便宜的直飞经济舱,而且不要落在大兴机场。只看价格,任务结束后关闭浏览器。
其中,StartLux-V1.0-27B-Preview 用时约 95 秒完成搜索,找到了价格为 299 美元的国航机票。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
反观 Claude Sonnet 4.6,它在日期选择、弹窗关闭和筛选菜单之间经历了更多截图确认,还一度误触时间筛选面板。
两百多秒后,它给出的最低报价为 556 美元。价格更高,搜索时间也是 StartLux 的两倍。
尤其是在操作路径上,StartLux 要简洁得多,全程只用了 12 步,而 Sonnet 足足用了 21 步。

视频链接:https://mp.weixin.qq.com/s/365CtdgGYFlEKNDICtoCfg
这足以说明,在 Agent 任务上,参数规模已然不是唯一的决定性变量。
新的变量,是后训练。
参数做减法,能力不打折
StartLux-V1.0-27B-Preview 并非从零开始训练。
它以 Qwen3.6-27B 为基座,最终测试分数却比 Qwen 高出不少,原因就藏在任务数据和自动化后训练方法中。
简单来说,StartLux 训练的是一个更会干活的 Agent。训练数据重点强化了任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力。
模型要学会的不只是给出最终文本,还包括何时调用哪个工具、工具返回异常后如何调整,以及在什么情况下才能宣布任务完成。
接着,后训练将这一过程推得更远。
团队自主研发出一套全新的、多维度、可验证、可规模化的模型迭代优化技术。其中采用AI 训练 AI(Auto Research)的方法,让模型能够在真实工具环境中自主执行任务,再根据环境反馈持续调整策略。
比如前文提到的金融分析案例中的回查修正,以及浏览器任务中的约束识别和路径选择,正是这种后训练最直观的体现。
据官方介绍,StartLux-V1.0-27B-Preview 也是国内首个采用 Auto Research 方式完成后训练的本地 Agent 模型。

诚然,这并不意味着 Scaling Law 失效了。
大参数云端模型仍然是当下的主流选择,但 StartLux 也给出了清晰的信号:这并非唯一通解。
用陈大年的话来说:
Scaling Law 是“过路神仙”,没有它,AI 起不来。但它只是从 AI 的发展路径上路过,未来不一定属于它。
行业同样意识到了这个问题。目前,大模型技术路径正呈现出显著分野的趋势:
一边是**“大力出奇迹”**的忠实信徒,参数从百亿卷到千亿,再卷到万亿,训练成本也随之指数级攀升;
另一边则是以 Harness 为代表的 Agentic 评估体系迅速走红,越来越多专家学者开始明确提出**“少即是多”**。
化用王阳明的说法,知行合一,更高质量的行动才是关键。StartLux 为模型做减法提供了又一例证。

这也可以解释 StartLux 为什么坚持发展本地模型。
模型一旦进入 PC,对于长时任务而言,其成本结构可以从持续累积的云端 Token 费用,转化为更可控的设备算力和电力消耗。同时,模型也能更好地理解用户的长上下文,实现更个性化的目标。
不止 StartLux,Meta、Google、NVIDIA 最近也在加码本地小模型方向。
不过,这些项目大多还停留在实验阶段,或更偏向极客用户。以本地模型产品化为主的,目前只此一家。
StartLux 也表示,后续将稳步推进自有基座模型训练,探索扩散式语言模型等新架构。总之,路线走对了,未来可期。

StartLux 接棒本地模型
既然这是一条非共识路线,掌舵者就需要两种人:敢下注的和能做出来的。
StartLux 的明星团队正是如此,由企业家与科学家强强联合。

StartLux 创始人陈大年
CEO 陈大年此前已经简单介绍过了。他是连续创业者,也是中国初代程序员,和张小龙、雷军同期成名,创业时间与马云、马化腾处于同一时代。
他是中国最早引入“共享软件”概念的人,和二哥陈天桥一起创办了盛大网络以及互联网创新摇篮之一的盛大创新院。国民级产品**“WiFi 万能钥匙”**也是由他一手孵化。
可以说,他对中国市场的用户和产品了如指掌,本地模型也算是他的舒适区。

StartLux 联合创始人郭权玮
负责将技术路线落地的,是 StartLux 联合创始人兼 CTO 郭权玮。
郭权玮拥有国立阳明交通大学计算机科学与工程博士学位,研究方向涵盖本地部署大模型、Agentic AI、AI for Science、AI for Finance 和隐私保护机器学习等领域。
加入 StartLux 前,他曾任 AI 科学公司幻量科技首席算法科学家。更早之前,他在台湾工业技术研究院从事数据隐私、数据去标识化和隐私保护机器学习研发。
他还是2024 年 TAAI 最佳论文奖获得者,并以第一发明人身份拥有数据隐私相关发明专利。
而 StartLux 另一位联合创始人罗永祥,则是前摩根士丹利亚洲董事总经理。
**陈大年懂产品和用户,郭权玮长期研究本地模型、Agent 和数据隐私,罗永祥负责市场和投融资。**这套组合高度适配 StartLux,也将助力其长线发展。

至于团队最终想交付的,也不只是一份模型权重。
在 StartLux 的构想中,本地智能解决方案应该像安装 Office 一样,一键完成部署。用户不需要理解量化、显存配置和推理框架,也不用自行反复调优。
因此,目前团队计划面向企业和个人用户,在年内推出第一代本地智能解决方案。
这样看来,StartLux 的横空出世绝非“又多了一个玩家”那么简单。
它也代表着,继 DeepSeek、Kimi 等云端模型公司涌现之后,国产本地模型也开始陆续补位。
从智能时代的后起之秀,又兜兜转转回到互联网时代的初代程序员,模型基本范式正在换挡,但始终有中国公司在接力向前。