一张3090,五小时造出FPS

开发者用单张RTX 3090本地运行Qwen3.8-27B,约5小时生成可玩的僵尸射击游戏。真正值得关注的不是Demo,而是消费级显卡已能承载完整的本地编程Agent闭环。
单张RTX 3090,也能让27B模型连续“干活”
9月14日,一名开发者在社区展示了一次颇具代表性的本地编程实验:用单张超频后的RTX 3090运行Q4_K_M量化版Qwen3.8-27B,再通过两套Harness驱动模型持续生成、修改和验证代码,约5小时后做出了一款可以实际游玩的第一人称僵尸射击游戏。
从公开演示和描述来看,这个游戏已经具备第一人称移动、射击、敌人以及场景反馈等基本要素。它显然谈不上完整商业游戏,画面、关卡设计、代码结构和异常处理也不太可能经得起专业团队审查,但它越过了一个重要门槛:不是只能截图展示的网页原型,而是能够启动、操作并形成基础玩法循环的软件。
更关键的是,这个过程没有依赖云端模型API,也没有用最新的数据中心GPU。RTX 3090发布于2020年,已有大量二手卡在开发者手中流通。用这样一张24GB显存的消费级显卡,把一个270亿参数模型塞进本地环境,并让它连续承担数小时的Agent编程任务,本身比“AI又做了一个小游戏”更值得关注。

先说结论:厉害的不是FPS,而是本地Agent闭环
用大模型生成射击游戏早已不算新鲜。Claude、GPT、Gemini等闭源模型都能在较短时间内写出类似Demo,一些专门面向游戏开发的Agent甚至可以直接控制编辑器、导入素材和运行测试。
这次实验的不同之处,是它把整条链路压进了一台普通工作站:
- 模型权重在本地加载;
- Harness负责拆解需求和调用工具;
- 模型读取项目文件并生成代码;
- 编译器或运行环境返回错误;
- 模型根据日志继续修复;
- 多轮循环后形成可运行版本。
这说明27B级开源模型的价值正在发生变化。过去,这个参数规模通常被视为“单轮问答还不错,但复杂开发不够稳”;现在,模型未必需要一次性给出完美答案,只要能在Harness里持续读日志、改文件、跑测试,它就可以用更多推理轮次换取最终完成度。
换句话说,Harness正在把模型从“答题选手”变成“能返工的开发者”。模型单次输出是否完美,仍然重要,但不再是唯一决定因素。
27B模型为什么能塞进24GB显存
Qwen3.8-27B是一个约270亿参数的稠密模型。如果直接使用FP16权重,仅参数理论上就要占用约54GB显存,单张RTX 3090肯定装不下。
此次测试使用的是Q4_K_M量化版本。这个命名通常出现在GGUF生态中,可以简单理解为一种4-bit混合量化方案:模型大部分权重以约4 bit精度保存,对部分更敏感的张量使用相对更高精度,从而在体积、速度和输出质量之间折中。
只算理论下限,270亿参数乘以4 bit,大约需要13.5GB存储空间。但真实运行时远不止模型权重,还要给以下部分留出显存:
- 量化元数据和部分高精度张量;
- KV Cache;
- CUDA运行时和算子工作区;
- 上下文输入与批处理缓存;
- 推测解码或多Token预测所需模块;
- Harness可能并发提交的任务。
因此,单卡部署真正难的不是“模型文件能不能装进去”,而是装进去以后还能否留下足够空间跑长上下文。24GB显存运行27B模型,属于能用但谈不上宽裕的状态:上下文越长,KV Cache占用越大;并发越高,显存压力也越明显。
这也是为什么单卡本地部署通常要同时控制量化档位、上下文长度和并发数。一个更现实的起步配置思路是:
model: Qwen3.8-27B-Q4_K_M
mode: single-user
context_length: 8192
concurrency: 1
prompt_cache: enabled
agent_strategy:
- plan
- edit
- run
- inspect_logs
- repair
这不是针对某个推理框架的可直接复制配置,而是一组资源分配原则:先保证单用户、有限上下文和稳定工具循环,再考虑更长上下文或多任务并发。对编程Agent来说,稳定跑完20轮,通常比第一轮多塞几万Token更有意义。
测试者还使用MSI Afterburner对RTX 3090进行了超频,据称性能提升约12%。这个增幅有帮助,但不是实验成立的核心。没有这12%,任务可能只是从5小时变成更久,而不是彻底跑不了。真正让单卡成为可能的,仍然是4-bit量化、推理引擎优化以及对上下文和显存的精细控制。
“两套Harness”不等于“两张显卡”
这次案例在传播过程中出现了一个容易混淆的细节:部分二次转述称使用了两张二手RTX 3090,而9月15日披露的测试信息则明确指向单张超频RTX 3090,并提到使用了两套Harness方案。
Harness在这里指的是包裹模型的Agent执行框架或任务脚手架,不是GPU数量。它负责向模型暴露文件系统、终端、编译器和测试工具,并管理多轮任务状态。
现阶段更稳妥的表述是:单张3090运行Q4_K_M版Qwen3.8-27B已经具备明确的技术可行性,相关开源部署仓库也给出了单卡运行模式;至于此次游戏生成实验的全部硬件拓扑、两套Harness分别承担什么角色、是否存在阶段性切换,目前公开信息仍不完整。
这不影响案例的主要结论,但开发者不应把一个社区Demo直接理解成标准化Benchmark。5小时这个数字只有在以下条件一致时才有比较意义:
- 是否从空目录开始;
- 是否使用现成游戏模板和素材;
- 是否包含人工修改;
- Harness是否自动运行和验证项目;
- 模型实际生成了多少Token;
- 失败任务是否计入总耗时;
- GPU是否一直处于满负载状态。
“5小时做出游戏”是一个结果描述,不是严谨的性能指标。
5小时背后,Harness可能比模型更重要
如果只是让模型一次性输出一个FPS项目,成功率通常不会太高。游戏开发涉及输入系统、碰撞检测、敌人状态、资源路径、场景初始化和渲染循环,其中任何一个环节出错,都可能导致项目无法启动。
Harness的作用,就是把一个模糊目标拆成模型可以反复执行的小循环。例如:
目标:实现一个可玩的第一人称僵尸射击Demo
验收条件:
1. 项目能够无报错启动
2. 玩家可以移动和转动视角
3. 鼠标点击能够射击
4. 敌人可以接近玩家并受到伤害
5. 玩家或敌人存在生命值状态
6. 失败后可以重新开始
执行循环:
读取项目 → 制定下一步计划 → 修改文件 → 启动测试
→ 收集错误日志 → 定位问题 → 小范围修复 → 再次测试
这套方法并不依赖某个特定模型。模型能力决定每轮修改的质量,Harness则决定错误能否被及时暴露,以及任务会不会在几轮之后偏离目标。
对本地小模型来说,后者尤其重要。顶级闭源模型有时可以凭借更强的长上下文理解和代码推理能力,一次跨越多个模块;27B量化模型更适合短周期、强反馈的开发方式。让它一次重写20个文件,很容易失控;让它每次只修复一个可以通过测试验证的问题,完成率反而可能更高。
这也是该案例对开发者最实际的启示:本地编程Agent的效果,不能只看模型排行榜。项目索引、上下文裁剪、错误日志、测试脚本、文件权限和回滚机制,都会直接决定最终结果。
它证明了什么,又没有证明什么
这次实验至少证明了三件事。
1. 24GB显存仍然是本地AI开发的重要档位
RTX 3090虽然已经不新,但24GB显存使它仍然能容纳27B级4-bit模型。很多新一代消费卡算力更高,显存容量却未必明显增加。对本地大模型而言,能否加载模型往往比峰值算力更先决定体验。
二手3090的另一个吸引力是固定成本。对于每天都要跑数小时代码生成、内部文档处理或数据分析的个人开发者,本地机器不按Token计费,也不会因为一次失控的Agent循环产生意外账单。
2. 中型开源模型已经能承担长流程任务
Qwen3.8-27B相较前代强化了编程和办公场景,并提供reasoning_effort能力,用于根据任务难度调整思考深度。这个方向很适合Agent:简单的文件查询不必长时间推理,架构调整和疑难错误则可以分配更多计算预算。
真正重要的不是它在某个代码榜单上超过了谁,而是它能否在连续数小时的工具调用中保持目标、理解错误并逐步收敛。游戏Demo至少说明,它已经不只是一个本地代码补全模型。
3. 隐私敏感的开发任务有了更现实的本地选项
本地推理意味着源代码、日志、密钥配置和内部文档不必离开工作站。对于无法把仓库发送给第三方API的企业,这一点可能比模型是否快20%更重要。
但这个案例没有证明单张3090可以取代云端前沿模型。
量化会带来能力损失,尤其容易影响长上下文稳定性、复杂重构和细节遵循。单用户体验也不能外推到团队并发服务。一个人让模型慢慢写Demo,和十名工程师同时请求代码审查,是完全不同的负载。
此外,“能运行”不等于“适合生产”。如果Harness拥有终端写权限,模型可能删除文件、安装不可信依赖或执行高风险命令。本地部署解决了数据外传问题,却没有自动解决Agent安全问题。至少应使用容器、非特权账户、目录白名单和版本控制快照隔离执行环境。
真想复现,先别急着超频
对于准备在3090上尝试Qwen3.8-27B的开发者,更合理的顺序不是先拉高显卡功耗,而是先把任务和运行环境收紧。
建议从以下步骤开始:
- 选择Q4_K_M或相近的4-bit量化,先验证模型能否稳定加载;
- 将上下文控制在8K左右,根据显存余量逐步增加;
- 使用单并发模式,避免Harness同时启动多个推理任务;
- 把游戏或应用拆成可独立验收的小功能;
- 为构建、启动和基础交互编写自动化测试;
- 每轮修改后自动提交Git快照,失败时直接回滚;
- 限制Agent可执行的Shell命令和可写目录;
- 记录首Token延迟、生成速度、显存峰值和失败轮次,而不只记录总耗时。
如果项目本身没有自动化测试,模型很容易陷入“代码看起来对,但根本跑不起来”的状态。对于Agent编程,测试脚本不是最后补的工程设施,而是模型的眼睛。
3090没有突然变成游戏工作室,但门槛确实降了
单张RTX 3090、一个4-bit量化的27B模型、两套Harness,再加约5小时运行时间,就能得到一款可玩的第一人称射击Demo。这件事最值得注意的地方,不是AI将取代游戏开发者,也不是一张旧显卡可以媲美顶级云端模型。
它真正释放的信号是:本地开源模型已经开始跨过“只能聊天和补全代码”的阶段,进入可以在工具环境中持续工作的阶段。
对于个人开发者,这意味着一台成本可控的工作站就能运行全天候编程Agent;对于企业,这意味着部分代码生成、数据处理和内部自动化任务可以留在内网;对于模型厂商,竞争也不再只是参数规模和榜单分数,而是谁能在有限显存里,以更低的量化损失完成更长的任务链。
当然,一个僵尸射击Demo距离可靠软件还有很远。真正困难的仍然是需求澄清、架构设计、测试覆盖、可维护性和安全边界。模型可以在5小时里堆出一个能玩的原型,却未必能在未来5个月里维护它。
但作为一次消费级硬件上的极限测试,它已经足够说明问题:本地Agent开发不再只是高端工作站玩家的实验。六年前发布的3090,如今仍能成为一名不算快、偶尔犯错,却可以不间断返工的AI程序员。
参考来源
- IT之家:网友测试Qwen3.8-27B模型极限——介绍单张超频RTX 3090运行量化模型,并在约5小时内生成僵尸射击游戏的社区实验。
- GitHub:Qwen3.8-27B on one RTX 3090——单张RTX 3090部署Qwen3.8-27B的开源配置、补丁验证及单用户与批处理运行说明。
- 知乎:Qwen3.8-27B本地运行与游戏生成案例——对Qwen3.8-27B本地部署和第一人称射击游戏实验的二次梳理。



