Qwen3.6-27B的震撼|RTX 4090运行Claude级AI
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"想用Claude Opus,但月费太贵"、"把公司代码交给ChatGPT总觉得不安"——这些烦恼,一款免费AI就能一扫而空。
2026年4月22日发布的阿里巴巴《Qwen3.6-27B》,能在家用游戏PC上运行,却在部分基准测试中与Claude Opus 4.5并驾齐驱,堪称令人震惊的开源AI。
本文将用通俗易懂的方式,为您详解它究竟强在哪里。
首先确认一个基本问题:Qwen3.6-27B是谁做的AI?
阿里巴巴(中国版"亚马逊"式存在)旗下的Qwen团队于2026年4月22日,在Hugging Face和ModelScope上发布了最新AI《Qwen3.6-27B》。采用Apache 2.0许可证——"商业使用OK、二次修改OK、任何人都可自由使用"的宽松条款。
这就好比一家咖啡店不仅免费公开配方,还声明"随意改编也没问题",冲击力之大令全球工程师当天就开始纷纷下载。
参数量为270亿(27B)。而阿里巴巴在上一版《Qwen3.5》中曾发布3970亿(397B)参数的MoE巨型模型。
这次27B版本上演了"微型轿车跑赢重型卡车"这种不可思议的结果。小而强的原因在于后文提及的全新架构,业界将此称为"AI不再由体量决定胜负"的历史性时刻。
衡量性能的最重要指标是基准测试(AI之间的统一考试)。Qwen3.6-27B在编程领域打出了令人震惊的分数。
SWE-bench Verified是衡量"AI能否修复真实GitHub Issue"的测试,Qwen3.6-27B录得77.2%。
距Claude Opus 4.6的80.8%仅差3.6个百分点。
Terminal-Bench 2.0(终端操作熟练度)达59.3%,与Claude Opus 4.5完全持平。
"一款与世界顶级付费AI旗鼓相当的免费AI出现了"——这一事实在业界引发了强烈震动。
全新功能《Thinking Preservation(思维保留)》也是重要的差异化亮点。
传统AI在对话变长时,会出现"忘掉之前的思考、重新从头推理"的浪费情况。
Qwen3.6-27B将推理过程保存至对话历史,下一轮可直接复用。
就像"每次做菜都要重新备料,现在能放冰箱里反复使用"一样。Agent(自动执行任务的AI)的精度因此大幅提升。
"为何体量小却实力强"的答案,在于混合注意力(Hybrid Attention)这一全新设计。
Qwen3.6-27B由共64层Transformer构成,采用"3次Gated DeltaNet(线性注意力)+1次标准注意力"为一组共4层、循环16次的结构。
就像"3名快速兼职员工加上1名资深正式员工监督"的模式。速度快却不失智慧——在大幅削减计算量的同时维持精度,达到了绝妙的平衡。
单次对话能塞入的信息量上限即上下文窗口。Qwen3.6-27B原生支持262,144 token,借助YaRN技术可扩展至约1,010,000 token。
相当于"把10本文库本一起喂给它,让它总结"的量级。将整个庞大Git仓库全部喂给AI进行重构——过去只是梦想,如今已成现实。
开源AI最重要的问题是"能不能在自己的PC上跑"。Qwen3.6-27B同样带来了震撼答案。
完整BF16权重为55.6GB,体量较大,但通过Q4_K_M量化(在保持质量的同时压缩体积的方法)可缩减至约16.8GB。
一张RTX 4090(配备24GB显存的消费级旗舰GPU,2026年现价约30万日元)即可流畅运行。
Q5约19.5GB,Q6约22.5GB,家用游戏PC可直接复用。
"去年还需要数百万日元专业服务器的AI,如今每月电费3,000日元就能运行"的时代已然到来。
面向企业端,阿里巴巴同步发布了Qwen/Qwen3.6-27B-FP8版本,采用块大小128的细粒度量化,支持SGLang(0.5.10及以上)、vLLM(0.19.0及以上)、KTransformers、Hugging Face Transformers等主流推理运行时。
"小团队用RTX 4090,大企业用H100/H200大规模并行"——按规模灵活选用的设计广受好评。
以下对比2026年4月时点的主要AI。
值得关注的是"性价比"。
过去每月需支付数十万日元Claude费用的开发现场,换用Qwen3.6-27B只需一次性GPU投入。
有报告称Qwen 3.6 Plus预览版的输出速度是Claude Opus 4.6的2~3倍,在编程用途上已成为充分的替代候选。
对日本工程师、初创企业和中小企业而言,Qwen3.6-27B有望成为游戏规则改变者。
日本企业,尤其是金融、医疗、制造业,普遍存在"公司代码不得外传给外部AI"的规定。
实际上,许多工作场景无法使用Claude或ChatGPT。
Qwen3.6-27B在自有服务器内完整运行,因此"把机密代码喂给家里的RTX 4090,获取重构建议"既合规又安全,完全可行。
"此前在AI应用上落后的行业,一举追赶的基础设施"已然就绪。
Qwen系列历来以出色的日语性能著称。Qwen3.6-27B同样充分支持日语提示、日语输出及日语代码注释。
"不必等待国产LLM,中国出品的高质量模型已可免费使用"——在此背景下,本地LLM市场(自主托管型语言模型市场)的格局正在迅速改写。对AI初创企业而言,API使用费大幅下降带来的红利不可估量。
从事Web应用外包开发、月收入80万日元的田村。
此前每月为Claude Pro和GitHub Copilot支付1.5万日元。
改为在家用RTX 4090上运行Qwen3.6-27B,接入Cline(VS Code用AI Agent)后完成迁移。
"3个月节省18万日元,而且在无网络的新干线上也能用",大感满意。能在本地处理客户机密代码,安全感十足,这成了最终拍板的理由。
任职于员工50人机械零件制造商信息系统部门的高桥。
在社长严令"客户数据不得交给外部AI"的情况下,将Qwen3.6-27B部署至公司内部服务器。自主开发了从发票OCR→核心系统自动录入→每周报告自动生成的完整Agent流程。
"原本需要3人处理的每月2,000张凭证,现在1人就能完成"——他将这一成果汇报给社长,荣升公司首位"AI负责役员(CAIO)"。
材料工学专业的木村教授。
一直为"把未发表的实验数据输入ChatGPT进行分析是否违反研究伦理"而苦恼。在研究室工作站部署Qwen3.6-27B后,实验数据的模式分析、英文论文草稿撰写、审稿意见回复草案全部实现内部化。
"国际论文投稿数从每年3篇增至8篇",在学术圈引发热议。
这是"免费AI改变基础研究生产力"的标志性案例。
A. 模型本身基于Apache 2.0完全免费。
初期投入为RTX 4090(约30万日元)或二手RTX 3090(约10万日元)。
即便24小时运行,每月电费约3,000~5,000日元。
"比每月付3万日元用Claude Opus,半年内即可回本"——无论个人还是企业,投资回收速度都很快。若用二手3090,约3个月即可回本。
A. 由于是开源模型,第三方可验证权重;Apache 2.0许可证允许"任意使用",因此模型在技术上不可能将数据发送至外部(本地运行情况下)。
"虽是中国企业开发,但运行只在您的PC内"——就是这个逻辑。政府机关等可能需要专项审查,但在民间使用上,已在全球普遍推广。
A. 仅用CPU+64GB以上DDR5内存,可运行Q4量化版,但响应速度约为1 token/秒,实用性较低。Mac上使用Apple Silicon(M3 Max及以后,推荐64GB统一内存)可勉强运行。
"要流畅使用,2026年4月时点的现实方案是NVIDIA GPU 24GB以上"。注意:CUDA 13.2存在导致乱码的Bug,请使用CUDA 13.1或12.x系列。
A. Apache 2.0是"保留版权声明和免责声明即可几乎任意使用"的宽松许可证。
集成至自有服务并对外销售、提供SaaS服务、内部业务使用,均可。
再发行时需保留原始许可证声明,但对于输出结果可主张自由权利,这是其特点。
"将AI生成的代码作为自家产品销售,没有任何问题"。
A. 目前Qwen 3.6 Plus Preview(支持1M上下文)已在OpenRouter上抢先发布,通常版也很可能推出旗舰级的不同尺寸版本。Qwen团队自2025年起持续"每季度大型更新",预计2026年Q3将有下一代登场。
"购入的GPU一年内就过时"的担忧确实存在,但考虑AI进化速度,这已是标准风险。
"AI越大越强"——这个延续到2024年的常识,已被Qwen3.6-27B彻底成为历史。在家用游戏PC上免费运行与世界顶级商业AI肩并肩的模型的时代,已然到来——是袖手旁观,还是立即行动将其化为自己的武器,一年后作为工程师的价值将大相径庭。
"将免费最强AI收为己用者赢"的2026年下半年已经到来,不如先从30分钟的下载开始?
本文为来自 AI Friends 的交叉发布内容。