性能碾压Qwen3.5/Gemma4!Nanbeige4.2-3B在代码生成/数学推理上的7大突破

发布时间:2026/7/26 17:42:11
性能碾压Qwen3.5/Gemma4!Nanbeige4.2-3B在代码生成/数学推理上的7大突破 性能碾压Qwen3.5/Gemma4Nanbeige4.2-3B在代码生成/数学推理上的7大突破【免费下载链接】Nanbeige4.2-3B项目地址: https://ai.gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3BNanbeige4.2-3B是一款基于Nanbeige4.2-3B-Base构建的紧凑型智能模型它将强大的智能体行为与广泛的推理和对齐能力相结合。其循环Transformer架构通过重用Transformer层来增加模型容量而无需添加参数。仅凭借3B非嵌入参数该模型就在通用智能体和代码智能体任务上展现出了出色的性能。 7大核心突破解析1. 3B参数实现9B级智能体性能在复杂工具使用、办公智能体和代码智能体基准测试中Nanbeige4.2-3B超越了Qwen3.5-9B和Gemma4-12B等更大规模的模型。其GDPval评分达到74.3分远超Qwen3.5-9B的61.9分和Gemma4-12B的68.5分。2. 代码生成能力跃升在SWE-Bench Verified测试中Nanbeige4.2-3B以63.6%的通过率领先Qwen3.5-9B53.1%和Gemma4-12B44.2%。SWE-Bench Pro测试中同样以46.9%的成绩大幅领先竞品。3. 数学推理能力超群HMMT-Feb-2026数学测试中Nanbeige4.2-3B获得82.8分远超Qwen3.5-9B的69.6分和Gemma4-12B的51.5分。IMO-Answer-Bench测试中以67.3分领先Qwen3.5-9B的56.3分。4. 本地部署的个人助理仅3B非嵌入参数使其足够紧凑可在本地部署同时保留多步骤工作流所需的智能体能力。在Pinch-Bench-V274.7分和Claw-Gym65.0分等日常任务测试中均大幅领先Qwen3.5系列。5. 创新的循环Transformer架构通过Looped Transformer架构重用Transformer层在不增加参数的情况下提升模型容量。modeling_nanbeige.py中还包含最新的架构改进包括LoopSplit、带深度注意力的mHC和连接的n-gram嵌入。6. 超长上下文支持模型支持高达262,144个token256K的上下文长度为长文档处理和复杂任务提供充足空间。7. 多框架部署支持提供Huggingface、SGLang、vLLM、llama.cpp和ollama等多种部署方式满足不同场景需求。 快速开始使用要开始使用Nanbeige4.2-3B首先克隆仓库git clone https://gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3BHuggingface部署示例from transformers import AutoModelForCausalLM, AutoTokenizer model_id Nanbeige/Nanbeige4.2-3B tokenizer AutoTokenizer.from_pretrained( model_id, use_fastFalse, trust_remote_codeTrue ) model AutoModelForCausalLM.from_pretrained( model_id, torch_dtypeauto, device_mapauto, trust_remote_codeTrue ) messages [ {role: user, content: Which number is bigger, 9.11 or 9.8?} ] prompt tokenizer.apply_chat_template( messages, add_generation_promptTrue, tokenizeFalse ) input_ids tokenizer( prompt, add_special_tokensFalse, return_tensorspt ).input_ids output_ids model.generate( input_ids.to(cuda), max_new_tokens131072, temperature0.6, top_p0.95, top_k20, eos_token_id166101 ) response tokenizer.decode( output_ids[0][len(input_ids[0]):], skip_special_tokensTrue ) print(response)⚡ 性能优化建议根据目标场景调整推理设置场景温度最大新token数智能体和工具使用任务1.065,536推理和聊天任务0.6131,072技术报告提供了更详细的模型信息和评估结果Nanbeige42_report.pdf。Nanbeige4.2-3B证明了小型模型通过架构创新和优化训练流程可以在特定任务上超越更大规模的模型为本地部署和资源受限环境提供了强大的AI解决方案。【免费下载链接】Nanbeige4.2-3B项目地址: https://ai.gitcode.com/hf_mirrors/Nanbeige/Nanbeige4.2-3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考