BU-30B-A3B-Preview模型深度解析:300亿参数背后的视觉-语言混合专家架构
【免费下载链接】bu-30b-a3b-preview项目地址: https://ai.gitcode.com/hf_mirrors/browser-use/bu-30b-a3b-preview
BU-30B-A3B-Preview是一款突破性的视觉-语言混合专家模型,基于Qwen3-VL-30B-A3B-Instruct架构构建,拥有300亿总参数和30亿活跃参数的混合专家(MoE)设计。这款模型专为浏览器使用场景优化,能在单GPU上高效运行,同时提供卓越的DOM理解和视觉推理能力。
模型核心架构解析
混合专家(MoE)设计:效率与性能的完美平衡
BU-30B-A3B-Preview采用了创新的混合专家架构,这是其能在保持高性能的同时大幅降低计算资源需求的关键。模型包含128个专家(num_experts: 128),但每个token仅由其中8个专家处理(num_experts_per_tok: 8)。这种设计使模型在拥有300亿总参数的同时,实际活跃参数仅为30亿,大幅降低了推理时的计算负载。
视觉-语言双模态融合
模型的视觉和语言处理模块通过精心设计的接口实现无缝协作:
视觉编码器:采用27层深度网络(
depth: 27),输入图像通过16x16的补丁大小(patch_size: 16)转换为1152维特征(hidden_size: 1152),最终投影到2048维与语言模型对齐(out_hidden_size: 2048)语言模型:包含48层Transformer(
num_hidden_layers: 48),32个注意力头(num_attention_heads: 32),隐藏层维度2048(hidden_size: 2048),支持长达32768 tokens的上下文(max_model_len: 32768)特殊标记系统:通过
<|vision_start|>(151652)和<|vision_end|>(151653)等特殊标记实现视觉内容与文本的精准对齐,同时支持视频输入(<|video_pad|>151656)和对象引用(<|object_ref_start|>/<|object_ref_end|>)等高级功能
快速上手指南
通过BU Cloud使用(推荐新手)
- 从BU Cloud获取API密钥
- 设置环境变量:
export BROWSER_USE_API_KEY="your-key" - 安装browser-use库并运行:
from dotenv import load_dotenv from browser_use import Agent, ChatBrowserUse load_dotenv() llm = ChatBrowserUse( model='browser-use/bu-30b-a3b-preview', # BU开源模型 ) agent = Agent( task='比较browser-use和stagehand的星标数量并告诉我哪个更多', llm=llm, flash_mode=True ) agent.run_sync()本地部署(vLLM方式)
对于有一定技术背景的用户,推荐使用vLLM进行本地部署:
- 安装vLLM(确保版本≥0.12.0):
pip install vllm --upgrade- 启动服务:
vllm serve browser-use/bu-30b-a3b-preview \ --max-model-len 32768 \ --host 0.0.0.0 \ --port 8000- 通过OpenAI兼容接口使用:
from browser_use import Agent, ChatOpenAI llm = ChatOpenAI( base_url='http://localhost:8000/v1', model='browser-use/bu-30b-a3b-preview', temperature=0.6, top_p=0.95, dont_force_structured_output=True, # 禁用结构化输出以提高速度 ) agent = Agent( task='比较browser-use和stagehand的星标数量并告诉我哪个更多', llm=llm, ) agent.run_sync()模型技术规格详解
| 属性 | 数值 |
|---|---|
| 基础模型 | Qwen/Qwen3-VL-30B-A3B-Instruct |
| 总参数 | 300亿 |
| 活跃参数 | 30亿(MoE架构) |
| 上下文长度 | 32,768 tokens |
| 架构类型 | 视觉-语言混合专家模型 |
| 视觉输入 | 图像、视频 |
| ** dtype** | bfloat16 |
| 分词器词汇量 | 151,936 |
浏览器使用场景优势
BU-30B-A3B-Preview针对浏览器使用场景进行了深度优化,主要优势包括:
卓越的DOM理解能力
模型能精准解析网页结构,理解HTML元素之间的关系和布局,这得益于其特殊设计的对象引用标记(<|object_ref_start|>/<|object_ref_end|>)和框选标记(<|box_start|>/<|box_end|>)。
强大的视觉推理能力
通过视觉编码器的深度栈(27层)和空间合并技术(spatial_merge_size: 2),模型能处理复杂的视觉场景,识别网页中的图像内容并将其与文本信息关联。
高效的工具调用能力
模型内置工具调用机制(<tool_call>/</tool_call>和<tool_response>/</tool_response>),能无缝集成浏览器操作,实现自动化网页交互。
总结
BU-30B-A3B-Preview代表了浏览器AI助手的新一代技术方向,通过混合专家架构在性能和效率之间取得了完美平衡。300亿参数的模型能在单GPU上流畅运行,同时提供SoTA级别的DOM理解和视觉推理能力,为浏览器自动化和智能助手应用开辟了新的可能性。
无论是通过BU Cloud快速体验,还是使用vLLM进行本地部署,这款模型都能为开发者和普通用户提供强大而灵活的浏览器AI能力。随着浏览器使用场景的不断扩展,BU-30B-A3B-Preview无疑将成为构建下一代智能网页应用的关键基础设施。
【免费下载链接】bu-30b-a3b-preview项目地址: https://ai.gitcode.com/hf_mirrors/browser-use/bu-30b-a3b-preview
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考