Saluki 27B – 轻量本地智能体大模型

Saluki 27B 由 Underdog AI 推出,是基于 Qwen3.8-27B 改造的 2-bit 混合精度量化模型,采用 GGUF 格式封装,模型文件体积压缩至 7.89GB,原版全精度权重需要 54GB 存储空间。模型面向本地智能体场景做专项调优,工具调用与并行多工具调度指标超过原版 Qwen3.8-27B,原生支持 262144 token 超长上下文,Apache 2.0 开源协议开放权重。普通 16GB 内存笔记本设备即可完成本地运行,依托 llama.cpp 生态直接加载,不需要定制编译环境,本地部署后数据不会上传外部服务器,适合离线智能体项目开发。

Saluki 27B - 轻量本地智能体大模型

Saluki 27B特点

模型压缩过程优先保障工具调用能力,在量化压缩后,函数调用、并行工具调度的指标得到提升。

硬件门槛大幅降低,消费级笔记本、中端台式机都可以承载,GPU 显存压力小。

原生大窗口上下文,一次性读取大量文档与代码文件,维持长任务内信息连贯。

标准 GGUF 文件,兼容主流本地推理框架,现有 llama.cpp 程序无需改动代码直接加载。

本地离线运行,所有推理流程在本机完成,敏感业务资料不会流出设备。

Saluki 27B技术原理

底层基座为 Qwen3.8-27B 稠密大模型,64 层网络融合 Gated DeltaNet 线性注意力与门控注意力机制。采用 GSQ 与 RCO 量化方案,针对每个张量分配独立量化参数,在固定存储预算内保留关键权重信息。Underdog 在原有量化成果基础上继续迭代,通过 imatrix 重要性矩阵识别模型关键参数,对工具调用相关权重保留更高精度,其余参数执行 2-bit 压缩。整套流程不改动基础模型网络结构,仅调整权重数值精度,配套微调优化工具调用输出格式。

Saluki 27B功能

工具调用编排,识别任务需求,选择对应函数,支持一次性发起多工具并行调用。

长文档读取,加载大量文本、代码材料,完成内容检索与信息提取。

代码读写与问题排查,读取仓库代码,定位简单 bug,生成补丁代码。

自然语言对话,接收文本指令,产出结构化输出内容。

本地 RAG 对接,搭配向量数据库,读取私有知识库完成问答。

Saluki 27B应用场景

本地 AI 智能体开发,搭建离线运行的自动化任务程序。

个人电脑端代码助手,在本地完成代码阅读、简单缺陷修复。

企业内网文档处理,私有化部署,处理内部资料,规避数据外传风险。

离线知识库问答,接入私有文档库,用于资料检索与内容汇总。

边缘设备端轻量 AI 服务,低内存硬件搭建本地推理接口。

Saluki 27B使用教程

1. 获取 Saluki 27B GGUF 权重文件,准备 llama.cpp 运行环境,核对设备内存资源。

2. 加载模型文件,配置上下文窗口参数,开启 GPU 层卸载降低内存占用。

3. 准备工具定义文件,写入可调用函数描述,启用工具调用解析模块。

4. 输入任务指令,模型识别需求,自动触发工具调用,收集工具返回结果继续推理。

5. 查看模型输出,校验工具调用逻辑,调整提示词优化任务执行效果。

6. 项目集成可接入 API 接口,嵌入自研应用,搭建完整本地智能体系统。

Saluki 27B同类产品对比

表格

项目Saluki 27BBonsai 2 27B
研发主体Underdog AI(Conway Research)PrismML
产品定位2-bit 量化 GGUF 本地 Agent 模型,基于 Qwen3.8-27B 优化,主打轻量化工具调用轻量化 Qwen3.8-27B 衍生量化模型,面向本地部署智能体场景
核心特色文件仅 7.89GB,Apache2.0 协议,llama.cpp 原生兼容,并行工具调用性能优于原版 Qwen3.8-27B200K 上下文窗口,显存占用控制优秀,兼顾长文本读取与基础工具调用能力
适用场景本地私有化 Agent 开发、函数调用、多工具串联任务,16G 显存设备本地推理长文档检索、本地知识库问答、需要超长上下文的本地智能体应用
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...