AI深识站
  • AI软件
  • AI资讯
  • AI世界漫游指南
    • AI知识探索库
    • AI学习教程
  • AI最新项目
  • 排行榜
      • 未登录
        登录后即可体验更多功能
    • AI软件
    • AI资讯
    • AI世界漫游指南
      • AI知识探索库
      • AI学习教程
    • AI最新项目
    • 排行榜
    未登录
    登录后即可体验更多功能

    大模型

    共 164 篇文章
    排序
    发布更新浏览点赞
    Qwen-Audio-3.0-ASR-Flash – 阿里巴巴发布的专业级语音识别大模型

    Qwen-Audio-3.0-ASR-Flash – 阿里巴巴发布的专业级语音识别大模型

    Qwen-Audio-3.0-ASR-Flash是阿里巴巴发布的专业级语音识别大模型,显著提升行业术语识别准确率(医疗场景达95.36%),并具备上下文一致性优化与语音润色能力,可直接输出结构化文本...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0470
    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3 – MiniMax发布的开源通用全模态生成模型

    MiniMax H3是MiniMax发布的首款开源通用全模态生成模型,将视频生成从单一任务工具升级为商业级生产力工具。它不再区分图片、视频、音频的独立生成任务,而是通过统一理解多模态上下文直接输出连贯...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0950
    Grok Voice Think Fast 2.0 – xAI公司发布的新一代语音智能体模型

    Grok Voice Think Fast 2.0 – xAI公司发布的新一代语音智能体模型

    Grok Voice Think Fast 2.0是马斯克旗下xAI公司发布的新一代语音智能体模型,定位为端到端语音到语音(speech-to-speech)AI系统,无需依赖传统"语音识别-大模型推...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0480
    Lyria 3.5 – 谷歌DeepMind发布的最新AI音乐生成模型

    Lyria 3.5 – 谷歌DeepMind发布的最新AI音乐生成模型

    Lyria 3.5是谷歌DeepMind发布的最新AI音乐生成模型,作为Lyria系列的迭代版本,将AI从"一次性生成工具"升级为"可交互的创作伙伴"。支持对已生成歌曲的局部段落进行自然语言修改(如仅...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0490
    Instella-MoE – AMD推出的全开源混合专家语言模型(MoE)

    Instella-MoE – AMD推出的全开源混合专家语言模型(MoE)

    Instella-MoE是AMD推出的全开源混合专家语言模型(MoE),总参数量达160亿,但推理时仅激活28亿参数,通过专家稀疏激活机制实现高性能与低计算成本的平衡。完全基于AMD自研硬件与软件栈训...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0630
    Midjourney V8.2 – Midjourney发布的图像生成模型重大更新版本

    Midjourney V8.2 – Midjourney发布的图像生成模型重大更新版本

    Midjourney V8.2是Midjourney正式发布的图像生成模型重大更新版本,通过重构美学奖励模型与个性化系统,显著降低随机生成劣质图像的概率,并大幅提升对用户审美偏好的精准捕捉能力。相比此...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0670
    Anthropic Opus 5 – Anthropic公司发布的旗舰级AI模型

    Anthropic Opus 5 – Anthropic公司发布的旗舰级AI模型

    Anthropic Opus 5是Anthropic公司发布的高性价比旗舰级AI模型,定位为性能逼近顶级模型Fable 5但价格仅为其一半的日常任务首选方案。通过动态调节"思考档位"(effort)机...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0600
    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2 – 阿里巴巴开源的0.8B参数文档解析模型

    OvisOCR2是阿里巴巴开源的0.8B参数文档解析模型,首次以端到端架构超越传统流水线方法,在权威基准OmniDocBench v1.6上以96.58分登顶。该模型仅需单次推理即可将文档图像直接转化...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0990
    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge – 英伟达推出的40亿参数开源世界模型

    Cosmos 3 Edge是英伟达在SIGGRAPH 2026大会上发布的40亿参数开源世界模型,专为边缘设备实时物理AI推理设计。通过双塔架构实现本地化物理世界理解与动作生成,可在Jetson Th...
    AI最新项目# 大模型
    文明旁观者的头像4周前
    0810
    BigMac – 小红书开源的多模态大语言模型训练框架

    BigMac – 小红书开源的多模态大语言模型训练框架

    BigMac是小红书dots infra团队开源的多模态大语言模型训练框架,通过"准依赖安全嵌套流水线"设计,首次实现显存占用与训练速度的同步优化。传统方案中,多模态训练必须在"算力优先"(速度高但显...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0650
    Ling 3.0 Flash – 蚂蚁百灵团队最新发布的高效推理大模型

    Ling 3.0 Flash – 蚂蚁百灵团队最新发布的高效推理大模型

    Ling 3.0 Flash是蚂蚁集团百灵团队最新发布的高效推理大模型,总参数量124B,激活参数仅5.1B,在保持高智能水平的同时显著优化Token消耗与推理速度。以1/10的Token消耗实现Ag...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01450
    FLUX 3 – Black Forest Labs发布的多模态基础模型

    FLUX 3 – Black Forest Labs发布的多模态基础模型

    FLUX 3是德国人工智能公司Black Forest Labs发布的全球首个在统一架构下联合训练图像、视频、音频及机器人动作预测的多模态基础模型。通过Self-Flow技术将物理世界的因果逻辑融入生...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01250
    MAI-Voice-2-Flash – 微软推出的超低延迟文本转语音模型

    MAI-Voice-2-Flash – 微软推出的超低延迟文本转语音模型

    MAI-Voice-2-Flash是微软推出的超低延迟文本转语音(TTS)模型,专为高并发实时交互场景设计。以32%的成本降幅实现2倍速度提升(每百万字符15美元),同时保持自然语调与高语音质量,并将...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0670
    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro – 一款微软自研的图像生成模型

    MAI-Image-2.5-Pro一款自研AI模型系列中精度最高的图像生成模型,专为企业级高质量图像创作与编辑场景设计。该模型完全基于微软自有清理数据训练,不依赖第三方模型蒸馏,在文字渲染准确性、身份...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0770
    Mage-Flow – 微软推出的专注于图像生成与编辑的模型

    Mage-Flow – 微软推出的专注于图像生成与编辑的模型

    Mage-Flow是微软推出的Mage多模态模型家族中专注于图像生成与编辑的模型。它是一款高效的、原生分辨率的基础模型,专为文本生成图像和指令驱动的图像编辑任务而设计。 Mage-Flow核心特点 轻...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0800
    Fugu Cyber – Sakana AI发布的网络安全专用多智能体编排模型

    Fugu Cyber – Sakana AI发布的网络安全专用多智能体编排模型

    Fugu Cyber是日本AI公司Sakana AI发布的网络安全专用多智能体编排模型,通过动态调度多个专家模型协同工作,在网络安全领域关键基准测试中超越GPT-5.5-Cyber等通用旗舰模型。它并...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0570
    Gemini 3.5 Flash-Lite – 谷歌发布的专为高频任务设计的轻量级AI模型

    Gemini 3.5 Flash-Lite – 谷歌发布的专为高频任务设计的轻量级AI模型

    Gemini 3.5 Flash-Lite是谷歌发布的专为高频任务设计的轻量级AI模型,以极低成本实现超高吞吐量执行,尤其适合智能体(Agent)工作流中的子任务处理。其最大特点是输出速度达350 t...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0840
    Gemini 3.5 Flash Cyber – 专为网络安全场景微调的轻量级AI模型

    Gemini 3.5 Flash Cyber – 专为网络安全场景微调的轻量级AI模型

    Gemini 3.5 Flash Cyber是谷歌发布的专为网络安全场景微调的轻量级AI模型,以更低成本高效发现并修复软件安全漏洞。该模型并非独立开放服务,而是深度集成于谷歌的代码安全智能体平台Cod...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0870
    Gemini 3.6 Flash – 谷歌DeepMind发布的效率型大语言模型

    Gemini 3.6 Flash – 谷歌DeepMind发布的效率型大语言模型

    Gemini 3.6 Flash是谷歌DeepMind发布的效率型大语言模型,定位为代码、知识工作与多模态任务的高性价比解决方案。以更低成本实现更强能力:输出Token价格从3.5 Flash的9美元...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01040
    GenCeption – 谷歌DeepMind发布的通用视觉模型

    GenCeption – 谷歌DeepMind发布的通用视觉模型

    GenCeption是谷歌DeepMind发布的通用视觉模型,通过逆向改造视频生成模型,实现单模型统一完成深度估计、图像分割、3D姿态估计等五类核心视觉任务。仅用7500段合成视频训练,即可通过文本指...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01050
    Audio-Visual Flamingo – NVIDIA等推出的全开源音视频大语言模型

    Audio-Visual Flamingo – NVIDIA等推出的全开源音视频大语言模型

    Audio-Visual Flamingo(简称 AVF)是 NVIDIA Nemotron Labs 联合马里兰大学推出的全开源音视频大语言模型(AV-LLM),专门实现音频、图像、长视频的联合感知...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01190
    Matrix -Game3.5 – Skywork团队发布的开源多模态世界模型

    Matrix -Game3.5 – Skywork团队发布的开源多模态世界模型

    Matrix-Game 3.5是昆仑万维旗下Skywork团队发布的开源多模态世界模型,实现Patch级空间记忆机制与单卡实时交互能力,使AI能生成具有物理因果一致性的可交互虚拟世界。它标志着世界模型...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01520
    MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

    MiniCPM-RobotTrack – 视觉-语言-动作(VLA)跟踪导航模型

    MiniCPM-RobotTrack是面壁智能发布的具身智能系列模型中的轻量级端到端视觉-语言-动作(VLA)跟踪导航模型,专为机器人目标跟踪与自主导航设计。实现无网环境下的纯本地化实时跟踪能力,仅需...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01010
    MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

    MiniCPM-RobotManip – 开源通用视觉-语言-动作(VLA)模型

    MiniCPM-RobotManip是面壁智能发布的开源通用视觉-语言-动作(VLA)模型,参数规模仅1.5B,但通过视觉Token极致压缩和流式上下文管理技术,实现了机器人领域关键的长时记忆能力突破...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0800
    Qwen-Audio-3.0-TTS – 阿里通义发布的新一代实时语音合成大模型

    Qwen-Audio-3.0-TTS – 阿里通义发布的新一代实时语音合成大模型

    Qwen-Audio-3.0-TTS是阿里巴巴通义实验室发布的新一代实时语音合成大模型,包含面向实时交互的Flash版本(首包延迟约300毫秒)和面向高质量生成的Plus版本。该模型在全球第三方权威榜...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01140
    MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

    MiniCPM-Robot – 面壁智能发布的开源具身智能系列模型

    MiniCPM-Robot是面壁智能发布的开源具身智能系列模型,包含视觉-语言-动作模型(MiniCPM-RobotManip)和跟踪导航模型(MiniCPM-RobotTrack)两款核心产品。该系...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0930
    神珍 – 上海科学智能研究院发布的科学多模态基础模型

    神珍 – 上海科学智能研究院发布的科学多模态基础模型

    “神珍”(Monkey King Bang, MKB)是上海科学智能研究院发布的科学多模态基础模型,总参数量约110亿,专为统一处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据而设计...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0780
    MiniCPM5-2B – 面壁智能发布的20亿参数规模端侧大语言模型

    MiniCPM5-2B – 面壁智能发布的20亿参数规模端侧大语言模型

    MiniCPM5-2B是面壁智能联合OpenBMB发布的20亿参数规模端侧大语言模型,在Artificial Analysis(AA)权威榜单中以17分成绩登顶全球4B以下模型榜首,成为当前同级参数规...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0830
    Tempolor v4.7 – 趣丸科技发布的天谱乐大模型最新版本

    Tempolor v4.7 – 趣丸科技发布的天谱乐大模型最新版本

    Tempolor v4.7是趣丸科技在世界人工智能大会(WAIC)发布的天谱乐大模型最新版本,将AI音乐创作从“单次生成结果”升级为支持深度二次创作的工具。该版本不再仅追求“能否生成一首歌”,而是聚焦...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    0710
    HappyOyster 1.0 – 阿里发布的可实时交互的开放式世界模型

    HappyOyster 1.0 – 阿里发布的可实时交互的开放式世界模型

    HappyOyster 1.0(快乐生蚝1.0)是阿里巴巴ATH创新事业部发布的可实时交互的开放式世界模型产品,将AI从“生成静态内容”升级为“模拟可操控的动态数字世界”。用户仅需一句话或一张图即可生...
    AI最新项目# 大模型
    文明旁观者的头像1个月前
    01050
    加载更多
    AI深识站
    AI深识站——国内外优质AI工具导航平台,收录AI写作、绘画、办公、音视频等热门工具,配套AI资讯与教程,每日更新,助你高效工作、玩转AI生活!用AI,学AI,从这里开始。Ctrl + D 或 ⌘ + D 添加书签,随时探索AI新世界。

    关于我们广告合作免责声明

    Copyright © 2026 AI深识站 赣ICP备2026009722号-1 
    网址
    网址文章软件
    热门搜索
    元宝豆包DeepSeek千问翻译