行业动态

端侧AI部署的控制权正在转向插件化运行时

核心观点 端侧 AI 软件栈正在从“谁有自己的 SDK”转向“谁能成为主流运行时的可插拔后端”。Qualcomm 把 QNN 做成 ONNX Runtime Plugin EP,Intel 让 OpenVINO 接入 llama.cpp,vLLM 和 SGLang 的近期补

◷ 2026-06-09 📁 行业动态 👤 laumy 🔥 0 热度 💬 0 评论

文章列表

MoE模型原理:让大模型按需激活专家

概述 大模型能力提升通常依赖两个方向:模型参数变多、训练数据变多。Dense模型的做法比较直接,每一层的参数都会参与每个token的计算,模型越大,单次前向计算也越重。这样虽然简单,

◷ 2026-06-09 📁 算法模型 👤 laumy 🔥 0 热度 💬 0 评论

ISP Pipeline 缩写词汇总

这篇文章把 ISP Pipeline 中常见缩写按数据流阶段串起来。看 ISP 文档时,不建议孤立记缩写,而是先判断它处在输入接收、RAW 前处理、HDR/3A、RGB/YUV 后处理、几何校正、输出,还是 AI/CV 支路。 完

◷ 2026-06-04 📁 外设 👤 laumy 🔥 0 热度 💬 0 评论

llama.cpp 模型加载机制深度解析

概述 llama.cpp 的模型加载系统是一个高度优化的、支持多后端、多设备的模型权重加载框架。它通过精心设计的数据结构和加载流程,实现了: 零拷贝加载:通过内存映射(mmap)实现模型文件的零拷贝加载

◷ 2026-02-12 📁 推理框架 👤 laumy 🔥 1317 热度 💬 0 评论

ggml后端架构简要分析

后端系统概述 GGML后端系统主要提供如下功能: 统一接口: 不同硬件平台使用相关的API。 自动选择:根据硬件自动选择最优后端。 灵活切换:可以在运行时切换后端。 扩展性:易于添加的新后端。

◷ 2026-01-29 📁 推理框架 👤 laumy 🔥 599 热度 💬 0 评论

jetson orin nano使用TensorRT-LLM跑大模型

准备 硬件信息 硬件信息如下: sudo cat /proc/device-tree/model NVIDIA Jetson Orin NX Enginejetson_releasee Developer Kit(base) nano@nano-desktop:~$ jetson_release Software part of jetson-stats …

◷ 2026-01-24 📁 Ai应用 👤 laumy 🔥 1468 热度 💬 0 评论

Jetson Orin Nano 使用 llama.cpp 跑大模型

安全说明:本文是本地 AI 推理开发笔记,只记录 Jetson Orin Nano 上的 CUDA 环境检查、llama.cpp 官方源码编译、开源 GGUF 模型测试和性能观察。页面不提供可执行安装包,不要求输入账号、密码、支付信息或任

◷ 2026-01-22 📁 Ai应用 👤 laumy 🔥 653 热度 💬 0 评论