Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化检查点,用 from_pretrained 传入 gguf_file 即可在本地生成,无需额外配置。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化检查点,用 from_pretrained 传入 gguf_file 即可在本地生成,无需额外配置。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、A/G 比值和 V/S 比值的深度学习框架,用于预测胰岛素抵抗。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次把该能力带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核知识迁移到 Apple Silicon。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已随 Pixel 9 和 10 系列推出。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后的几秒内拍摄视频,通过深度学习在后台估算心率和静息心率。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。