Salesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学...
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreWebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天...
Read MoreGitHub 近期分享了一个反直觉的发现:在 AI 编码代理中,单纯缩短单个工具输出未必能降低成本,反而可能推高总开销。原因在于,当输出缺乏必要上下文时,模型会被迫重新打开文件、重新运行命令或增加额外对话轮次,...
Read MoreFnScribe 是一款面向 macOS 的私有化语音听写工具,核心特点是语音转写在本地完成,不需要将录音上传至云端,从而降低敏感语音数据外泄风险。用户可以通过快捷键在任意活跃应用中启动听写,并支持免提操作,适合写作...
Read More随着AI编程代理、自动化迁移等工具越来越多地直接操作业务数据库,现有版本控制往往只能审计迁移脚本本身,难以回答“某一行数据究竟被改成了什么”。diffium-db 是一款终端界面(TUI)工具,用户只需将其指向目标数据...
Read Morevgpu 是 Vercel Labs 推出的一个 TypeScript 库,专为 WebGPU 设计,旨在以模块化方式统一着色器、3D 场景、GPU 张量、神经网络和数学可视化等计算与渲染任务。该库提供类型化着色器导入能力,并采用紧凑的 GPU 优先...
Read MoreTurboKV 是一个基于 Rust 语言实现的异步嵌入式键值数据库项目,源代码已在 GitHub 公开。该数据库的设计目标是在保持简单集成与轻量部署的同时,提供高性能的本地键值存取能力。TurboKV 支持原子操作,有助于保证并...
Read More