Blog

科研博客

智能体与大模型正在把科学往前推。这里追踪那些前沿进展——新模型、新方法、新突破,以及它们对科研到底意味着什么、哪些是真的、哪些只是噪声。

如何用 Aeon 分析时间序列:DTW 分类、聚类与相似度计算

Aeon 提供了一套面向时间序列的 Python 工具,可以在保留观测顺序的前提下比较曲线、识别类别并探索分组。下面的例子从六条容易核对的短曲线出发:DTW 最近邻模型判断两条未参与训练的曲线是上升还是下降,时间序列 k 均值恢复两个趋势组,距离计算则解释相似曲线与相反曲线为何会被区别对待。两条留出曲线都得到正确分类;两条相似上升曲线的 DTW 距离是 0.06,上升曲线与下降曲线之间的距离是 70.0。这些结果适合验证分析流程是否真正工作,但六条刻意简化的曲线不能代表模型在真实传感器、临床或实验数据上的准确率。

MMindPlot 研究团队
· 2026-07-26
time-seriesmachine-learningPython

如何用 Dask DataFrame、Array、Delayed 与 Distributed 分析分区科学数据

可复现的 Dask 工作流能够惰性读取分区测量数据,执行筛选和分组汇总,写出分区 Parquet 数据集,变换分块数值数组,并求值具有明确依赖关系的任务图,而不必把所有中间数据同时塞入内存。经过验证的演示中,三个 CSV 分区共包含 12 行,value 总和为 306。按 value = 18 筛选后,control 的计数、和、均值分别为 4、96、24.0;treated 分别为 6、186、31.0。另一个 6 × 8 分块数组得到从 33.5 到 44.0 的八个列均值;六个延迟平方任务之和为 91。Dask 2026.3.0 在保留的第 5 次尝试中完成这些功能。由于聊天沙箱不允许

MMindPlot 研究团队
· 2026-07-27
DaskPythondata engineering

如何使用 Python、psutil 与可复现系统清单检测科学计算资源

开展科学计算之前,最重要但经常被忽略的一步,是先测量真正执行任务的机器,而不是根据设备型号、云主机名称或经验猜测可用资源。本次经过完整验证的实例检测到:Linux x8664 主机拥有 8 个物理 CPU 核心、16 个逻辑核心、31.06 GiB 总内存、16.06 GiB 当前可用内存、103.12 GiB 项目文件系统可用空间,并且没有检测到可用 GPU 加速器。原生检测器给出的并行上限建议为 14 个工作进程;结合内存和 I/O 风险,更稳妥的操作建议是从 8–12 个工作进程开始,再依据真实负载逐步扩展。

MMindPlot 研究团队
· 2026-07-26
scientific-computingPythonsystem-resources

如何使用 GNU Octave 求解并审计 MATLAB 兼容的线性代数流程

GNU Octave 将线性方程组求解为 x=[2,3],并独立核验该预期向量。5个信号观测的均值为6,样本标准差为6.59545297913646。流程保留了MATLAB兼容的MAT工作区以及栅格和矢量图。。该结果在保留的第11次尝试中通过原生执行、真实聊天端到端执行和语义产物验证,只能在本演示的数据、方法和限制范围内解释。

MMindPlot 研究团队
· 2026-07-27
MATLAB compatibleGNU Octavelinear algebra

如何使用 Matplotlib 创建可发表的多面板科学图

流程读取6条测量记录,使用Matplotlib面向对象接口创建两个坐标轴,并绘制折线、误差棒、散点、注释与图例。输出为1823×1223像素、200 dpi的PNG,以及保留可编辑文字的SVG。。该结果在保留的第9次尝试中通过原生执行、真实聊天端到端执行和语义产物验证,只能在本演示的数据、方法和限制范围内解释。

MMindPlot 研究团队
· 2026-07-27
Matplotlibscientific visualizationpublication figure